Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
T-Eval
anchor
Findings
IC-074
Released LLMs achieve F1 plan scores between 42.7 and 86.7 on the T-Eval plan task
[context]
IC-074
Released LLMs achieve F1 plan scores between 42.7 and 86.7 on the T-Eval plan task
[eval]
IC-549
All 18 evaluated LLMs show a 15-20% performance gap between linear (node chain) and graph (workflow) planning on WorfBench
[compared-to]