Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
C-Eval
anchor
Findings
IC-388
CS-Bench scores correlate strongly (p > 0.9) with math and code benchmark scores across 12 models
[eval]