Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
GPQA
anchor
Findings
IC-388
CS-Bench scores correlate strongly (p > 0.9) with math and code benchmark scores across 12 models
[eval]