Modelpedia
Work in progress
About
Findings
Models
Concepts
Methods
Datasets
Sources
Light
Dark
Datasets
ImageNet-1k / ImageNet / ImageNet-1k-val / ImageNet-Val
77 findings
MMLU / MMLU-Math
43 findings
GSM8K
42 findings
MS COCO / COCO / COCO 2014 / COCO 2017 / COCO 20k / COCO-it / COCO-wl
41 findings
CIFAR-10
23 findings
SST-2
20 findings
TriviaQA
20 findings
HellaSwag
18 findings
TruthfulQA / TruthfulQA MC1
18 findings
AdvBench / AdvBench-50
17 findings
CIFAR-100
17 findings
Natural Questions / NaturalQA
17 findings
HarmBench / HarmBench Prompt / HarmBench Response / HarmBench-adv
16 findings
The Pile
15 findings
CounterFact / Counterfact dataset
13 findings
AG-News
12 findings
HotpotQA
12 findings
Winogrande
12 findings
ARC
11 findings
MaliciousInstruct / i-maliciousinstructions
11 findings
StrategyQA
11 findings
IOI dataset / IOI task
10 findings
Wikidata / WikidataRecent
10 findings
Winobias
10 findings
Financial Phrasebank
9 findings
MT-Bench
9 findings
Bias in Bios
8 findings
CUB-200-2011 / CUB200
8 findings
HumanEval
8 findings
IFEval / IFEval-Simple
8 findings
ImageNet-R / ImageNet-Rendition
8 findings
JailbreakBench
8 findings
PIQA
8 findings
RTE
8 findings
SciQ / SciQA
8 findings
Waterbirds
8 findings
ZSRE
8 findings
ARC-Challenge
7 findings
Anthropic-HH / Anthropic HHH / Anthropic/HH-RLHF
7 findings
CommonsenseQA
7 findings
EuroSAT
7 findings
IMDB
7 findings
LMSYS-Chat-1M
7 findings
MATH
7 findings
MBPP
7 findings
PopQA
7 findings
SQuAD
7 findings
WikiText
7 findings
XSum
7 findings
AlpacaEval
6 findings
BLIMP
6 findings
CelebA
6 findings
MMBench
6 findings
OpenWebText / OpenWebText-10k
6 findings
ParaRel
6 findings
Places365
6 findings
RealToxicityPrompts
6 findings
SorryBench
6 findings
Wikipedia
6 findings
WildChat
6 findings
AudioSet
5 findings
Big-Bench Hard
5 findings
C4
5 findings
DTD
5 findings
Flowers-102
5 findings
Food-101
5 findings
FreshQA
5 findings
HH-RLHF / HH-RLHF-RedTeam
5 findings
ImageNet-Sketch
5 findings
MM-VET
5 findings
MME
5 findings
MMMU
5 findings
MMVP
5 findings
MathVista
5 findings
MultiTP
5 findings
NSD
5 findings
PubMed
5 findings
SVAMP
5 findings
TREC
5 findings
TerraMesh
5 findings
VQAv2
5 findings
Wikitext-103
5 findings
WildBench
5 findings
APPS
4 findings
BOLD Moments Dataset
4 findings
CIRCO
4 findings
CNN/DailyMail
4 findings
CREPE
4 findings
CS-Bench
4 findings
Caltech-101
4 findings
DollarStreet
4 findings
Episodic Memory Benchmark / Episodic Memory Benchmark (short book)
4 findings
GEODE
4 findings
GQA
4 findings
Kinetics-400
4 findings
MMC
4 findings
MMLU Pro
4 findings
MMT-Bench
4 findings
MNIST
4 findings
MRPC
4 findings
MuSiQue / Musique-ans
4 findings
OpenBookQA
4 findings
Oxford Pets
4 findings
PlanBench
4 findings
RedditQA
4 findings
SAD
4 findings
SOTOPIA
4 findings
Seed-Bench / SeedBench
4 findings
Stanford Cars
4 findings
USE-5
4 findings
Vibe-Eval
4 findings
WikiQA
4 findings
WikiText-2
4 findings
Winogender
4 findings
A-OKVQA
3 findings
BENCHFORM
3 findings
CC12M
3 findings
CVRR-ES
3 findings
CaseLawQA
3 findings
Chatbot Arena
3 findings
Choices13k
3 findings
Cityscapes
3 findings
ClashEval
3 findings
CodeContests
3 findings
DROP
3 findings
Dolly (AC)
3 findings
Dolma
3 findings
DomainNet
3 findings
DynaMath
3 findings
ELI5
3 findings
FFHQ
3 findings
FGVC Aircraft
3 findings
Fictional Knowledge Dataset / Perez et al. (2022b) self-knowledge dataset
3 findings
GLUE-X
3 findings
Game of 24 (4nums.com instances 1-1000)
3 findings
HEX-Phi
3 findings
I2P
3 findings
ITC'99
3 findings
ImageNet-21k / ImageNet-22k
3 findings
ImageNet-A
3 findings
ImageNet-C
3 findings
ImageNet-Segmentation
3 findings
ImageNet-V2
3 findings
ImageNetette
3 findings
InsightBench
3 findings
LIMA
3 findings
LibriSpeech
3 findings
MM-SafetyBench
3 findings
MR
3 findings
MiniScan
3 findings
NLST (National Lung Screening Trial)
3 findings
Needle-in-a-haystack
3 findings
OBQA
3 findings
OGBN-ARXIV
3 findings
ORION
3 findings
OpenImages-O / OpenImage-O
3 findings
PVQ-RR
3 findings
ProteinGym
3 findings
QAMPARI
3 findings
RACE
3 findings
RedPajama
3 findings
RefCOCO+
3 findings
RewardBench
3 findings
SAMSum
3 findings
SST-5
3 findings
SUN397
3 findings
Safety Assessment of Chinese Large Language Models
3 findings
Self-Instruct
3 findings
Stanford Online Products
3 findings
Subjective
3 findings
TabMWP
3 findings
Textures
3 findings
Tokyo24/7
3 findings
UCF101
3 findings
VALSE
3 findings
VGGSound
3 findings
XNLI
3 findings
XSTest
3 findings
enwik9
3 findings
iNaturalist
3 findings
A Grammar of Kalamang
2 findings
ACRE
2 findings
AIDS
2 findings
ALFWorld
2 findings
AQUA / AQUA-RAT
2 findings
ARC Easy
2 findings
ASQA
2 findings
Analytic Entailment
2 findings
Apo/Holo Pairs
2 findings
Arena-Hard-Auto
2 findings
Auto-Bench
2 findings
BOLD
2 findings
BeaverTails / BeaverTails Test
2 findings
Big-Bench / Big-Bench verb tense
2 findings
BioASQ
2 findings
BookCorpus
2 findings
BookMIA
2 findings
BoolQ
2 findings
COCO-20i
2 findings
Caltech-256
2 findings
CommonGen
2 findings
ConceptNet
2 findings
Conceptual 3M / CC3M
2 findings
Copernicus Data Space Ecosystem
2 findings
Cora
2 findings
DAN
2 findings
DBpedia
2 findings
DECAF
2 findings
DIV2K-SE
2 findings
Databricks Dolly
2 findings
DrawBench
2 findings
E.T.Bench
2 findings
FMOW
2 findings
FSS-1000
2 findings
FairMT-10K
2 findings
FineWeb
2 findings
Flickr30k
2 findings
Fold-Switching (Chakravarty & Porter 2022)
2 findings
GAIA
2 findings
GLUE
2 findings
GQA Balanced
2 findings
GRUE
2 findings
JBB-Behaviors
2 findings
JEC-QA
2 findings
LAION-400M
2 findings
LOTSA
2 findings
LUNA25
2 findings
LogiQA
2 findings
LongBench
2 findings
MQP
2 findings
MSR-VTT
2 findings
MT-Bench-101
2 findings
MUTAG
2 findings
MUTUAL
2 findings
Major TOM Core-S2L2A
2 findings
MedVL-CT69K
2 findings
MiniARC
2 findings
MuJoCo Humanoid-v4
2 findings
NINCO
2 findings
NL-Eye
2 findings
NYU-v2 / NYU-D
2 findings
NarrativeQA
2 findings
NewsQA
2 findings
NoCaps
2 findings
Nordland
2 findings
ObjectNet
2 findings
OfficeHome
2 findings
OpenAI Moderation
2 findings
PG19
2 findings
Penn Treebank / Penn Treebank 3
2 findings
PicoRV32
2 findings
Pitts30k
2 findings
Professions (Bolukbasi et al.)
2 findings
PubMedQA
2 findings
QASC
2 findings
QNLI
2 findings
ROxford
2 findings
RefCOCOg
2 findings
Relations Dataset
2 findings
Rotten Tomatoes
2 findings
SSB-hard
2 findings
SVHN
2 findings
SafeRLHF Test
2 findings
SafetyQA
2 findings
Scrolls
2 findings
SearchQA
2 findings
SimpleSafetyTests
2 findings
Something-Something V2
2 findings
StackExchange
2 findings
StereoSet
2 findings
SugarCrepe
2 findings
Super NaturalInstructions
2 findings
T-Eval
2 findings
TAPe
2 findings
TCGA
2 findings
THINGS / Things-MEG
2 findings
Talk2Car
2 findings
TempCompass
2 findings
TextbookQA
2 findings
ToTTo
2 findings
Toxigen
2 findings
UC Merced Land Use
2 findings
UltraFeedback
2 findings
VQA
2 findings
VQA-X
2 findings
VTAB-1k
2 findings
Vicuna Bench
2 findings
VideoChatGPT
2 findings
WMDP
2 findings
WMT 14: fr→en
2 findings
WMT21
2 findings
WNLI
2 findings
WebArena-Lite
2 findings
WebQuestions / Complex WebQuestions
2 findings
WebShop
2 findings
WorkflowBench
2 findings
XWinograd
2 findings
YouCook2
2 findings
ZINC
2 findings
bAbI
2 findings
bnlearn
2 findings
iLDCT
2 findings
2WikiMultiHopQA
1 finding
ACS Income
1 finding
ADIENCE
1 finding
AFHQ
1 finding
AHA dataset
1 finding
AIOps Challenge
1 finding
ARO
1 finding
ASDIV
1 finding
ATLAS
1 finding
ATTAQ
1 finding
AVA
1 finding
AVE
1 finding
Abductive NLI / Abductive NLG
1 finding
Ad Fontes Media
1 finding
AdversarialGLUE
1 finding
Alpaca 52k
1 finding
AlpacaEval 2
1 finding
Amazon Reviews
1 finding
Antonym Dataset (Nguyen et al. 2017)
1 finding
Arena-Hard-200
1 finding
Argoverse
1 finding
BBQ
1 finding
BRODEN
1 finding
BeerAdvocate
1 finding
BioGen
1 finding
Bridge Data
1 finding
C-Eval
1 finding
CASIA1+
1 finding
CIRR
1 finding
CLEVR
1 finding
CO3D
1 finding
COAID
1 finding
COCO-REM
1 finding
COCO-Stuff
1 finding
COIFT
1 finding
COIN
1 finding
COLIE
1 finding
COQA
1 finding
CUFS
1 finding
CVBench-2D
1 finding
Chameleon
1 finding
Charades-STA
1 finding
ChartQA
1 finding
Citeseer
1 finding
Claude's Constitution
1 finding
CodeNet
1 finding
CodeXGLUE
1 finding
Codeforces
1 finding
CommonsenseQA 2.0
1 finding
ConceptEdit
1 finding
ConflictEdit
1 finding
ConflictQA
1 finding
Conneau et al. Probing Tasks
1 finding
CosmosQA
1 finding
DART
1 finding
DAVIS 2017 val
1 finding
DFFD
1 finding
DGSHD
1 finding
DIS
1 finding
DIV2K val
1 finding
DREAM
1 finding
DailyDialog
1 finding
DataComp
1 finding
DeepMind Control Suite / DM Control
1 finding
DisCEval-MT
1 finding
DisEntQA
1 finding
DocVQA
1 finding
DomainBed
1 finding
EHRShot
1 finding
ESC-50
1 finding
EVOBC
1 finding
Ego4D
1 finding
English UD Treebank
1 finding
Ethos
1 finding
Event-Bench
1 finding
ExpertQA
1 finding
FB15K-237
1 finding
FFT
1 finding
FLORES-200
1 finding
FOLIO
1 finding
FSD50K
1 finding
FactScore
1 finding
Factor-Expert
1 finding
FairFace
1 finding
FaithDial
1 finding
Fashion MNIST
1 finding
Fashion-IQ
1 finding
FigStep
1 finding
Foil It
1 finding
FreebaseQA
1 finding
Function Vectors Dataset
1 finding
GALE Phase 3 and 4 Chinese Newswire Parallel Text
1 finding
GFP
1 finding
GPQA
1 finding
GTZAN
1 finding
GenECIS
1 finding
Gifford et al. EEG Dataset
1 finding
GitHub (codeparrot)
1 finding
GossipCop
1 finding
GovReport
1 finding
HATEXPLAIN
1 finding
HCI (Historical Colored Images)
1 finding
HHH Alignment
1 finding
HR-SOD
1 finding
HRS-Bench
1 finding
HUST-OBS
1 finding
HotelReviews
1 finding
IBL Brainwide Map
1 finding
ILSVRC 2012 Validation Set
1 finding
IMD2020
1 finding
IMDB-B
1 finding
IWSLT 2017
1 finding
ImageNet-SK
1 finding
ImageNet-X
1 finding
ImageWoof
1 finding
InShop
1 finding
Instruction Induction
1 finding
JailbreakV-28K
1 finding
Jigsaw Unintended Bias in Toxicity Classification
1 finding
KONIQ-10K
1 finding
Kinetics
1 finding
Kinetics-710
1 finding
Koala Test Set
1 finding
Kodak
1 finding
LAION-200M
1 finding
LAION-5B
1 finding
LAION-Captions
1 finding
LAMBADA
1 finding
LLVIP
1 finding
LLaVA-Instruct
1 finding
LVIS-92i
1 finding
Lichess 2022 Blitz Games
1 finding
M4
1 finding
MC4
1 finding
MESS
1 finding
MICrONS
1 finding
MINTREC2.0
1 finding
MIT-States
1 finding
MLVU
1 finding
MMKE-Bench
1 finding
MQuAKE
1 finding
Maniskill-Fail
1 finding
Martin & Nissenbaum (2016) Vignettes
1 finding
MedQ-Pairs
1 finding
MedQA
1 finding
MetaMath
1 finding
MetaMathQA
1 finding
MiniF2F
1 finding
Mip-NeRF 360
1 finding
ModelNet40
1 finding
Moral Machine dataset / Moral Machine Experiment
1 finding
Moral Stories
1 finding
MovieLens 25M
1 finding
MultiFieldQA-EN
1 finding
Multilingual Amazon Reviews Corpus
1 finding
N24News
1 finding
NCI1
1 finding
NELL-995
1 finding
NYC Places
1 finding
Numersense
1 finding
O2BR
1 finding
OBI Component 20
1 finding
OBI-Rejoin
1 finding
OC20 IS2RE
1 finding
OC20 S2EF
1 finding
OntoNotes v5
1 finding
Open LLM Leaderboard
1 finding
OpenDataSoft Nobel Prize
1 finding
Orca-Math
1 finding
Oxford-102-Flowers
1 finding
PAN 2018
1 finding
PED
1 finding
PKU-SafeRLHF
1 finding
PMC-OA
1 finding
POPE
1 finding
Parti
1 finding
Pascal VOC
1 finding
PatternNet
1 finding
Pile of Law
1 finding
Pittsburgh30k
1 finding
Places
1 finding
Pokec
1 finding
ProScript
1 finding
Project Euler
1 finding
Proof-Pile
1 finding
PubChemQC
1 finding
QUVA
1 finding
QVHighlights
1 finding
QuAREL
1 finding
R-GSM
1 finding
RAGTruth
1 finding
RAVEL
1 finding
ROCO
1 finding
RT-1 Demonstration Dataset
1 finding
RareAct
1 finding
RealSumm
1 finding
Recipe-MPR
1 finding
RedditBias
1 finding
Replica
1 finding
Robofail
1 finding
SCAT+
1 finding
SGInW
1 finding
SICK
1 finding
SIUO
1 finding
SQA3D
1 finding
SQuAD 2.0
1 finding
STAR
1 finding
STL-10
1 finding
SWAG
1 finding
SWE-bench
1 finding
ScanObjectNN
1 finding
ScreenSpot
1 finding
Self-Instruct Test Set
1 finding
ShareGPT
1 finding
ShareGPT4V
1 finding
SlimPajama
1 finding
Social IQA
1 finding
SpatialBench
1 finding
Spider
1 finding
Squirrel
1 finding
Stanford Alpaca
1 finding
SummEval
1 finding
SuperNI
1 finding
Swiss Roll
1 finding
T-REx
1 finding
T2ICompBench
1 finding
TACO
1 finding
TDIUC
1 finding
TL;DR
1 finding
Tanks and Temples
1 finding
TextVQA
1 finding
TheoremQA
1 finding
ThinObject-5K
1 finding
ToPIoQA
1 finding
TokyoVal
1 finding
ToolBench
1 finding
Transcoder
1 finding
Tulu
1 finding
Tuxemon
1 finding
TweetEval
1 finding
UCR Time Series Archive
1 finding
USCAD
1 finding
UT-Zappos
1 finding
UTKFace
1 finding
UltraChat
1 finding
UltraChat 200K
1 finding
UniRef100
1 finding
UniRef50
1 finding
Vicuna Test Set
1 finding
VidSitu
1 finding
Video-MME
1 finding
VideoInstruct100k
1 finding
VisualWebBench
1 finding
VizWiz
1 finding
WILDS-Camelyon
1 finding
WILDS-FMOW
1 finding
WMT
1 finding
WMT 14: en→fr
1 finding
WMT19 de→fr
1 finding
WN18RR
1 finding
WanNLI
1 finding
WebArena
1 finding
WebVid-2M
1 finding
Wiki-CS
1 finding
WikiArt
1 finding
WikiBio
1 finding
WikiGen
1 finding
WildJailbreak
1 finding
Wizard of Wikipedia
1 finding
WizardLM Test Set
1 finding
WordNet
1 finding
WorkArena
1 finding
X-Stance
1 finding
XCOPA
1 finding
XLSum
1 finding
Yinqiwenyuandetection
1 finding
i-CONA
1 finding
junyi15
1 finding
AGE Dataset
0 findings
Aegis
0 findings
Aegis Safety Test
0 findings
Aligning AI with Shared Human Values
0 findings
AlpacaFarm Self-Instruct
0 findings
Amazon-WILDS
0 findings
AmbigQA
0 findings
American Rhetoric Speech Bank
0 findings
Anthropic Red Team
0 findings
CIFAR-10-C
0 findings
CXR14
0 findings
CartPole
0 findings
Cicero / Cicero V1 / Cicero V2
0 findings
CivilComments-WILDS
0 findings
Columbia Image Splicing Detection Evaluation Dataset
0 findings
Common Evaluation Platform (CEP)
0 findings
CreativeBench
0 findings
DL19
0 findings
DPG-Bench
0 findings
DaTikZ
0 findings
Defeasible NLI
0 findings
Do-Not-Answer
0 findings
Dynamic Sensorium
0 findings
EMOTIC / Emotion
0 findings
EPFL Combinational Benchmark Suite
0 findings
Enron Corpus
0 findings
Entity Tracking
0 findings
FLASK
0 findings
Freebase
0 findings
HINT
0 findings
HWOBc
0 findings
HaluEval
0 findings
Hate Speech Dataset from a White Supremacy Forum
0 findings
ImageNet-16-120
0 findings
Jigsaw Toxic Comment Classification Challenge
0 findings
JudgeBench
0 findings
L+M-24
0 findings
LAION-2B
0 findings
LAION-natural
0 findings
LLM360 / LLM360 dataset
0 findings
LLaVA-Pretrain
0 findings
LM Evaluation Harness
0 findings
ManiSkill
0 findings
MedNLI
0 findings
Model-Written Evaluations (Perez et al. 2023) / Hallucination dataset (Perez et al. 2023)
0 findings
Monash Time Series Forecasting Archive
0 findings
MountainCar
0 findings
Multi-Genre Natural Language Inference (MNLI)
0 findings
MultiJail-EN
0 findings
Natural Language fMRI Dataset (Lebel et al. 2022)
0 findings
Neuropathic Pain Diagnosis Simulator
0 findings
New York Times Student Opinion
0 findings
NumGLUE
0 findings
OBC306
0 findings
OBI-IJDH
0 findings
OBI125
0 findings
OGB-MolHIV / OGBG-MolHIV
0 findings
Oogiri-go
0 findings
PACO
0 findings
PACS
0 findings
PASCAL VOC 2007
0 findings
PASCAL VOC 2012
0 findings
PVQ-R 49 Cultural Groups
0 findings
Paris / RParis
0 findings
PersonalityBench
0 findings
Pick-a-Pic
0 findings
Pile-Bio
0 findings
Quora Question Answer Dataset
0 findings
Quora Question Pairs
0 findings
RLBench
0 findings
Rocket Chip Generator
0 findings
Ruozhiba
0 findings
SAT-Math
0 findings
SCAN
0 findings
SKEMPI 2.0 / SKEMPI v2.0
0 findings
SNLI
0 findings
Safety-Tuned Llamas Safety Data
0 findings
SemEval 2020 Task 7
0 findings
SemEval 2021 Task 7
0 findings
Social Bias Frames
0 findings
Social Chemistry 101
0 findings
Spring
0 findings
Story Cloze Test
0 findings
Supreme Court Database
0 findings
TIFA
0 findings
TREC-COVID
0 findings
Tatoeba
0 findings
Three Decades of New York Times Headlines
0 findings
TinyStories / Eldan & Li 2023 (TinyStories)
0 findings
ToxicChat / ToxicChat Test
0 findings
VLCS
0 findings
VLKEB
0 findings
VirtualHome
0 findings
WMT 2014
0 findings
WMT 2022
0 findings
WebQuestionsSP
0 findings
Whisker Sweep Dataset / Spiking whisker sweep dataset
0 findings
WikiHow
0 findings
∞Bench
0 findings