Benchmarks

Les benchmarks qui évaluent les modèles d'IA, classés par éditeur. Chaque fiche détaille ce que mesure le benchmark, son éditeur, sa licence et son accès, ainsi que le classement des meilleurs modèles.

Benchmarks

330 benchmarks d'IA, classés par éditeur.

ÉditeurBenchmarkCompétences évaluéesModèles
Communauté MTEBMTEB: RTEB French—220
MTEB: RTEB German—214
MTEB: RTEB Legal—213
MTEB: Long-context Retrieval—170
MTEB: Legal—160
MTEB: Medical—158
MTEB: European—130
MTEB: Indic—121
MTEB: French—119
MTEB: Dutch—115
MTEB: Russian—106
MTEB: German—100
MTEB: RTEB Finance—99
MTEB: RTEB Healthcare—99
MTEB: MAEB Audio-Only—62
MTEB: Chinese—60
MTEB: Scandinavian—50
MTEB: Image-Text, Lite—49
MTEB: Code—45
MTEB: Image only—45
MTEB: Chemical—43
MTEB: Image-Text, English—40
MTEB: Image-Text, Multilingual—40
MTEB: MVEB Video-Only—33
MTEB: Farsi—32
MTEB: Spanish—29
MTEB: Thai—29
MTEB: Vietnamese—29
MTEB: MVEB Video-Text—24
MTEB: Korean—23
MTEB: MAEB—21
MTEB: Portuguese—18
MTEB: MVEB—16
MTEB: Polish—12
MTEB: RTEB Code—7
MTEB: RTEB English—7
OpenAISWE-Bench VerifiedCode, Développement frontend, Raisonnement102
HumanEvalCode, Raisonnement65
BrowseCompAgents, Raisonnement, Recherche58
MMMLUConnaissances générales, Langage, Mathématiques, Raisonnement49
GSM8kMathématiques, Raisonnement47
SimpleQAConnaissances générales, Factualité, Raisonnement45
Epoch: SWE-Bench verified—32
MATH-500Mathématiques, Raisonnement31
MRCR v2 (8-needle)Connaissances générales, Contexte long, Raisonnement21
Graphwalks BFS <128kRaisonnement, Raisonnement spatial11
Graphwalks BFS >128kContexte long, Raisonnement, Raisonnement spatial11
Graphwalks parents <128kRaisonnement, Raisonnement spatial11
HealthBenchSanté9
HealthBench HardSanté9
HealthBench ProfessionalSanté9
OpenAI-MRCR: 2 needle 128kContexte long, Raisonnement8
Graphwalks parents >128kContexte long, Raisonnement, Raisonnement spatial7
Internal API instruction following (hard)Connaissances générales, Sortie structurée7
MRCRConnaissances générales, Contexte long, Raisonnement7
SWE-Lancer (IC-Diamond subset)Code, Raisonnement6
BrowseComp Long Context 128kRaisonnement, Recherche4
OpenAI-MRCR: 2 needle 1MContexte long, Raisonnement4
SWE-LancerCode, Raisonnement4
MRCR v2Connaissances générales, Contexte long, Raisonnement3
GoogleIFEvalConnaissances générales, Sortie structurée, Suivi d'instructions65
Epoch: SimpleQA Verified—63
MBPPConnaissances générales, Raisonnement33
MGSMMathématiques, Raisonnement30
ERQARaisonnement, Raisonnement spatial, Vision23
WMT24++Langage23
IMO-AnswerBenchMathématiques, Raisonnement19
FACTS GroundingAncrage factuel, Factualité, Raisonnement13
HiddenMathMathématiques, Raisonnement13
BIG-Bench Extra HardConnaissances générales, Langage, Raisonnement11
BoolQLangage, Raisonnement10
AndroidWorld_SRAgents, Connaissances générales, Multimodal, Raisonnement8
DeepSearchQAAgents, Raisonnement, Recherche8
ECLeKTicLangage, Raisonnement8
Natural2CodeConnaissances générales, Raisonnement8
Natural QuestionsConnaissances générales, Raisonnement, Recherche7
RefCOCO-avgAncrage factuel, Raisonnement spatial, Vision7
CountBenchRaisonnement, Raisonnement spatial, Vision6
FLEURSLangage, Reconnaissance vocale6
Allen Institute (AI2)MTEB: Instruction Following—198
ARC-CConnaissances générales, Raisonnement34
AI2DMultimodal, Raisonnement, Vision32
DROPMathématiques, Raisonnement29
IFBenchConnaissances générales, Suivi d'instructions28
HellaSwagRaisonnement27
WinograndeLangage, Raisonnement22
Social IQaCréativité, Psychologie, Raisonnement9
ARC-EConnaissances générales, Raisonnement8
Wild BenchCommunication, Connaissances générales, Raisonnement8
ZebraLogicRaisonnement7
OpenBookQAConnaissances générales, Raisonnement5
Epoch AIEpoch: OTIS Mock AIME 2024-2025—122
Epoch: FrontierMath-2025-02-28-Private—69
Epoch: Chess Puzzles—65
Epoch: FrontierMath-2025-02-28-Public—64
Epoch: FrontierMath-Tier-4-2025-07-01-Private—55
Epoch: FrontierMath-Tier-4-v2-Private—43
Epoch: FrontierMath-Tiers-1-3-v2-Private—42
Epoch: FrontierMath-Tier-4-2025-07-01-Public—36
Epoch: Mystery Game Puzzles—21
FrontierMathMathématiques, Raisonnement16
LiveBenchLiveBenchConnaissances générales, Mathématiques, Raisonnement38
LiveBench: Agentic Coding—26
LiveBench: Coding—26
LiveBench: Data Analysis—26
LiveBench: Global average—26
LiveBench: IF—26
LiveBench: Language—26
LiveBench: Mathematics—26
LiveBench: Reasoning—26
LiveBench 20241125Connaissances générales, Mathématiques, Raisonnement14
BenchableBenchable : Email Classification (Baseline)—261
Benchable : Instruction Following (Baseline)—258
Benchable : Coding (Baseline)—255
Benchable : General Knowledge (Baseline)—254
Benchable : Ethics (Baseline)—253
Benchable : Reasoning (Baseline)—248
Benchable : Hallucinations (Baseline)—235
Benchable : Mathematics (Baseline)—228
Benchable : Keyword Topic Relevance Classification—9
SierraTau2 TelecomAppels d'outils, Communication, Raisonnement34
Tau2 RetailAppels d'outils, Communication, Raisonnement25
TAU-bench RetailAppels d'outils, Communication, Raisonnement24
t2-benchAgents, Appels d'outils, Raisonnement23
TAU-bench AirlineAppels d'outils, Communication, Raisonnement22
Tau2 AirlineAppels d'outils, Communication, Raisonnement22
Tau-benchAgents, Appels d'outils, Connaissances générales, Raisonnement6
TAU3-BenchAgents, Appels d'outils, Raisonnement5
ByteDanceSuperGPQAChimie, Connaissances générales, Finance, Juridique, Mathématiques, Physique, Raisonnement, Santé, Économie34
SWE-bench MultilingualCode, Raisonnement34
OCRBench-V2 (zh)Image vers texte, Vision11
WideSearchAgents, Raisonnement, Recherche9
Multi-SWE-BenchCode, Raisonnement6
Beyond AIMEMathématiques, Raisonnement5
Shanghai AI LabVBench: Respect du prompt—62
VBench: Total—62
MMBench-V1.1Multimodal, Raisonnement, Vision18
MVBenchMultimodal, Raisonnement, Raisonnement spatial, Vidéo, Vision17
MMBenchMultimodal, Raisonnement, Vision9
MMT-BenchConnaissances générales, Multimodal, Raisonnement, Vision4
QwenCC-OCRMultimodal, Sortie structurée, Text-to-image, Vision18
WritingBenchCommunication, Créativité, Finance, Juridique, Rédaction15
NOVA-63Connaissances générales11
DeepPlanningAgents, Raisonnement9
CSimpleQAConnaissances générales, Langage7
Gorilla (UC Berkeley)BFCL-v3Agents, Appels d'outils, Connaissances générales, Finance, Raisonnement, Sortie structurée19
BFCL-V4Agents, Appels d'outils13
BFCLAppels d'outils, Connaissances générales, Raisonnement11
BFCL v2Appels d'outils, Connaissances générales, Raisonnement5
MAA (AMC)AIME 2025Mathématiques, Raisonnement108
AIME 2024Mathématiques, Raisonnement52
AIME 2026Mathématiques, Raisonnement17
AMC_2022_23Mathématiques, Raisonnement6
PrincetonCharXiv-RMultimodal, Raisonnement, Vision47
CharXiv-DMultimodal, Raisonnement, Sortie structurée, Vision16
COLLIELangage, Raisonnement, Rédaction10
SUNRGBD3D, Raisonnement spatial, Vision4
Scale AIHumanity's Last ExamMathématiques, Raisonnement, Vision91
SWE-Bench ProAgents, Code, Raisonnement44
MCP AtlasAgents, Appels d'outils, Code, Raisonnement30
Multi-ChallengeCommunication, Raisonnement28
Zhipu AILVBenchContexte long, Multimodal, Vision24
LongBench v2Connaissances générales, Contexte long, Raisonnement, Sortie structurée16
ComplexFuncBenchAppels d'outils, Contexte long, Raisonnement, Sortie structurée7
AlignBenchConnaissances générales, Créativité, Jeu de rôle, Langage, Mathématiques, Raisonnement, Rédaction4
AiderAider-PolyglotCode, Connaissances générales22
Aider-Polyglot EditCode, Connaissances générales10
AiderCode, Raisonnement4
ARC PrizeARC-AGI v2Raisonnement, Raisonnement spatial, Vision16
ARC-AGIRaisonnement, Raisonnement spatial, Vision7
ARC-AGI-3Connaissances générales, Raisonnement4
CohereIncludeConnaissances générales31
Global-MMLU-LiteConnaissances générales, Langage, Raisonnement14
Global-MMLUConnaissances générales, Langage, Raisonnement5
Laude InstituteTerminal-Bench 2.0Agents, Appels d'outils, Code, Raisonnement49
Terminal-BenchAgents, Code, Raisonnement25
Terminal-Bench 2.1Agents, Appels d'outils, Code, Raisonnement17
LiveCodeBenchLiveCodeBench v6Connaissances générales, Raisonnement53
LiveCodeBench v5Connaissances générales, Raisonnement9
LiveCodeBench ProCode, Connaissances générales, Raisonnement4
LMArenaArena HardConnaissances générales, Créativité, Raisonnement, Rédaction26
Arena-Hard v2Connaissances générales, Créativité, Raisonnement, Rédaction16
MT-BenchCommunication, Connaissances générales, Créativité, Jeu de rôle, Raisonnement12
MathArenaHMMT 2025Mathématiques33
HMMT25Mathématiques25
HMMT Feb 26Mathématiques, Raisonnement11
MetaMulti-IFCommunication, Langage, Raisonnement, Sortie structurée, Suivi d'instructions20
TextVQAImage vers texte, Multimodal, Vision15
CoVoST2Audio, Langage, Reconnaissance vocale4
Artificial AnalysisAA-LCRContexte long, Raisonnement15
GDPval-AAAgents, Connaissances générales, Finance, Juridique, Raisonnement7
BAAIMLVU-MConnaissances générales8
RefSpatialBenchAncrage factuel, Raisonnement spatial, Vision6
HKUSTToolathlonAgents, Appels d'outils, Raisonnement31
C-EvalConnaissances générales, Raisonnement18
MicrosoftODinWVision16
AGIEvalConnaissances générales, Juridique, Mathématiques, Raisonnement10
NVIDIAMTEB: ViDoRe V3—41
RULERContexte long, Raisonnement4
Vals AIFinance Agent v2Agents, Finance, Raisonnement26
Finance AgentAgents, Finance, Raisonnement8
AppleHypersim3D, Raisonnement spatial, Vision4
CodeforcesCodeForcesMathématiques, Raisonnement16
DatabricksOfficeQA ProAgents, Connaissances générales, Raisonnement7
EQ-BenchCreative Writing v3Créativité, Rédaction12
EvalPlusHumanEval+Raisonnement10
EvolvingLMMs-LabVideoMMMUMultimodal, Raisonnement, Santé, Vision26
Harvey AILegal Agent BenchmarkAgents, Juridique, Raisonnement13
HuaweiMTEB: Code Information Retrieval—51
Illuin TechnologyMTEB: ViDoRe (V1&V2)—48
Jina AIMTEB: Jina Visual Document Retrieval—5
Kilo CodePinchBench : agentique (OpenClaw, 147 tâches)—57
MeituanVITA-BenchAgents, Raisonnement10
MercorAPEX-AgentsAgents, Raisonnement7
Mistral AIMM-MT-BenchCommunication, Multimodal17
Moonshot AIOJBenchRaisonnement9
NexusflowNexusAppels d'outils, Connaissances générales4
OpenDataLabOmniDocBench 1.5Multimodal, Raisonnement, Sortie structurée, Vision13
OPPO / WasedaMAXIFEConnaissances générales11
ProximalFrontierSWEAgents, Code15
Reka AIVibe-EvalConnaissances générales, Multimodal, Vision8
SB IntuitionsMTEB: Japanese—21
SkillsBenchSkillsBenchAgents, Code7
TIGER LabMMLU-ProConnaissances générales, Finance, Juridique, Langage, Mathématiques, Raisonnement, Santé125
WayveLingoQALangage, Multimodal, Raisonnement, Vision4
WMTWMT23Langage, Santé4
xAIRealWorldQARaisonnement spatial, Vision26
Recherche académiqueGPQABiologie, Chimie, Connaissances générales, Physique, Raisonnement221
MTEB: BEIR—197
Epoch: GPQA diamond—143
MMLUConnaissances générales, Finance, Juridique, Langage, Mathématiques, Raisonnement, Santé98
Epoch: MATH level 5—84
LiveCodeBenchCode, Connaissances générales, Raisonnement72
MATHMathématiques, Raisonnement70
MMMU-ProConnaissances générales, Multimodal, Raisonnement, Vision65
VBench: Actions humaines—62
VBench: Amplitude du mouvement—62
VBench: Cohérence du sujet—62
VBench: Fluidité du mouvement—62
VBench: Qualité d'image—62
VBench: Qualité esthétique—62
VBench: Qualité visuelle—62
VBench: Stabilité temporelle—62
MMMUConnaissances générales, Multimodal, Raisonnement, Santé, Vision61
MMLU-ReduxConnaissances générales, Langage, Mathématiques, Raisonnement48
MathVistaMathématiques, Multimodal, Vision38
MathVisionMathématiques, Multimodal, Vision32
MMLU-ProXConnaissances générales, Finance, Juridique, Langage, Mathématiques, Raisonnement, Santé32
MTEB: Reasoning Retrieval—29
DocVQAImage vers texte, Multimodal, Vision26
ChartQAMultimodal, Raisonnement, Vision24
ScreenSpot ProAncrage factuel, Multimodal, Raisonnement spatial, Vision24
MathVista-MiniMathématiques, Multimodal, Vision23
PolyMATHMathématiques, Multimodal, Raisonnement, Raisonnement spatial, Vision23
MMStarConnaissances générales, Multimodal, Raisonnement, Vision22
OCRBenchImage vers texte, Vision22
OSWorld-VerifiedAgents, Connaissances générales, Multimodal, Vision22
BIG-Bench HardLangage, Mathématiques, Raisonnement20
OSWorldAgents, Connaissances générales, Multimodal, Vision20
DeepSWE 1.1Agents, Code19
MTEB: CoREB—19
SciCodeBiologie, Chimie, Code, Mathématiques, Physique, Raisonnement18
TriviaQAConnaissances générales, Raisonnement18
TruthfulQAConnaissances générales, Finance, Juridique, Raisonnement, Santé18
Video-MMEMultimodal, Raisonnement, Vision17
Hallusion BenchRaisonnement, Vision16
MTEB: BEIR-NL—16
ScreenSpotAncrage factuel, Multimodal, Raisonnement spatial, Vision16
BLINK3D, Multimodal, Raisonnement, Raisonnement spatial, Vision13
BrowseComp-zhRaisonnement, Recherche13
Claw-EvalAgents, Code13
Global PIQAConnaissances générales, Physique, Raisonnement13
MultiPL-EConnaissances générales, Langage13
SimpleVQAConnaissances générales, Image vers texte, Multimodal, Vision13
BBHLangage, Mathématiques, Raisonnement12
CharadesSTALangage, Multimodal, Vidéo, Vision12
InfoVQAtestMultimodal, Vision12
MedXpertQAMultimodal, Raisonnement, Santé, Vision12
OCRBench-V2 (en)Image vers texte, Vision12
VBench: Créativité (VBench 2.0)—12
VBench: Total—12
CyberGymAgents, Code, Sûreté11
DocVQAtestMultimodal, Vision11
MMMU (val)Connaissances générales, Multimodal, Raisonnement, Santé, Vision11
MuirBenchMultimodal, Raisonnement, Vision11
PIQAConnaissances générales, Physique, Raisonnement11
MLVUContexte long, Multimodal, Vidéo, Vision10
VideoMME w sub.Multimodal, Vidéo, Vision10
VideoMME w/o sub.Multimodal, Vidéo, Vision10
BabyVisionMultimodal, Raisonnement, Vision9
EgoSchemaContexte long, Raisonnement, Vision9
InfoVQAMultimodal, Vision9
ZEROBenchMultimodal, Raisonnement, Vision9
EmbSpatialBenchIA incarnée, Raisonnement spatial, Vision8
MCP-MarkAgents, Appels d'outils8
Bird-SQL (dev)Raisonnement7
DynaMathMathématiques, Multimodal, Raisonnement, Vision7
MathArena ApexMathématiques, Raisonnement7
OCRBench_V2Image vers texte, Vision7
V*Multimodal, Raisonnement, Vision7
CMMLUConnaissances générales, Langage, Raisonnement6
MATH (CoT)Mathématiques, Raisonnement6
Seal-0Raisonnement, Recherche6
TheoremQAFinance, Mathématiques, Physique, Raisonnement6
MMLongBench-DocContexte long, Multimodal, Vision5
Multilingual MMLUConnaissances générales, Langage, Raisonnement5
SQuALITYContexte long, Langage, Résumé5
ZEROBench-SubMultimodal, Raisonnement, Vision5
Codegolf v2.2Code4
MMMU (validation)Connaissances générales, Multimodal, Raisonnement, Santé, Vision4
MMMUvalConnaissances générales, Multimodal, Raisonnement, Santé, Vision4
OSWorld 2.0Agents, Connaissances générales, Multimodal, Vision4
SlakeVQAImage vers texte, Multimodal, Raisonnement, Santé, Vision4
TIR-BenchAgents, Appels d'outils, Multimodal, Raisonnement4
VLMsAreBlindMultimodal, Raisonnement, Vision4
InconnuEpoch: EBR-bench—18
FrontierCode 1.1Agents, Code, Raisonnement15
NL2RepoAgents, Code14
DeepSWEAgents, Code10
AutomationBenchAgents, Appels d'outils, Raisonnement8
Agents' Last ExamAgents, Appels d'outils, Raisonnement5
Artificial AnalysisConnaissances générales5
GDP.pdfConnaissances générales, Multimodal, Raisonnement, Vision5
PostTrainBenchAgents, Code, Raisonnement, Systèmes5
Program BenchAgents, Code5
WorldVQAMultimodal, Raisonnement, Vision5
Artificial Analysis Coding Agent Index v1.1Agents, Code4
BenchCADCode, Multimodal, Raisonnement, Vision4
ExploitBenchAgents, Code, Sûreté4
HealthBench ConsensusSanté4