LiveBench

LiveBench est un benchmark généraliste créé en 2024 par l’équipe LiveBench, réunissant notamment Abacus.AI, NYU et Colin White. Il évalue les modèles de langage sur des tâches de mathématiques, de code, de raisonnement, de langue, d’analyse de données et de suivi d’instructions.

LiveBench est un benchmark généraliste créé en 2024 par l’équipe LiveBench, réunissant notamment Abacus.AI, NYU et Colin White. Il évalue les modèles de langage sur des tâches de mathématiques, de code, de raisonnement, de langue, d’analyse de données et de suivi d’instructions.

Sa conception vise à limiter la contamination des jeux de test grâce à de nouvelles questions publiées chaque mois, issues de sources récentes. Les réponses ouvertes disposent d’une vérité-terrain objective et vérifiable, ce qui permet une correction automatique et une comparaison régulière des capacités des modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkÉquipe LiveBench (Abacus.AI, NYU et al. ; Colin White et al.)
Capacités mesuréesÉvaluation généraliste multi-catégories : maths, code, raisonnement, langue, analyse de données et suivi d'instructions.
ModalitéTexte
Type de questionsTâches variées à réponses ouvertes à correction objective (6 catégories)
Métrique d'évaluationExactitude (score automatique sur vérité-terrain)
AccèsPublic
LanguesAnglais
Taille du jeu~18 tâches réparties sur 6 catégories (taille variable, mise à jour mensuelle)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (38)

#ModèleÉditeurLicenceScoreSortieFiabilité
1o3-miniOpenAI🔒 Propriétaire84,6 %30 janvier 2025Auto-déclaré
2GPT-5.5OpenAI🔒 Propriétaire80,7 %23 avril 2026n.d.
3GPT-4.5OpenAI🔒 Propriétaire80,3 %5 mars 2026n.d.
4Gemini 3.1 Pro PreviewGoogle▫ n.d.79,9 %19 février 2026n.d.
5Claude Fable 5Anthropic🔒 Propriétaire78,3 %9 juin 2026n.d.
6Claude Opus 4.8Anthropic🔒 Propriétaire77,2 %28 mai 2026n.d.
7Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert77,1 %29 avril 2025Auto-déclaré
8Claude Opus 4.7Anthropic🔒 Propriétaire76,9 %16 avril 2026n.d.
9Kimi K2 InstructMoonshot AI🟢 Ouvert76,4 %11 juillet 2025Auto-déclaré
10Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert76,4 %5 septembre 2025Auto-déclaré
11Claude Opus 4.6Anthropic🔒 Propriétaire76,3 %5 février 2026n.d.
12Claude Opus 4.5Anthropic🔒 Propriétaire76,0 %24 novembre 2025n.d.
13Claude Sonnet 4.6Anthropic🔒 Propriétaire75,5 %17 février 2026n.d.
14Gemini 3.5 FlashGoogle🔒 Propriétaire75,0 %19 mai 2026n.d.
15Qwen3 32BAlibaba Cloud / Qwen Team🟢 Ouvert74,9 %29 avril 2025Auto-déclaré
16GPT-5.2OpenAI🔒 Propriétaire74,8 %11 décembre 2025n.d.
17GPT-5.2 CodexOpenAI🔒 Propriétaire74,3 %14 janvier 2026n.d.
18Qwen3 30B A3BAlibaba Cloud / Qwen Team🟢 Ouvert74,3 %29 avril 2025Auto-déclaré
19Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire74,3 %19 mai 2026n.d.
20DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert73,6 %23 avril 2026n.d.
21Gemini 3 ProGoogle🔒 Propriétaire73,4 %18 novembre 2025n.d.
22QwQ-32BAlibaba Cloud / Qwen Team🟢 Ouvert73,1 %5 mars 2025Auto-déclaré
23GPT-5.3 CodexOpenAI🔒 Propriétaire72,8 %5 février 2026n.d.
24Gemini 3 FlashGoogle🔒 Propriétaire72,4 %17 décembre 2025n.d.
25Kimi K2.6Moonshot AI🟢 Ouvert72,2 %20 avril 2026n.d.
26GPT-5.1OpenAI🔒 Propriétaire72,0 %13 novembre 2025n.d.
27Kimi K2.7 CodeMoonshot AI🟢 Ouvert71,9 %12 juin 2026n.d.
28Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire70,9 %31 mars 2026n.d.
29GLM-5.1Zhipu AI🟢 Ouvert70,2 %7 avril 2026n.d.
30GPT-5.4 nanoOpenAI🔒 Propriétaire70,1 %17 mars 2026n.d.
31MiniMax M3MiniMax🟢 Ouvert70,0 %1 juin 2026n.d.
32Kimi K2.5Moonshot AI🟢 Ouvert69,1 %27 janvier 2026n.d.
33o1OpenAI🔒 Propriétaire67,0 %17 décembre 2024Auto-déclaré
34Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert52,3 %19 septembre 2024Auto-déclaré
35o1-previewOpenAI🔒 Propriétaire52,3 %12 septembre 2024Auto-déclaré
36Phi 4Microsoft🟢 Ouvert47,6 %12 décembre 2024Auto-déclaré
37Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert35,9 %19 septembre 2024Auto-déclaré
38Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert29,6 %27 mars 2025Auto-déclaré

Classement établi sur 38 modèles évalués, dont 22 de grands éditeurs. Score médian de l'ensemble : 73,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur LiveBench traduit une forte exactitude moyenne face à des tâches ouvertes et variées, dans les six catégories couvertes. La correction automatique sur une vérité-terrain objective renforce la cohérence de l’évaluation. La fiabilité des résultats publiés dans cette base doit toutefois être nuancée, car ils sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique.

La mise à jour mensuelle réduit le risque de contamination par des questions anciennes, sans faire de LiveBench une mesure exhaustive de l’intelligence d’un modèle. Sa portée reste celle d’un ensemble anglophone d’environ 18 tâches, dont la taille varie, centré sur des réponses objectivement vérifiables. Le classement montre un niveau globalement élevé parmi les 38 modèles recensés, avec une médiane de 74 %. o3-mini arrive en tête à 85 %, soit un écart de 11 points avec cette médiane. Ce plafond observé ne signale pas une saturation complète, puisqu’une marge demeure avant l’exactitude totale, mais les scores élevés imposent de considérer les écarts avec prudence, notamment en raison de leur mode de déclaration.


Sources des scores : llm-stats.