LiveBench
LiveBench est un benchmark généraliste créé en 2024 par l’équipe LiveBench, réunissant notamment Abacus.AI, NYU et Colin White. Il évalue les modèles de langage sur des tâches de mathématiques, de code, de raisonnement, de langue, d’analyse de données et de suivi d’instructions.
LiveBench est un benchmark généraliste créé en 2024 par l’équipe LiveBench, réunissant notamment Abacus.AI, NYU et Colin White. Il évalue les modèles de langage sur des tâches de mathématiques, de code, de raisonnement, de langue, d’analyse de données et de suivi d’instructions.
Sa conception vise à limiter la contamination des jeux de test grâce à de nouvelles questions publiées chaque mois, issues de sources récentes. Les réponses ouvertes disposent d’une vérité-terrain objective et vérifiable, ce qui permet une correction automatique et une comparaison régulière des capacités des modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Équipe LiveBench (Abacus.AI, NYU et al. ; Colin White et al.) |
| Capacités mesurées | Évaluation généraliste multi-catégories : maths, code, raisonnement, langue, analyse de données et suivi d'instructions. |
| Modalité | Texte |
| Type de questions | Tâches variées à réponses ouvertes à correction objective (6 catégories) |
| Métrique d'évaluation | Exactitude (score automatique sur vérité-terrain) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | ~18 tâches réparties sur 6 catégories (taille variable, mise à jour mensuelle) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (38)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | o3-mini | OpenAI | 🔒 Propriétaire | 84,6 % | 30 janvier 2025 | Auto-déclaré |
| 2 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 80,7 % | 23 avril 2026 | n.d. |
| 3 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 80,3 % | 5 mars 2026 | n.d. |
| 4 | Gemini 3.1 Pro Preview | ▫ n.d. | 79,9 % | 19 février 2026 | n.d. | |
| 5 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 78,3 % | 9 juin 2026 | n.d. |
| 6 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 77,2 % | 28 mai 2026 | n.d. |
| 7 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,1 % | 29 avril 2025 | Auto-déclaré |
| 8 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 76,9 % | 16 avril 2026 | n.d. |
| 9 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 76,4 % | 11 juillet 2025 | Auto-déclaré |
| 10 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 76,4 % | 5 septembre 2025 | Auto-déclaré |
| 11 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 76,3 % | 5 février 2026 | n.d. |
| 12 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 76,0 % | 24 novembre 2025 | n.d. |
| 13 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 75,5 % | 17 février 2026 | n.d. |
| 14 | Gemini 3.5 Flash | 🔒 Propriétaire | 75,0 % | 19 mai 2026 | n.d. | |
| 15 | Qwen3 32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,9 % | 29 avril 2025 | Auto-déclaré |
| 16 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 74,8 % | 11 décembre 2025 | n.d. |
| 17 | GPT-5.2 Codex | OpenAI | 🔒 Propriétaire | 74,3 % | 14 janvier 2026 | n.d. |
| 18 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,3 % | 29 avril 2025 | Auto-déclaré |
| 19 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 74,3 % | 19 mai 2026 | n.d. |
| 20 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 73,6 % | 23 avril 2026 | n.d. |
| 21 | Gemini 3 Pro | 🔒 Propriétaire | 73,4 % | 18 novembre 2025 | n.d. | |
| 22 | QwQ-32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,1 % | 5 mars 2025 | Auto-déclaré |
| 23 | GPT-5.3 Codex | OpenAI | 🔒 Propriétaire | 72,8 % | 5 février 2026 | n.d. |
| 24 | Gemini 3 Flash | 🔒 Propriétaire | 72,4 % | 17 décembre 2025 | n.d. | |
| 25 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 72,2 % | 20 avril 2026 | n.d. |
| 26 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 72,0 % | 13 novembre 2025 | n.d. |
| 27 | Kimi K2.7 Code | Moonshot AI | 🟢 Ouvert | 71,9 % | 12 juin 2026 | n.d. |
| 28 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 70,9 % | 31 mars 2026 | n.d. |
| 29 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 70,2 % | 7 avril 2026 | n.d. |
| 30 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 70,1 % | 17 mars 2026 | n.d. |
| 31 | MiniMax M3 | MiniMax | 🟢 Ouvert | 70,0 % | 1 juin 2026 | n.d. |
| 32 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 69,1 % | 27 janvier 2026 | n.d. |
| 33 | o1 | OpenAI | 🔒 Propriétaire | 67,0 % | 17 décembre 2024 | Auto-déclaré |
| 34 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,3 % | 19 septembre 2024 | Auto-déclaré |
| 35 | o1-preview | OpenAI | 🔒 Propriétaire | 52,3 % | 12 septembre 2024 | Auto-déclaré |
| 36 | Phi 4 | Microsoft | 🟢 Ouvert | 47,6 % | 12 décembre 2024 | Auto-déclaré |
| 37 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 35,9 % | 19 septembre 2024 | Auto-déclaré |
| 38 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 29,6 % | 27 mars 2025 | Auto-déclaré |
Classement établi sur 38 modèles évalués, dont 22 de grands éditeurs. Score médian de l'ensemble : 73,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur LiveBench traduit une forte exactitude moyenne face à des tâches ouvertes et variées, dans les six catégories couvertes. La correction automatique sur une vérité-terrain objective renforce la cohérence de l’évaluation. La fiabilité des résultats publiés dans cette base doit toutefois être nuancée, car ils sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique.
La mise à jour mensuelle réduit le risque de contamination par des questions anciennes, sans faire de LiveBench une mesure exhaustive de l’intelligence d’un modèle. Sa portée reste celle d’un ensemble anglophone d’environ 18 tâches, dont la taille varie, centré sur des réponses objectivement vérifiables. Le classement montre un niveau globalement élevé parmi les 38 modèles recensés, avec une médiane de 74 %. o3-mini arrive en tête à 85 %, soit un écart de 11 points avec cette médiane. Ce plafond observé ne signale pas une saturation complète, puisqu’une marge demeure avant l’exactitude totale, mais les scores élevés imposent de considérer les écarts avec prudence, notamment en raison de leur mode de déclaration.
Sources des scores : llm-stats.