Arena-Hard v2
Arena-Hard v2 est un benchmark conçu en 2025 par LMArena, anciennement LMSYS, notamment par Tianle Li et Wei-Lin Chiang. Il rassemble des requêtes utilisateur réelles et difficiles issues de Chatbot Arena et de WildChat-1M.
Arena-Hard v2 est un benchmark conçu en 2025 par LMArena, anciennement LMSYS, notamment par Tianle Li et Wei-Lin Chiang. Il rassemble des requêtes utilisateur réelles et difficiles issues de Chatbot Arena et de WildChat-1M.
Son objectif est d’évaluer la capacité des modèles à répondre à des problèmes ouverts en ingénierie logicielle, mathématiques, écriture créative et résolution technique. Fondé sur des juges automatisés, il cherche à mieux différencier les modèles tout en restant fortement corrélé aux préférences humaines observées dans Chatbot Arena.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | LMArena (ex-LMSYS) — Tianle Li, Wei-Lin Chiang et al. |
| Capacités mesurées | Évaluation sur des requêtes utilisateur réelles et difficiles, avec forte corrélation aux préférences humaines de Chatbot Arena. |
| Modalité | Texte |
| Type de questions | Requêtes ouvertes réelles (ingénierie logicielle, maths, écriture créative, résolution technique) |
| Métrique d'évaluation | LLM-as-judge (win-rate ; juges GPT-4.1 et Gemini-2.5) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais |
| Taille du jeu | 500 requêtes difficiles (+ 250 requêtes d'écriture créative) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (16)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 86,2 % | 16 décembre 2025 | Auto-déclaré |
| 2 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,7 % | 10 septembre 2025 | Auto-déclaré |
| 3 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,7 % | 25 juillet 2025 | Auto-déclaré |
| 4 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,2 % | 22 juillet 2025 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,4 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 73,9 % | 11 mars 2026 | Auto-déclaré |
| 7 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 71,0 % | 6 mars 2026 | Auto-déclaré |
| 8 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 67,7 % | 15 décembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,7 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,3 % | 10 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,5 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,5 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,7 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,1 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 49,0 % | 6 mars 2026 | Auto-déclaré |
| 16 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 36,8 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 16 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 66,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Arena-Hard v2 indique qu’un modèle remporte fréquemment les comparaisons effectuées par GPT-4.1 et Gemini-2.5 sur des requêtes complexes, spécifiques et ancrées dans des usages réels. La méthode LLM-as-judge atteint une corrélation de 98,6 % avec les classements de préférences humaines et produit une séparation des performances trois fois supérieure à celle de MT-Bench, ce qui renforce sa capacité discriminante.
Cette rigueur méthodologique doit toutefois être distinguée de la provenance des résultats recensés dans la base, majoritairement auto-déclarés par les éditeurs. Le caractère public du benchmark implique aussi un risque de contamination à prendre en compte. Sa portée reste centrée sur des requêtes en anglais et sur les domaines couverts par sa sélection de prompts. Les scores observés ne signalent pas une saturation complète, le meilleur résultat restant à 86 %. Parmi les 16 modèles évalués, MiMo-V2-Flash se détache à 86 %, nettement au-dessus de la médiane de 66 %, ce qui révèle une différenciation encore marquée au sommet du classement.
Sources des scores : llm-stats.