Arena-Hard v2

Arena-Hard v2 est un benchmark conçu en 2025 par LMArena, anciennement LMSYS, notamment par Tianle Li et Wei-Lin Chiang. Il rassemble des requêtes utilisateur réelles et difficiles issues de Chatbot Arena et de WildChat-1M.

Arena-Hard v2 est un benchmark conçu en 2025 par LMArena, anciennement LMSYS, notamment par Tianle Li et Wei-Lin Chiang. Il rassemble des requêtes utilisateur réelles et difficiles issues de Chatbot Arena et de WildChat-1M.

Son objectif est d’évaluer la capacité des modèles à répondre à des problèmes ouverts en ingénierie logicielle, mathématiques, écriture créative et résolution technique. Fondé sur des juges automatisés, il cherche à mieux différencier les modèles tout en restant fortement corrélé aux préférences humaines observées dans Chatbot Arena.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkLMArena (ex-LMSYS) — Tianle Li, Wei-Lin Chiang et al.
Capacités mesuréesÉvaluation sur des requêtes utilisateur réelles et difficiles, avec forte corrélation aux préférences humaines de Chatbot Arena.
ModalitéTexte
Type de questionsRequêtes ouvertes réelles (ingénierie logicielle, maths, écriture créative, résolution technique)
Métrique d'évaluationLLM-as-judge (win-rate ; juges GPT-4.1 et Gemini-2.5)
AccèsPublic
LicenceApache-2.0
Languesanglais
Taille du jeu500 requêtes difficiles (+ 250 requêtes d'écriture créative)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (16)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiMo-V2-FlashXiaomi🟢 Ouvert86,2 %16 décembre 2025Auto-déclaré
2Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,7 %10 septembre 2025Auto-déclaré
3Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert79,7 %25 juillet 2025Auto-déclaré
4Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert79,2 %22 juillet 2025Auto-déclaré
5Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,4 %22 septembre 2025Auto-déclaré
6Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert73,9 %11 mars 2026Auto-déclaré
7Sarvam-105BSarvam AI🟢 Ouvert71,0 %6 mars 2026Auto-déclaré
8Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert67,7 %15 décembre 2025Auto-déclaré
9Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert64,7 %22 septembre 2025Auto-déclaré
10Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert62,3 %10 septembre 2025Auto-déclaré
11Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert60,5 %22 septembre 2025Auto-déclaré
12Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert58,5 %22 septembre 2025Auto-déclaré
13Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert56,7 %22 septembre 2025Auto-déclaré
14Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert51,1 %22 septembre 2025Auto-déclaré
15Sarvam-30BSarvam AI🟢 Ouvert49,0 %6 mars 2026Auto-déclaré
16Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert36,8 %22 septembre 2025Auto-déclaré

Classement établi sur 16 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 66,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Arena-Hard v2 indique qu’un modèle remporte fréquemment les comparaisons effectuées par GPT-4.1 et Gemini-2.5 sur des requêtes complexes, spécifiques et ancrées dans des usages réels. La méthode LLM-as-judge atteint une corrélation de 98,6 % avec les classements de préférences humaines et produit une séparation des performances trois fois supérieure à celle de MT-Bench, ce qui renforce sa capacité discriminante.

Cette rigueur méthodologique doit toutefois être distinguée de la provenance des résultats recensés dans la base, majoritairement auto-déclarés par les éditeurs. Le caractère public du benchmark implique aussi un risque de contamination à prendre en compte. Sa portée reste centrée sur des requêtes en anglais et sur les domaines couverts par sa sélection de prompts. Les scores observés ne signalent pas une saturation complète, le meilleur résultat restant à 86 %. Parmi les 16 modèles évalués, MiMo-V2-Flash se détache à 86 %, nettement au-dessus de la médiane de 66 %, ce qui révèle une différenciation encore marquée au sommet du classement.


Sources des scores : llm-stats.