Arena Hard
Créé en 2024 par LMSYS / Chatbot Arena, Arena Hard est un benchmark public consacré aux modèles conversationnels instruction-tuned. Il rassemble des requêtes ouvertes difficiles issues de situations réelles, notamment en raisonnement, programmation, mathématiques, écriture et créativité.
Créé en 2024 par LMSYS / Chatbot Arena, Arena Hard est un benchmark public consacré aux modèles conversationnels instruction-tuned. Il rassemble des requêtes ouvertes difficiles issues de situations réelles, notamment en raisonnement, programmation, mathématiques, écriture et créativité.
Les réponses sont comparées par paires selon une approche LLM-as-a-judge, avec GPT-4.1 et Gemini-2.5 comme juges automatiques. Arena Hard vise ainsi à reproduire les préférences humaines et à mieux distinguer des modèles de qualité proche, avec une séparation annoncée trois fois supérieure à celle de MT-Bench.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | LMSYS / Chatbot Arena |
| Capacités mesurées | créativité, généraliste, raisonnement, rédaction |
| Modalité | Texte |
| Type de questions | questions ouvertes de génération de réponses, évaluées par comparaison pairwise via LLM-as-a-judge |
| Métrique d'évaluation | taux de victoire / score Arena-Hard contre un modèle de référence |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 500 prompts |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (26)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,6 % | 29 avril 2025 | Auto-déclaré |
| 2 | Qwen3 32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,8 % | 29 avril 2025 | Auto-déclaré |
| 3 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,0 % | 29 avril 2025 | Auto-déclaré |
| 4 | Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 🟢 Ouvert | 88,3 % | 18 mars 2025 | Auto-déclaré |
| 5 | Mistral Small 3 24B Instruct | Mistral AI | 🟢 Ouvert | 87,6 % | 30 janvier 2025 | Auto-déclaré |
| 6 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,2 % | 19 septembre 2024 | Auto-déclaré |
| 7 | Phi 4 Reasoning Plus | Microsoft | 🟢 Ouvert | 79,0 % | 30 avril 2025 | Auto-déclaré |
| 8 | DeepSeek-V2.5 | DeepSeek | 🟢 Ouvert | 76,2 % | 8 mai 2024 | Auto-déclaré |
| 9 | Phi 4 | Microsoft | 🟢 Ouvert | 75,4 % | 12 décembre 2024 | Auto-déclaré |
| 10 | Phi 4 Reasoning | Microsoft | 🟢 Ouvert | 73,3 % | 30 avril 2025 | Auto-déclaré |
| 11 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 70,9 % | 16 octobre 2024 | Auto-déclaré |
| 12 | Jamba 1.5 Large | AI21 Labs | 🟢 Ouvert | 65,4 % | 22 août 2024 | Auto-déclaré |
| 13 | Mistral Small 4 | Mistral AI | 🟢 Ouvert | 58,3 % | 16 mars 2026 | Auto-déclaré |
| 14 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 57,6 % | 16 avril 2025 | Auto-déclaré |
| 15 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 57,6 % | 16 avril 2025 | Auto-déclaré |
| 16 | MiniStral 3 (14B Instruct 2512) | Mistral AI | 🟢 Ouvert | 55,1 % | 4 décembre 2025 | Auto-déclaré |
| 17 | Mistral Large 3 | Mistral AI | 🟢 Ouvert | 55,1 % | 1 septembre 2025 | Auto-déclaré |
| 18 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,0 % | 19 septembre 2024 | Auto-déclaré |
| 19 | Ministral 3 (8B Instruct 2512) | Mistral AI | 🟢 Ouvert | 50,9 % | 4 décembre 2025 | Auto-déclaré |
| 20 | Jamba 1.5 Mini | AI21 Labs | 🟢 Ouvert | 46,1 % | 22 août 2024 | Auto-déclaré |
| 21 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 43,1 % | 20 juin 2025 | Auto-déclaré |
| 22 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 37,9 % | 23 août 2024 | Auto-déclaré |
| 23 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 37,0 % | 23 août 2024 | Auto-déclaré |
| 24 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 32,8 % | 30 avril 2025 | Auto-déclaré |
| 25 | Ministral 3 (3B Instruct 2512) | Mistral AI | 🟢 Ouvert | 30,5 % | 4 décembre 2025 | Auto-déclaré |
| 26 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 26,7 % | 2 mai 2025 | Auto-déclaré |
Classement établi sur 26 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 57,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle remporte fréquemment ses comparaisons face au modèle de référence sur ces requêtes difficiles. La corrélation annoncée de 98,6 % avec les classements issus de préférences humaines soutient la pertinence de l’évaluation automatique. Cette lecture doit néanmoins rester prudente dans la modelothèque, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.
Le classement fait apparaître une forte amplitude entre la médiane de l’ensemble, à 58 %, et Qwen3 235B A22B, premier à 96 %. Ce résultat souligne le pouvoir discriminant du benchmark, mais un score aussi proche du maximum peut aussi signaler un risque de saturation au sommet, où les écarts deviennent moins lisibles. La portée reste circonscrite à 500 prompts en anglais et à des réponses ouvertes jugées automatiquement. Enfin, l’accès public peut favoriser l’exposition des modèles aux contenus du benchmark, ce qui constitue un risque de contamination à considérer lors de l’interprétation des performances.
Sources des scores : llm-stats.