Arena Hard

Créé en 2024 par LMSYS / Chatbot Arena, Arena Hard est un benchmark public consacré aux modèles conversationnels instruction-tuned. Il rassemble des requêtes ouvertes difficiles issues de situations réelles, notamment en raisonnement, programmation, mathématiques, écriture et créativité.

Créé en 2024 par LMSYS / Chatbot Arena, Arena Hard est un benchmark public consacré aux modèles conversationnels instruction-tuned. Il rassemble des requêtes ouvertes difficiles issues de situations réelles, notamment en raisonnement, programmation, mathématiques, écriture et créativité.

Les réponses sont comparées par paires selon une approche LLM-as-a-judge, avec GPT-4.1 et Gemini-2.5 comme juges automatiques. Arena Hard vise ainsi à reproduire les préférences humaines et à mieux distinguer des modèles de qualité proche, avec une séparation annoncée trois fois supérieure à celle de MT-Bench.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkLMSYS / Chatbot Arena
Capacités mesuréescréativité, généraliste, raisonnement, rédaction
ModalitéTexte
Type de questionsquestions ouvertes de génération de réponses, évaluées par comparaison pairwise via LLM-as-a-judge
Métrique d'évaluationtaux de victoire / score Arena-Hard contre un modèle de référence
AccèsPublic
Languesanglais
Taille du jeu500 prompts
Année de publication2024
RessourcesSite / dépôt officiel

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (26)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert95,6 %29 avril 2025Auto-déclaré
2Qwen3 32BAlibaba Cloud / Qwen Team🟢 Ouvert93,8 %29 avril 2025Auto-déclaré
3Qwen3 30B A3BAlibaba Cloud / Qwen Team🟢 Ouvert91,0 %29 avril 2025Auto-déclaré
4Llama-3.3 Nemotron Super 49B v1NVIDIA🟢 Ouvert88,3 %18 mars 2025Auto-déclaré
5Mistral Small 3 24B InstructMistral AI🟢 Ouvert87,6 %30 janvier 2025Auto-déclaré
6Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert81,2 %19 septembre 2024Auto-déclaré
7Phi 4 Reasoning PlusMicrosoft🟢 Ouvert79,0 %30 avril 2025Auto-déclaré
8DeepSeek-V2.5DeepSeek🟢 Ouvert76,2 %8 mai 2024Auto-déclaré
9Phi 4Microsoft🟢 Ouvert75,4 %12 décembre 2024Auto-déclaré
10Phi 4 ReasoningMicrosoft🟢 Ouvert73,3 %30 avril 2025Auto-déclaré
11Ministral 8B InstructMistral AI🟢 Ouvert70,9 %16 octobre 2024Auto-déclaré
12Jamba 1.5 LargeAI21 Labs🟢 Ouvert65,4 %22 août 2024Auto-déclaré
13Mistral Small 4Mistral AI🟢 Ouvert58,3 %16 mars 2026Auto-déclaré
14Granite 3.3 8B BaseIBM🟢 Ouvert57,6 %16 avril 2025Auto-déclaré
15Granite 3.3 8B InstructIBM🟢 Ouvert57,6 %16 avril 2025Auto-déclaré
16MiniStral 3 (14B Instruct 2512)Mistral AI🟢 Ouvert55,1 %4 décembre 2025Auto-déclaré
17Mistral Large 3Mistral AI🟢 Ouvert55,1 %1 septembre 2025Auto-déclaré
18Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert52,0 %19 septembre 2024Auto-déclaré
19Ministral 3 (8B Instruct 2512)Mistral AI🟢 Ouvert50,9 %4 décembre 2025Auto-déclaré
20Jamba 1.5 MiniAI21 Labs🟢 Ouvert46,1 %22 août 2024Auto-déclaré
21Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert43,1 %20 juin 2025Auto-déclaré
22Phi-3.5-MoE-instructMicrosoft🟢 Ouvert37,9 %23 août 2024Auto-déclaré
23Phi-3.5-mini-instructMicrosoft🟢 Ouvert37,0 %23 août 2024Auto-déclaré
24Phi 4 MiniMicrosoft🟢 Ouvert32,8 %30 avril 2025Auto-déclaré
25Ministral 3 (3B Instruct 2512)Mistral AI🟢 Ouvert30,5 %4 décembre 2025Auto-déclaré
26IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert26,7 %2 mai 2025Auto-déclaré

Classement établi sur 26 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 57,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle remporte fréquemment ses comparaisons face au modèle de référence sur ces requêtes difficiles. La corrélation annoncée de 98,6 % avec les classements issus de préférences humaines soutient la pertinence de l’évaluation automatique. Cette lecture doit néanmoins rester prudente dans la modelothèque, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.

Le classement fait apparaître une forte amplitude entre la médiane de l’ensemble, à 58 %, et Qwen3 235B A22B, premier à 96 %. Ce résultat souligne le pouvoir discriminant du benchmark, mais un score aussi proche du maximum peut aussi signaler un risque de saturation au sommet, où les écarts deviennent moins lisibles. La portée reste circonscrite à 500 prompts en anglais et à des réponses ouvertes jugées automatiquement. Enfin, l’accès public peut favoriser l’exposition des modèles aux contenus du benchmark, ce qui constitue un risque de contamination à considérer lors de l’interprétation des performances.


Sources des scores : llm-stats.