TriviaQA
TriviaQA est un benchmark de compréhension de texte créé en 2017 par Mandar Joshi et des chercheurs de l’University of Washington. Il rassemble des questions de culture générale rédigées par des passionnés, associées à des réponses courtes et à des documents de preuve collectés…
TriviaQA est un benchmark de compréhension de texte créé en 2017 par Mandar Joshi et des chercheurs de l’University of Washington. Il rassemble des questions de culture générale rédigées par des passionnés, associées à des réponses courtes et à des documents de preuve collectés indépendamment.
Le benchmark évalue la capacité d’un modèle à retrouver des informations pertinentes, à interpréter des formulations complexes et variables, puis à raisonner entre plusieurs phrases. Il sert ainsi à comparer les systèmes sur une tâche de question-réponse fondée sur des éléments textuels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Mandar Joshi et al. (University of Washington) |
| Capacités mesurées | généraliste, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte avec documents de preuve |
| Métrique d'évaluation | exact match et F1 |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais |
| Taille du jeu | environ 95 000 paires question-réponse et plus de 650 000 triplets question-réponse-évidence |
| Année de publication | 2017 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 85,1 % | 11 juillet 2025 | Auto-déclaré |
| 2 | Gemma 2 27B | 🟢 Ouvert | 83,7 % | 27 juin 2024 | Auto-déclaré | |
| 3 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 81,3 % | 27 avril 2026 | Auto-déclaré |
| 4 | Mistral Small 3.1 24B Base | Mistral AI | 🟢 Ouvert | 80,5 % | 17 mars 2025 | Auto-déclaré |
| 5 | Mistral Small 3.1 24B Instruct | Mistral AI | 🟢 Ouvert | 80,5 % | 17 mars 2025 | Auto-déclaré |
| 6 | Mistral Small 3 24B Base | Mistral AI | 🟢 Ouvert | 80,3 % | 30 janvier 2025 | Auto-déclaré |
| 7 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 78,2 % | 16 avril 2025 | Auto-déclaré |
| 8 | Gemma 2 9B | 🟢 Ouvert | 76,6 % | 27 juin 2024 | Auto-déclaré | |
| 9 | Ministral 3 (14B Base 2512) | Mistral AI | 🟢 Ouvert | 74,9 % | 4 décembre 2025 | Auto-déclaré |
| 10 | Mistral Large 3 | Mistral AI | 🟢 Ouvert | 74,9 % | 1 septembre 2025 | Auto-déclaré |
| 11 | Mistral NeMo Instruct | Mistral AI | 🟢 Ouvert | 73,8 % | 18 juillet 2024 | Auto-déclaré |
| 12 | Gemma 3n E4B | 🔒 Propriétaire | 70,2 % | 26 juin 2025 | Auto-déclaré | |
| 13 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 70,2 % | 20 mai 2025 | Auto-déclaré | |
| 14 | Ministral 3 (8B Base 2512) | Mistral AI | 🟢 Ouvert | 68,1 % | 4 décembre 2025 | Auto-déclaré |
| 15 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 65,5 % | 16 octobre 2024 | Auto-déclaré |
| 16 | Gemma 3n E2B | 🔒 Propriétaire | 60,8 % | 26 juin 2025 | Auto-déclaré | |
| 17 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 60,8 % | 20 mai 2025 | Auto-déclaré | |
| 18 | Ministral 3 (3B Base 2512) | Mistral AI | 🟢 Ouvert | 59,2 % | 4 décembre 2025 | Auto-déclaré |
Classement établi sur 18 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 74,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur TriviaQA indique qu’un modèle restitue fréquemment la réponse attendue, selon l’exact match et le F1, à partir de questions ouvertes et de documents de preuve. Il traduit donc une bonne combinaison de compréhension, de recherche d’information et de raisonnement entre plusieurs phrases, dans le cadre précis de questions de culture générale en anglais.
La médiane de 75 % parmi les 18 modèles évalués témoigne de performances déjà élevées, sans saturation complète puisque le meilleur résultat, obtenu par Kimi K2 Base de Moonshot AI, atteint 85 %. Cet écart montre que le classement distingue encore les modèles les plus performants. Sa lecture exige néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. L’accès public au jeu impose aussi de considérer un possible effet de contamination lors de l’entraînement. Enfin, TriviaQA couvre une portée ciblée : il mesure la réponse courte documentée en anglais, et non l’ensemble des capacités générales d’un modèle.
Sources des scores : llm-stats.