TriviaQA

TriviaQA est un benchmark de compréhension de texte créé en 2017 par Mandar Joshi et des chercheurs de l’University of Washington. Il rassemble des questions de culture générale rédigées par des passionnés, associées à des réponses courtes et à des documents de preuve collectés…

TriviaQA est un benchmark de compréhension de texte créé en 2017 par Mandar Joshi et des chercheurs de l’University of Washington. Il rassemble des questions de culture générale rédigées par des passionnés, associées à des réponses courtes et à des documents de preuve collectés indépendamment.

Le benchmark évalue la capacité d’un modèle à retrouver des informations pertinentes, à interpréter des formulations complexes et variables, puis à raisonner entre plusieurs phrases. Il sert ainsi à comparer les systèmes sur une tâche de question-réponse fondée sur des éléments textuels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMandar Joshi et al. (University of Washington)
Capacités mesuréesgénéraliste, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte avec documents de preuve
Métrique d'évaluationexact match et F1
AccèsPublic
LicenceApache-2.0
Languesanglais
Taille du jeuenviron 95 000 paires question-réponse et plus de 650 000 triplets question-réponse-évidence
Année de publication2017
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2 BaseMoonshot AI🟢 Ouvert85,1 %11 juillet 2025Auto-déclaré
2Gemma 2 27BGoogle🟢 Ouvert83,7 %27 juin 2024Auto-déclaré
3MiMo-V2.5-ProXiaomi🟢 Ouvert81,3 %27 avril 2026Auto-déclaré
4Mistral Small 3.1 24B BaseMistral AI🟢 Ouvert80,5 %17 mars 2025Auto-déclaré
5Mistral Small 3.1 24B InstructMistral AI🟢 Ouvert80,5 %17 mars 2025Auto-déclaré
6Mistral Small 3 24B BaseMistral AI🟢 Ouvert80,3 %30 janvier 2025Auto-déclaré
7Granite 3.3 8B BaseIBM🟢 Ouvert78,2 %16 avril 2025Auto-déclaré
8Gemma 2 9BGoogle🟢 Ouvert76,6 %27 juin 2024Auto-déclaré
9Ministral 3 (14B Base 2512)Mistral AI🟢 Ouvert74,9 %4 décembre 2025Auto-déclaré
10Mistral Large 3Mistral AI🟢 Ouvert74,9 %1 septembre 2025Auto-déclaré
11Mistral NeMo InstructMistral AI🟢 Ouvert73,8 %18 juillet 2024Auto-déclaré
12Gemma 3n E4BGoogle🔒 Propriétaire70,2 %26 juin 2025Auto-déclaré
13Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert70,2 %20 mai 2025Auto-déclaré
14Ministral 3 (8B Base 2512)Mistral AI🟢 Ouvert68,1 %4 décembre 2025Auto-déclaré
15Ministral 8B InstructMistral AI🟢 Ouvert65,5 %16 octobre 2024Auto-déclaré
16Gemma 3n E2BGoogle🔒 Propriétaire60,8 %26 juin 2025Auto-déclaré
17Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert60,8 %20 mai 2025Auto-déclaré
18Ministral 3 (3B Base 2512)Mistral AI🟢 Ouvert59,2 %4 décembre 2025Auto-déclaré

Classement établi sur 18 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 74,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur TriviaQA indique qu’un modèle restitue fréquemment la réponse attendue, selon l’exact match et le F1, à partir de questions ouvertes et de documents de preuve. Il traduit donc une bonne combinaison de compréhension, de recherche d’information et de raisonnement entre plusieurs phrases, dans le cadre précis de questions de culture générale en anglais.

La médiane de 75 % parmi les 18 modèles évalués témoigne de performances déjà élevées, sans saturation complète puisque le meilleur résultat, obtenu par Kimi K2 Base de Moonshot AI, atteint 85 %. Cet écart montre que le classement distingue encore les modèles les plus performants. Sa lecture exige néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. L’accès public au jeu impose aussi de considérer un possible effet de contamination lors de l’entraînement. Enfin, TriviaQA couvre une portée ciblée : il mesure la réponse courte documentée en anglais, et non l’ensemble des capacités générales d’un modèle.


Sources des scores : llm-stats.