TruthfulQA

TruthfulQA est un benchmark créé en 2021 par Stephanie Lin, Jacob Hilton et Owain Evans pour évaluer la véracité des réponses produites par les modèles de langage. Ses questions sont délibérément conçues pour susciter des erreurs inspirées d’idées reçues, de croyances fausses ou de…

TruthfulQA est un benchmark créé en 2021 par Stephanie Lin, Jacob Hilton et Owain Evans pour évaluer la véracité des réponses produites par les modèles de langage. Ses questions sont délibérément conçues pour susciter des erreurs inspirées d’idées reçues, de croyances fausses ou de conceptions erronées présentes dans les textes humains.

Le benchmark examine ainsi la capacité d’un modèle à éviter de reproduire ces affirmations trompeuses tout en fournissant une réponse informative. Ses questions courtes, ouvertes ou proposées sous forme de QCM, couvrent notamment la santé, le droit, la finance et la politique.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkStephanie Lin, Jacob Hilton et Owain Evans
Capacités mesuréesfinance, généraliste, santé, juridique, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte, avec variantes QCM
Métrique d'évaluationaccuracy / taux de réponses véridiques et informatives
AccèsPublic
LicenceApache-2.0
Languesanglais
Taille du jeu817 questions
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MAI-Thinking-1Microsoft🔒 Propriétaire88,0 %2 juin 2026Auto-déclaré
2Phi-3.5-MoE-instructMicrosoft🟢 Ouvert77,5 %23 août 2024Auto-déclaré
3Granite 3.3 8B InstructIBM🟢 Ouvert66,9 %16 avril 2025Auto-déclaré
4Phi 4 MiniMicrosoft🟢 Ouvert66,4 %30 avril 2025Auto-déclaré
5Phi-3.5-mini-instructMicrosoft🟢 Ouvert64,0 %23 août 2024Auto-déclaré
6Hermes 3 70BNous Research🟢 Ouvert63,3 %15 août 2024Auto-déclaré
7Llama 3.1 Nemotron 70B InstructNVIDIA🟢 Ouvert58,6 %1 octobre 2024Auto-déclaré
8Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert58,4 %19 septembre 2024Auto-déclaré
9Jamba 1.5 LargeAI21 Labs🟢 Ouvert58,3 %22 août 2024Auto-déclaré
10IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert58,1 %2 mai 2025Auto-déclaré
11Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,8 %19 septembre 2024Auto-déclaré
12Cohere: Command R (08-2024)Cohere🟢 Ouvert56,3 %30 août 2024Auto-déclaré
13Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert54,8 %23 juillet 2024Auto-déclaré
14Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert54,2 %19 septembre 2024Auto-déclaré
15Jamba 1.5 MiniAI21 Labs🟢 Ouvert54,1 %22 août 2024Auto-déclaré
16Granite 3.3 8B BaseIBM🟢 Ouvert52,1 %16 avril 2025Auto-déclaré
17Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert50,6 %19 septembre 2024Auto-déclaré
18Mistral NeMo InstructMistral AI🟢 Ouvert50,3 %18 juillet 2024Auto-déclaré

Classement établi sur 18 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 58,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur TruthfulQA indique qu’un modèle produit fréquemment des réponses à la fois véridiques et informatives face à des questions qui favorisent des réponses intuitives mais fausses. Il mesure donc une résistance ciblée aux croyances erronées apprises dans les textes humains, plutôt qu’une aptitude générale à répondre à toute catégorie de question. La portée reste délimitée par un jeu anglophone de 817 questions réparties entre 38 catégories et par des formats de réponse courte ou de QCM.

Dans la base, les scores sont majoritairement auto-déclarés par les éditeurs. Leur comparaison doit donc tenir compte d’une rigueur de mesure moins homogène qu’avec une évaluation entièrement conduite selon un protocole indépendant unique. L’accès public au jeu appelle également à considérer un risque de contamination lors de l’interprétation des résultats. Le classement montre néanmoins une différenciation nette entre le niveau médian de 58 % et MAI-Thinking-1, meilleur modèle recensé à 88 %. Cette marge jusqu’au score maximal possible suggère que le benchmark n’est pas saturé au sommet du classement observé.


Sources des scores : llm-stats.