TruthfulQA
TruthfulQA est un benchmark créé en 2021 par Stephanie Lin, Jacob Hilton et Owain Evans pour évaluer la véracité des réponses produites par les modèles de langage. Ses questions sont délibérément conçues pour susciter des erreurs inspirées d’idées reçues, de croyances fausses ou de…
TruthfulQA est un benchmark créé en 2021 par Stephanie Lin, Jacob Hilton et Owain Evans pour évaluer la véracité des réponses produites par les modèles de langage. Ses questions sont délibérément conçues pour susciter des erreurs inspirées d’idées reçues, de croyances fausses ou de conceptions erronées présentes dans les textes humains.
Le benchmark examine ainsi la capacité d’un modèle à éviter de reproduire ces affirmations trompeuses tout en fournissant une réponse informative. Ses questions courtes, ouvertes ou proposées sous forme de QCM, couvrent notamment la santé, le droit, la finance et la politique.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Stephanie Lin, Jacob Hilton et Owain Evans |
| Capacités mesurées | finance, généraliste, santé, juridique, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte, avec variantes QCM |
| Métrique d'évaluation | accuracy / taux de réponses véridiques et informatives |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais |
| Taille du jeu | 817 questions |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 88,0 % | 2 juin 2026 | Auto-déclaré |
| 2 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 77,5 % | 23 août 2024 | Auto-déclaré |
| 3 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 66,9 % | 16 avril 2025 | Auto-déclaré |
| 4 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 66,4 % | 30 avril 2025 | Auto-déclaré |
| 5 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 64,0 % | 23 août 2024 | Auto-déclaré |
| 6 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 63,3 % | 15 août 2024 | Auto-déclaré |
| 7 | Llama 3.1 Nemotron 70B Instruct | NVIDIA | 🟢 Ouvert | 58,6 % | 1 octobre 2024 | Auto-déclaré |
| 8 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,4 % | 19 septembre 2024 | Auto-déclaré |
| 9 | Jamba 1.5 Large | AI21 Labs | 🟢 Ouvert | 58,3 % | 22 août 2024 | Auto-déclaré |
| 10 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 58,1 % | 2 mai 2025 | Auto-déclaré |
| 11 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,8 % | 19 septembre 2024 | Auto-déclaré |
| 12 | Cohere: Command R (08-2024) | Cohere | 🟢 Ouvert | 56,3 % | 30 août 2024 | Auto-déclaré |
| 13 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,8 % | 23 juillet 2024 | Auto-déclaré |
| 14 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,2 % | 19 septembre 2024 | Auto-déclaré |
| 15 | Jamba 1.5 Mini | AI21 Labs | 🟢 Ouvert | 54,1 % | 22 août 2024 | Auto-déclaré |
| 16 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 52,1 % | 16 avril 2025 | Auto-déclaré |
| 17 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,6 % | 19 septembre 2024 | Auto-déclaré |
| 18 | Mistral NeMo Instruct | Mistral AI | 🟢 Ouvert | 50,3 % | 18 juillet 2024 | Auto-déclaré |
Classement établi sur 18 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 58,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur TruthfulQA indique qu’un modèle produit fréquemment des réponses à la fois véridiques et informatives face à des questions qui favorisent des réponses intuitives mais fausses. Il mesure donc une résistance ciblée aux croyances erronées apprises dans les textes humains, plutôt qu’une aptitude générale à répondre à toute catégorie de question. La portée reste délimitée par un jeu anglophone de 817 questions réparties entre 38 catégories et par des formats de réponse courte ou de QCM.
Dans la base, les scores sont majoritairement auto-déclarés par les éditeurs. Leur comparaison doit donc tenir compte d’une rigueur de mesure moins homogène qu’avec une évaluation entièrement conduite selon un protocole indépendant unique. L’accès public au jeu appelle également à considérer un risque de contamination lors de l’interprétation des résultats. Le classement montre néanmoins une différenciation nette entre le niveau médian de 58 % et MAI-Thinking-1, meilleur modèle recensé à 88 %. Cette marge jusqu’au score maximal possible suggère que le benchmark n’est pas saturé au sommet du classement observé.
Sources des scores : llm-stats.