FACTS Grounding

FACTS Grounding est un benchmark créé en 2024 par Google DeepMind et Google Research. Il évalue la capacité des modèles de langage à produire des réponses longues, factuellement exactes et entièrement ancrées dans un document fourni.

FACTS Grounding est un benchmark créé en 2024 par Google DeepMind et Google Research. Il évalue la capacité des modèles de langage à produire des réponses longues, factuellement exactes et entièrement ancrées dans un document fourni.

Les modèles doivent exploiter un contexte pouvant être très long, sans hallucination ni recours à des connaissances externes. FACTS Grounding sert ainsi à mesurer la fiabilité des réponses fondées sur des sources, au moyen d’un score moyen établi automatiquement par un ensemble de LLM juges.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle DeepMind & Google Research
Capacités mesuréesFactualité et ancrage (grounding) : générer des réponses exactes fondées sur un contexte long fourni, sans hallucination ni connaissance externe
ModalitéTexte
Type de questionsGénération de réponse longue ancrée (grounding) dans un document fourni
Métrique d'évaluationJugement automatique par ensemble de LLM juges (factualité), score moyen
AccèsPublic
LicenceCC-BY-4.0 (split public)
LanguesAnglais
Taille du jeu1 719 exemples (860 publics + 859 privés), documents jusqu'à 32k tokens (~20 000 mots)
Année de publication2024
RessourcesSite / dépôt officiel

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire87,8 %5 juin 2025Auto-déclaré
2Gemini 2.5 FlashGoogle🔒 Propriétaire85,3 %20 mai 2025Auto-déclaré
3Gemini 2.5 Flash-LiteGoogle🟢 Ouvert84,1 %17 juin 2025Auto-déclaré
4Gemini 2.0 FlashGoogle🔒 Propriétaire83,6 %21 janvier 2025Auto-déclaré
5Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire83,6 %5 février 2025Auto-déclaré
6Gemma 3 12BGoogle🟢 Ouvert75,8 %12 mars 2025Auto-déclaré
7Gemma 3 27BGoogle🟢 Ouvert74,9 %12 mars 2025Auto-déclaré
8Gemini 3 ProGoogle🔒 Propriétaire70,5 %18 novembre 2025Auto-déclaré
9Gemma 3 4BGoogle🟢 Ouvert70,1 %12 mars 2025Auto-déclaré
10Gemini 3 FlashGoogle🔒 Propriétaire61,9 %17 décembre 2025Auto-déclaré
11GLM-5V-TurboZhipu AI🔒 Propriétaire58,6 %2 avril 2026Auto-déclaré
12Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire40,6 %3 mars 2026Auto-déclaré
13Gemma 3 1BGoogle🟢 Ouvert36,4 %12 mars 2025Auto-déclaré

Classement établi sur 13 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 74,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle génère régulièrement des réponses détaillées conformes au document de référence, tout en évitant les affirmations non étayées. Avec une médiane de 75 % et un meilleur résultat de 88 % pour Gemini 2.5 Pro Preview 06-05, le classement montre des écarts de performance et ne paraît pas entièrement saturé.

La rigueur repose sur plusieurs LLM juges plutôt que sur un juge unique, mais les scores recensés sont majoritairement auto-déclarés par les éditeurs. Leur comparabilité dépend donc de résultats qui ne proviennent pas tous d’une mesure indépendante. La séparation entre exemples publics et privés réduit l’exposition complète du jeu, sans éliminer à elle seule les enjeux de contamination liés à sa partie publique.

La portée reste ciblée : documents et réponses en anglais, contexte long, factualité et ancrage dans une source fournie. Enfin, 12 des 13 modèles classés sont édités par Google, également co-créateur du benchmark. Ce déséquilibre rend le classement peu indépendant pour comparer les modèles Google à ceux d’autres éditeurs.


Sources des scores : llm-stats.