FACTS Grounding
FACTS Grounding est un benchmark créé en 2024 par Google DeepMind et Google Research. Il évalue la capacité des modèles de langage à produire des réponses longues, factuellement exactes et entièrement ancrées dans un document fourni.
FACTS Grounding est un benchmark créé en 2024 par Google DeepMind et Google Research. Il évalue la capacité des modèles de langage à produire des réponses longues, factuellement exactes et entièrement ancrées dans un document fourni.
Les modèles doivent exploiter un contexte pouvant être très long, sans hallucination ni recours à des connaissances externes. FACTS Grounding sert ainsi à mesurer la fiabilité des réponses fondées sur des sources, au moyen d’un score moyen établi automatiquement par un ensemble de LLM juges.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google DeepMind & Google Research |
| Capacités mesurées | Factualité et ancrage (grounding) : générer des réponses exactes fondées sur un contexte long fourni, sans hallucination ni connaissance externe |
| Modalité | Texte |
| Type de questions | Génération de réponse longue ancrée (grounding) dans un document fourni |
| Métrique d'évaluation | Jugement automatique par ensemble de LLM juges (factualité), score moyen |
| Accès | Public |
| Licence | CC-BY-4.0 (split public) |
| Langues | Anglais |
| Taille du jeu | 1 719 exemples (860 publics + 859 privés), documents jusqu'à 32k tokens (~20 000 mots) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 87,8 % | 5 juin 2025 | Auto-déclaré | |
| 2 | Gemini 2.5 Flash | 🔒 Propriétaire | 85,3 % | 20 mai 2025 | Auto-déclaré | |
| 3 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 84,1 % | 17 juin 2025 | Auto-déclaré | |
| 4 | Gemini 2.0 Flash | 🔒 Propriétaire | 83,6 % | 21 janvier 2025 | Auto-déclaré | |
| 5 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 83,6 % | 5 février 2025 | Auto-déclaré | |
| 6 | Gemma 3 12B | 🟢 Ouvert | 75,8 % | 12 mars 2025 | Auto-déclaré | |
| 7 | Gemma 3 27B | 🟢 Ouvert | 74,9 % | 12 mars 2025 | Auto-déclaré | |
| 8 | Gemini 3 Pro | 🔒 Propriétaire | 70,5 % | 18 novembre 2025 | Auto-déclaré | |
| 9 | Gemma 3 4B | 🟢 Ouvert | 70,1 % | 12 mars 2025 | Auto-déclaré | |
| 10 | Gemini 3 Flash | 🔒 Propriétaire | 61,9 % | 17 décembre 2025 | Auto-déclaré | |
| 11 | GLM-5V-Turbo | Zhipu AI | 🔒 Propriétaire | 58,6 % | 2 avril 2026 | Auto-déclaré |
| 12 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 40,6 % | 3 mars 2026 | Auto-déclaré | |
| 13 | Gemma 3 1B | 🟢 Ouvert | 36,4 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 74,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle génère régulièrement des réponses détaillées conformes au document de référence, tout en évitant les affirmations non étayées. Avec une médiane de 75 % et un meilleur résultat de 88 % pour Gemini 2.5 Pro Preview 06-05, le classement montre des écarts de performance et ne paraît pas entièrement saturé.
La rigueur repose sur plusieurs LLM juges plutôt que sur un juge unique, mais les scores recensés sont majoritairement auto-déclarés par les éditeurs. Leur comparabilité dépend donc de résultats qui ne proviennent pas tous d’une mesure indépendante. La séparation entre exemples publics et privés réduit l’exposition complète du jeu, sans éliminer à elle seule les enjeux de contamination liés à sa partie publique.
La portée reste ciblée : documents et réponses en anglais, contexte long, factualité et ancrage dans une source fournie. Enfin, 12 des 13 modèles classés sont édités par Google, également co-créateur du benchmark. Ce déséquilibre rend le classement peu indépendant pour comparer les modèles Google à ceux d’autres éditeurs.
Sources des scores : llm-stats.