ECLeKTic
ECLeKTic est un benchmark créé par Google Research et Google DeepMind pour évaluer le transfert de connaissances entre langues dans les grands modèles de langage. Il repose sur des questions de recherche d’information issues d’articles Wikipédia dont le contenu pertinent n’existe que…
ECLeKTic est un benchmark créé par Google Research et Google DeepMind pour évaluer le transfert de connaissances entre langues dans les grands modèles de langage. Il repose sur des questions de recherche d’information issues d’articles Wikipédia dont le contenu pertinent n’existe que dans une seule langue.
Les modèles doivent répondre sans accès à une source externe, dans un cadre de question-réponse multilingue closed-book. ECLeKTic mesure ainsi leur capacité à mobiliser, dans une langue, une connaissance rencontrée dans une autre, plutôt que leur seule maîtrise linguistique.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google Research / Google DeepMind |
| Capacités mesurées | Transfert de connaissances cross-lingue : repondre en closed-book a des questions dont l'information n'existe que dans une seule langue |
| Modalité | Texte |
| Type de questions | QA closed-book multilingue (transfert cross-lingue) |
| Métrique d'évaluation | Exactitude / taux de transfert cross-lingue |
| Accès | Public |
| Langues | 12 langues : anglais, allemand, francais, hebreu, hindi, indonesien, italien, japonais, coreen, chinois mandarin, portugais, espagnol |
| Taille du jeu | ~384 questions transferees sur 12 langues |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 19,0 % | 26 juin 2025 | Auto-déclaré | |
| 2 | Gemma 3 27B | 🟢 Ouvert | 16,7 % | 12 mars 2025 | Auto-déclaré | |
| 3 | Gemma 3 12B | 🟢 Ouvert | 10,3 % | 12 mars 2025 | Auto-déclaré | |
| 4 | Gemma 3 4B | 🟢 Ouvert | 4,6 % | 12 mars 2025 | Auto-déclaré | |
| 5 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 2,5 % | 26 juin 2025 | Auto-déclaré | |
| 6 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 2,5 % | 20 mai 2025 | Auto-déclaré | |
| 7 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 1,9 % | 20 mai 2025 | Auto-déclaré | |
| 8 | Gemma 3 1B | 🟢 Ouvert | 1,4 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 3,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle restitue correctement davantage de connaissances au-delà de leur langue d’origine. Avec un meilleur résultat de 19 % pour Gemma 3n E4B Instructed et une médiane de 4 %, le classement ne montre pas de saturation apparente : le transfert cross-lingue évalué reste difficile pour les modèles classés. La portée demeure ciblée, avec environ 384 questions transférées entre 12 langues et fondées sur des contenus Wikipédia propres à une langue. Le caractère public du jeu et son ancrage dans Wikipédia invitent aussi à considérer un risque de contamination lors de l’interprétation, sans qu’il établisse à lui seul qu’une contamination a eu lieu. La rigueur comparative est limitée par des scores majoritairement auto-déclarés, plutôt que mesurés de manière indépendante. Enfin, les huit modèles du classement sont édités par Google, également à l’origine du benchmark. Les résultats renseignent donc sur les écarts internes à cette sélection, mais ne constituent pas une base indépendante pour comparer les modèles Google à ceux d’autres éditeurs.
Sources des scores : llm-stats.