ECLeKTic

ECLeKTic est un benchmark créé par Google Research et Google DeepMind pour évaluer le transfert de connaissances entre langues dans les grands modèles de langage. Il repose sur des questions de recherche d’information issues d’articles Wikipédia dont le contenu pertinent n’existe que…

ECLeKTic est un benchmark créé par Google Research et Google DeepMind pour évaluer le transfert de connaissances entre langues dans les grands modèles de langage. Il repose sur des questions de recherche d’information issues d’articles Wikipédia dont le contenu pertinent n’existe que dans une seule langue.

Les modèles doivent répondre sans accès à une source externe, dans un cadre de question-réponse multilingue closed-book. ECLeKTic mesure ainsi leur capacité à mobiliser, dans une langue, une connaissance rencontrée dans une autre, plutôt que leur seule maîtrise linguistique.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle Research / Google DeepMind
Capacités mesuréesTransfert de connaissances cross-lingue : repondre en closed-book a des questions dont l'information n'existe que dans une seule langue
ModalitéTexte
Type de questionsQA closed-book multilingue (transfert cross-lingue)
Métrique d'évaluationExactitude / taux de transfert cross-lingue
AccèsPublic
Langues12 langues : anglais, allemand, francais, hebreu, hindi, indonesien, italien, japonais, coreen, chinois mandarin, portugais, espagnol
Taille du jeu~384 questions transferees sur 12 langues
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemma 3n E4B InstructedGoogle🔒 Propriétaire19,0 %26 juin 2025Auto-déclaré
2Gemma 3 27BGoogle🟢 Ouvert16,7 %12 mars 2025Auto-déclaré
3Gemma 3 12BGoogle🟢 Ouvert10,3 %12 mars 2025Auto-déclaré
4Gemma 3 4BGoogle🟢 Ouvert4,6 %12 mars 2025Auto-déclaré
5Gemma 3n E2B InstructedGoogle🔒 Propriétaire2,5 %26 juin 2025Auto-déclaré
6Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert2,5 %20 mai 2025Auto-déclaré
7Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert1,9 %20 mai 2025Auto-déclaré
8Gemma 3 1BGoogle🟢 Ouvert1,4 %12 mars 2025Auto-déclaré

Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 3,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle restitue correctement davantage de connaissances au-delà de leur langue d’origine. Avec un meilleur résultat de 19 % pour Gemma 3n E4B Instructed et une médiane de 4 %, le classement ne montre pas de saturation apparente : le transfert cross-lingue évalué reste difficile pour les modèles classés. La portée demeure ciblée, avec environ 384 questions transférées entre 12 langues et fondées sur des contenus Wikipédia propres à une langue. Le caractère public du jeu et son ancrage dans Wikipédia invitent aussi à considérer un risque de contamination lors de l’interprétation, sans qu’il établisse à lui seul qu’une contamination a eu lieu. La rigueur comparative est limitée par des scores majoritairement auto-déclarés, plutôt que mesurés de manière indépendante. Enfin, les huit modèles du classement sont édités par Google, également à l’origine du benchmark. Les résultats renseignent donc sur les écarts internes à cette sélection, mais ne constituent pas une base indépendante pour comparer les modèles Google à ceux d’autres éditeurs.


Sources des scores : llm-stats.