Gemma 4 12B

Publié par Google le 23 mai 2026, Gemma 4 12B est un LLM multimodal dense de 12 milliards de paramètres. Son architecture unifiée traite le texte, les images et l’audio dans un transformer decoder-only unique, puis produit du texte. L’analyse vidéo repose sur des séquences d’images.

Publié par Google le 23 mai 2026, Gemma 4 12B est un LLM multimodal dense de 12 milliards de paramètres. Son architecture unifiée traite le texte, les images et l’audio dans un transformer decoder-only unique, puis produit du texte. L’analyse vidéo repose sur des séquences d’images.

Le modèle se distingue par une fenêtre de contexte de 256K tokens, une attention hybride locale et globale, ainsi que des modes de raisonnement configurables. Il intègre le function calling natif et le rôle system. Distribué sous licence Apache 2.0 avec des poids ouverts, il autorise les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie23 mai 2026
Connaissances jusqu'à2025-01-01
Multimodaloui
Paramètres12 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
FLEURS93,1 %4ᵉ / 6llm-statsAuto-déclaré
MMMLU83,4 %35ᵉ / 49llm-statsAuto-déclaré
MathVision79,7 %13ᵉ / 32llm-statsAuto-déclaré
GPQA78,8 %84ᵉ / 219llm-statsAuto-déclaré
AIME 202677,5 %14ᵉ / 17llm-statsAuto-déclaré
MMLU-Pro77,2 %63ᵉ / 125llm-statsAuto-déclaré
LiveCodeBench v672,0 %26ᵉ / 53llm-statsAuto-déclaré
MMMU-Pro69,1 %36ᵉ / 64llm-statsAuto-déclaré
CodeForces55,3 %15ᵉ / 16llm-statsAuto-déclaré
BIG-Bench Extra Hard53,0 %3ᵉ / 11llm-statsAuto-déclaré
MedXpertQA48,7 %8ᵉ / 12llm-statsAuto-déclaré
MRCR v2 (8-needle)43,4 %8ᵉ / 19llm-statsAuto-déclaré
CoVoST238,5 %3ᵉ / 4llm-statsAuto-déclaré
OmniDocBench 1.516,4 %13ᵉ / 13llm-statsAuto-déclaré
Humanity's Last Exam5,2 %85ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Gemma 4 12B rassemble plusieurs modalités dans une architecture sans encodeur séparé : les patchs d’image et les formes d’onde audio sont projetés directement dans l’espace d’embedding par des couches linéaires légères. Sa longue fenêtre de contexte et son attention hybride combinent traitement local par fenêtre glissante et attention globale. Le modèle prend en charge plus de 35 langues directement et a été pré-entraîné sur plus de 140 langues. À sa sortie, son résultat sur GPQA, qui évalue le raisonnement sur des questions scientifiques avancées, le plaçait dans le top 44% des 176 LLM de sa génération.

Limites et points d’attention. Ce classement sur GPQA situe Gemma 4 12B dans la moitié supérieure de sa génération, mais pas parmi les modèles dominants de son époque. L’appréciation comparative repose sur une seule source de données concordante, ce qui limite la portée de la comparaison à ce benchmark. La sortie exclusivement textuelle signifie également que les images, l’audio et les séquences vidéo servent d’entrées à analyser, sans génération native dans ces formats. Gemma 4 12B vise ainsi les applications multimodales, multilingues et commerciales nécessitant un contexte étendu, du function calling ou des modes de raisonnement configurables.


Sources des données : LLM-Stats (llm-stats.com).