Gemma 4 12B
Publié par Google le 23 mai 2026, Gemma 4 12B est un LLM multimodal dense de 12 milliards de paramètres. Son architecture unifiée traite le texte, les images et l’audio dans un transformer decoder-only unique, puis produit du texte. L’analyse vidéo repose sur des séquences d’images.
Publié par Google le 23 mai 2026, Gemma 4 12B est un LLM multimodal dense de 12 milliards de paramètres. Son architecture unifiée traite le texte, les images et l’audio dans un transformer decoder-only unique, puis produit du texte. L’analyse vidéo repose sur des séquences d’images.
Le modèle se distingue par une fenêtre de contexte de 256K tokens, une attention hybride locale et globale, ainsi que des modes de raisonnement configurables. Il intègre le function calling natif et le rôle system. Distribué sous licence Apache 2.0 avec des poids ouverts, il autorise les usages commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 23 mai 2026 |
| Connaissances jusqu'à | 2025-01-01 |
| Multimodal | oui |
| Paramètres | 12 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| FLEURS | 93,1 % | 4ᵉ / 6 | llm-stats | Auto-déclaré |
| MMMLU | 83,4 % | 35ᵉ / 49 | llm-stats | Auto-déclaré |
| MathVision | 79,7 % | 13ᵉ / 32 | llm-stats | Auto-déclaré |
| GPQA | 78,8 % | 84ᵉ / 219 | llm-stats | Auto-déclaré |
| AIME 2026 | 77,5 % | 14ᵉ / 17 | llm-stats | Auto-déclaré |
| MMLU-Pro | 77,2 % | 63ᵉ / 125 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 72,0 % | 26ᵉ / 53 | llm-stats | Auto-déclaré |
| MMMU-Pro | 69,1 % | 36ᵉ / 64 | llm-stats | Auto-déclaré |
| CodeForces | 55,3 % | 15ᵉ / 16 | llm-stats | Auto-déclaré |
| BIG-Bench Extra Hard | 53,0 % | 3ᵉ / 11 | llm-stats | Auto-déclaré |
| MedXpertQA | 48,7 % | 8ᵉ / 12 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 43,4 % | 8ᵉ / 19 | llm-stats | Auto-déclaré |
| CoVoST2 | 38,5 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| OmniDocBench 1.5 | 16,4 % | 13ᵉ / 13 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 5,2 % | 85ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Gemma 4 12B rassemble plusieurs modalités dans une architecture sans encodeur séparé : les patchs d’image et les formes d’onde audio sont projetés directement dans l’espace d’embedding par des couches linéaires légères. Sa longue fenêtre de contexte et son attention hybride combinent traitement local par fenêtre glissante et attention globale. Le modèle prend en charge plus de 35 langues directement et a été pré-entraîné sur plus de 140 langues. À sa sortie, son résultat sur GPQA, qui évalue le raisonnement sur des questions scientifiques avancées, le plaçait dans le top 44% des 176 LLM de sa génération.
Limites et points d’attention. Ce classement sur GPQA situe Gemma 4 12B dans la moitié supérieure de sa génération, mais pas parmi les modèles dominants de son époque. L’appréciation comparative repose sur une seule source de données concordante, ce qui limite la portée de la comparaison à ce benchmark. La sortie exclusivement textuelle signifie également que les images, l’audio et les séquences vidéo servent d’entrées à analyser, sans génération native dans ces formats. Gemma 4 12B vise ainsi les applications multimodales, multilingues et commerciales nécessitant un contexte étendu, du function calling ou des modes de raisonnement configurables.
Sources des données : LLM-Stats (llm-stats.com).