Gemma 4 31B
Gemma 4 31B est un LLM open-weights de Google, sorti le 2 avril 2026 sous licence Apache 2.0, avec usage commercial autorisé. Ses 31 milliards de paramètres et sa fenêtre de contexte de 262 144 tokens le positionnent comme un modèle dense à contexte long, proposé à un tarif minimal…
Gemma 4 31B est un LLM open-weights de Google, sorti le 2 avril 2026 sous licence Apache 2.0, avec usage commercial autorisé. Ses 31 milliards de paramètres et sa fenêtre de contexte de 262 144 tokens le positionnent comme un modèle dense à contexte long, proposé à un tarif minimal gratuit.
Le modèle traite le texte, les images et les vidéos pour produire du texte, sans prise en charge de l’audio. Il combine attention locale et globale, raisonnement configurable, rôle system natif, function calling et outils de génération ou de correction de code. Pré-entraîné sur plus de 140 langues, il prend nativement en charge plus de 35 langues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 2 avril 2026 |
| Connaissances jusqu'à | 2025-01-01 |
| Multimodal | oui |
| Paramètres | 31 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 29.4 | 63ᵉ / 137 |
| Code Index | 43.4 | 41ᵉ / 74 |
| Agentic Index | 14.4 | 48ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2026 | 89,2 % | 11ᵉ / 17 | llm-stats | Auto-déclaré |
| MMMLU | 88,4 % | 18ᵉ / 49 | llm-stats | Auto-déclaré |
| t2-bench | 86,4 % | 5ᵉ / 23 | llm-stats | Auto-déclaré |
| MathVision | 85,6 % | 9ᵉ / 32 | llm-stats | Auto-déclaré |
| MMLU-Pro | 85,2 % | 15ᵉ / 125 | llm-stats | Auto-déclaré |
| GPQA | 84,3 % | 52ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 80,0 % | 21ᵉ / 53 | llm-stats | Auto-déclaré |
| MMMU-Pro | 76,9 % | 23ᵉ / 64 | llm-stats | Auto-déclaré |
| BIG-Bench Extra Hard | 74,4 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 66,4 % | 5ᵉ / 19 | llm-stats | Auto-déclaré |
| MedXpertQA | 61,3 % | 5ᵉ / 12 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 26,5 % | 45ᵉ / 89 | llm-stats | Auto-déclaré |
| GDPval-AA | 26,1 % | 39ᵉ / 39 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1451 | 50ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Document | 1424 | 23ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Code | 1367 | 63ᵉ / 99 | Kimi K3 (1679) |
| Arena Vision | 1255 | 26ᵉ / 135 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google AI Studio | gratuit | gratuit | n.d. |
| OpenInference | 0,1 $ | 0,35 $ | 0,1 $ |
| deepinfra | 0,13 $ | 0,38 $ | n.d. |
| friendli | 0,14 $ | 0,4 $ | n.d. |
| together | 0,39 $ | 0,97 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 1,84 $ |
| Durée d'exécution — PinchBench | 5 h 52 min |
| Indice valeur/coût — PinchBench | 75,07 |
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 26 min 37 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Gemma 4 31B se classait dans le top 24% des LLM de sa génération sur GPQA. Ses résultats Benchable le placent dans le top 10 pour Hallucinations et Ethics, tandis que les scores en classification d’e-mails, connaissances générales, code et mathématiques restent élevés. Son Code Index est mieux classé que ses indices général et agentique. L’architecture à 60 couches, l’alternance entre attention locale et globale et le contexte long servent l’analyse de contenus volumineux. Le tarif minimal gratuit et un positionnement 100% sous la moyenne des LLM similaires en font une option très économique.
Limites et points d'attention. Les classements relatifs nuancent les scores Benchable élevés : Gemma 4 31B reste en retrait dans l’Arena text, descend dans la seconde moitié de l’Arena document et occupe une position intermédiaire dans l’Arena code. L’Intelligence Index le situe également au milieu du classement, tandis que l’Agentic Index indique des capacités agentiques moins compétitives. L’écart avec les modèles en tête est particulièrement marqué en code. L’absence d’entrée audio limite aussi son périmètre multimodal. Le modèle convient surtout aux usages multilingues, au traitement de longs contextes, à la compréhension d’images et aux tâches de code sensibles au coût.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).