Gemma 3 4B
Gemma 3 4B est un LLM de Google publié le 12 mars 2025. Avec 4 milliards de paramètres, il associe un format relativement compact à une fenêtre de contexte de 131 072 tokens. Près d’un an après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement…
Gemma 3 4B est un LLM de Google publié le 12 mars 2025. Avec 4 milliards de paramètres, il associe un format relativement compact à une fenêtre de contexte de 131 072 tokens. Près d’un an après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents.
Sa licence Gemma fournit des poids ouverts et autorise l’usage commercial. Son principal atout actuel reste son coût, inférieur de 97% à la moyenne des LLM similaires et environ 110 fois plus bas que celui des modèles frontière. Ses connaissances s’arrêtent au 1er août 2024.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Gemma |
| Date de sortie | 12 mars 2025 |
| Connaissances jusqu'à | 2024-08-01 |
| Multimodal | oui |
| Paramètres | 4 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| IFEval | 90,2 % | 15ᵉ / 65 | llm-stats | Auto-déclaré |
| GSM8k | 89,2 % | 27ᵉ / 47 | llm-stats | Auto-déclaré |
| DocVQA | 75,8 % | 26ᵉ / 26 | llm-stats | Auto-déclaré |
| MATH | 75,6 % | 27ᵉ / 70 | llm-stats | Auto-déclaré |
| AI2D | 74,8 % | 31ᵉ / 32 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 72,2 % | 10ᵉ / 20 | llm-stats | Auto-déclaré |
| HumanEval | 71,3 % | 55ᵉ / 65 | llm-stats | Auto-déclaré |
| Natural2Code | 70,3 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| FACTS Grounding | 70,1 % | 9ᵉ / 13 | llm-stats | Auto-déclaré |
| ChartQA | 68,8 % | 24ᵉ / 24 | llm-stats | Auto-déclaré |
| MBPP | 63,2 % | 28ᵉ / 33 | llm-stats | Auto-déclaré |
| VQAv2 (val) | 62,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| TextVQA | 57,8 % | 15ᵉ / 15 | llm-stats | Auto-déclaré |
| Global-MMLU-Lite | 54,5 % | 13ᵉ / 14 | llm-stats | Auto-déclaré |
| InfoVQA | 50,0 % | 9ᵉ / 9 | llm-stats | Auto-déclaré |
| MathVista-Mini | 50,0 % | 23ᵉ / 23 | llm-stats | Auto-déclaré |
| MMMU (val) | 48,8 % | 11ᵉ / 11 | llm-stats | Auto-déclaré |
| WMT24++ | 46,8 % | 18ᵉ / 23 | llm-stats | Auto-déclaré |
| MMLU-Pro | 43,6 % | 118ᵉ / 125 | llm-stats | Auto-déclaré |
| HiddenMath | 43,0 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| Bird-SQL (dev) | 36,3 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| GPQA | 30,8 % | 206ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 12,6 % | 71ᵉ / 72 | llm-stats | Auto-déclaré |
| BIG-Bench Extra Hard | 11,0 % | 10ᵉ / 11 | llm-stats | Auto-déclaré |
| ECLeKTic | 4,6 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| SimpleQA | 4,0 % | 42ᵉ / 45 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,05 $ | 0,1 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 110 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 4 min 50 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Gemma 3 4B se classait dans le top 92% des 80 LLM de sa génération sur GPQA, ce qui le situait favorablement parmi les modèles publiés durant les 18 mois précédents. Son meilleur résultat Benchable concerne Ethics, tandis que General Knowledge, Mathematics et Coding affichent des scores bruts plus solides que Reasoning. Sa fenêtre de 131 072 tokens constitue une caractéristique notable pour un modèle de 4 milliards de paramètres. Son positionnement très économique reste également distinctif, avec des tarifs minimaux de 0.05 $ par million de tokens en entrée et 0.1 $ en sortie.
Limites et points d’attention. Les classements Benchable placent Gemma 3 4B dans le bas des panels évalués, y compris sur Ethics malgré son score brut élevé. Email Classification figure presque en dernière position, tandis que Coding, General Knowledge et Reasoning restent eux aussi mal classés. Reasoning constitue sa faiblesse la plus nette en valeur absolue. Près d’un an après sa publication, ses performances sont aujourd’hui largement dépassées à l’échelle de l’IA, et les modèles de cette ancienneté sont souvent retirés des catalogues des éditeurs.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).