Gemma 3 4B

Gemma 3 4B est un LLM de Google publié le 12 mars 2025. Avec 4 milliards de paramètres, il associe un format relativement compact à une fenêtre de contexte de 131 072 tokens. Près d’un an après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement…

Gemma 3 4B est un LLM de Google publié le 12 mars 2025. Avec 4 milliards de paramètres, il associe un format relativement compact à une fenêtre de contexte de 131 072 tokens. Près d’un an après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents.

Sa licence Gemma fournit des poids ouverts et autorise l’usage commercial. Son principal atout actuel reste son coût, inférieur de 97% à la moyenne des LLM similaires et environ 110 fois plus bas que celui des modèles frontière. Ses connaissances s’arrêtent au 1er août 2024.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceGemma
Date de sortie12 mars 2025
Connaissances jusqu'à2024-08-01
Multimodaloui
Paramètres4 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
IFEval90,2 %15ᵉ / 65llm-statsAuto-déclaré
GSM8k89,2 %27ᵉ / 47llm-statsAuto-déclaré
DocVQA75,8 %26ᵉ / 26llm-statsAuto-déclaré
MATH75,6 %27ᵉ / 70llm-statsAuto-déclaré
AI2D74,8 %31ᵉ / 32llm-statsAuto-déclaré
BIG-Bench Hard72,2 %10ᵉ / 20llm-statsAuto-déclaré
HumanEval71,3 %55ᵉ / 65llm-statsAuto-déclaré
Natural2Code70,3 %7ᵉ / 8llm-statsAuto-déclaré
FACTS Grounding70,1 %9ᵉ / 13llm-statsAuto-déclaré
ChartQA68,8 %24ᵉ / 24llm-statsAuto-déclaré
MBPP63,2 %28ᵉ / 33llm-statsAuto-déclaré
VQAv2 (val)62,4 %3ᵉ / 3llm-statsAuto-déclaré
TextVQA57,8 %15ᵉ / 15llm-statsAuto-déclaré
Global-MMLU-Lite54,5 %13ᵉ / 14llm-statsAuto-déclaré
InfoVQA50,0 %9ᵉ / 9llm-statsAuto-déclaré
MathVista-Mini50,0 %23ᵉ / 23llm-statsAuto-déclaré
MMMU (val)48,8 %11ᵉ / 11llm-statsAuto-déclaré
WMT24++46,8 %18ᵉ / 23llm-statsAuto-déclaré
MMLU-Pro43,6 %118ᵉ / 125llm-statsAuto-déclaré
HiddenMath43,0 %7ᵉ / 13llm-statsAuto-déclaré
Bird-SQL (dev)36,3 %6ᵉ / 7llm-statsAuto-déclaré
GPQA30,8 %206ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench12,6 %71ᵉ / 72llm-statsAuto-déclaré
BIG-Bench Extra Hard11,0 %10ᵉ / 11llm-statsAuto-déclaré
ECLeKTic4,6 %4ᵉ / 8llm-statsAuto-déclaré
SimpleQA4,0 %42ᵉ / 45llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,05 $0,1 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 110 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable4 min 50 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Gemma 3 4B se classait dans le top 92% des 80 LLM de sa génération sur GPQA, ce qui le situait favorablement parmi les modèles publiés durant les 18 mois précédents. Son meilleur résultat Benchable concerne Ethics, tandis que General Knowledge, Mathematics et Coding affichent des scores bruts plus solides que Reasoning. Sa fenêtre de 131 072 tokens constitue une caractéristique notable pour un modèle de 4 milliards de paramètres. Son positionnement très économique reste également distinctif, avec des tarifs minimaux de 0.05 $ par million de tokens en entrée et 0.1 $ en sortie.

Limites et points d’attention. Les classements Benchable placent Gemma 3 4B dans le bas des panels évalués, y compris sur Ethics malgré son score brut élevé. Email Classification figure presque en dernière position, tandis que Coding, General Knowledge et Reasoning restent eux aussi mal classés. Reasoning constitue sa faiblesse la plus nette en valeur absolue. Près d’un an après sa publication, ses performances sont aujourd’hui largement dépassées à l’échelle de l’IA, et les modèles de cette ancienneté sont souvent retirés des catalogues des éditeurs.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).