Gemma 3 27B
Gemma 3 27B est un LLM open-weights de Google, publié le 12 mars 2025 sous licence Gemma, avec usage commercial autorisé. Son ancienneté d’environ un an est déjà très importante à l’échelle de l’IA : ses performances doivent être replacées face aux modèles de sa période, plutôt qu’aux…
Gemma 3 27B est un LLM open-weights de Google, publié le 12 mars 2025 sous licence Gemma, avec usage commercial autorisé. Son ancienneté d’environ un an est déjà très importante à l’échelle de l’IA : ses performances doivent être replacées face aux modèles de sa période, plutôt qu’aux systèmes haut de gamme actuels.
Avec 27 milliards de paramètres et une fenêtre de contexte de 131 072 tokens, le modèle privilégie un accès très économique. Son utilisation est gratuite selon les tarifs recensés, soit 100% sous la moyenne des LLM similaires. Ses connaissances s’arrêtent au 31 août 2024.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Gemma |
| Date de sortie | 12 mars 2025 |
| Multimodal | oui |
| Paramètres | 27 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 7.4 | 133ᵉ / 137 |
| Code Index | 10.1 | 74ᵉ / 74 |
| Agentic Index | 0.3 | 68ᵉ / 68 |
| Math Index | 20.7 | 45ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GSM8k | 95,9 % | 7ᵉ / 47 | llm-stats | Auto-déclaré |
| IFEval | 90,4 % | 13ᵉ / 65 | llm-stats | Auto-déclaré |
| MATH | 89,0 % | 7ᵉ / 70 | llm-stats | Auto-déclaré |
| HumanEval | 87,8 % | 27ᵉ / 65 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 87,6 % | 3ᵉ / 20 | llm-stats | Auto-déclaré |
| DocVQA | 86,6 % | 23ᵉ / 26 | llm-stats | Auto-déclaré |
| AI2D | 84,5 % | 23ᵉ / 32 | llm-stats | Auto-déclaré |
| Natural2Code | 84,5 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| ChartQA | 78,0 % | 21ᵉ / 24 | llm-stats | Auto-déclaré |
| Global-MMLU-Lite | 75,1 % | 6ᵉ / 14 | llm-stats | Auto-déclaré |
| FACTS Grounding | 74,9 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| MBPP | 74,4 % | 19ᵉ / 33 | llm-stats | Auto-déclaré |
| VQAv2 (val) | 71,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| InfoVQA | 70,6 % | 6ᵉ / 9 | llm-stats | Auto-déclaré |
| MathVista-Mini | 67,6 % | 21ᵉ / 23 | llm-stats | Auto-déclaré |
| MMLU-Pro | 67,5 % | 88ᵉ / 125 | llm-stats | Auto-déclaré |
| TextVQA | 65,1 % | 14ᵉ / 15 | llm-stats | Auto-déclaré |
| MMMU (val) | 64,9 % | 9ᵉ / 11 | llm-stats | Auto-déclaré |
| HiddenMath | 60,3 % | 2ᵉ / 13 | llm-stats | Auto-déclaré |
| Bird-SQL (dev) | 54,4 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| WMT24++ | 53,4 % | 14ᵉ / 23 | llm-stats | Auto-déclaré |
| GPQA | 42,4 % | 183ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 29,7 % | 61ᵉ / 72 | llm-stats | Auto-déclaré |
| BIG-Bench Extra Hard | 19,3 % | 7ᵉ / 11 | llm-stats | Auto-déclaré |
| ECLeKTic | 16,7 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 13,5 % | 19ᵉ / 19 | llm-stats | Auto-déclaré |
| SimpleQA | 10,0 % | 40ᵉ / 45 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 164ᵉ | GLM-4.7-Flash | 1368 |
| 165ᵉ | amazon-nova-experimental-chat-11-10 | 1366 |
| 166ᵉ | Gemma 3 27B | 1366 |
| 167ᵉ | MiniMax M1 | 1364 |
| 168ᵉ | o3-mini | 1363 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 80ᵉ | Claude 3.5 Sonnet | 1160 |
| 81ᵉ | hunyuan-vision-1.5-thinking | 1159 |
| 82ᵉ | Gemma 3 27B | 1159 |
| 83ᵉ | mistral-medium-2508 | 1158 |
| 84ᵉ | step-1o-turbo-202506 | 1157 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,08 $ | 0,16 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 68,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 6 min 34 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Gemma 3 27B se distingue surtout sur Ethics (Baseline), où il occupe la première place du classement recensé. Ses résultats Baseline sont également élevés en connaissances générales, classification d’e-mails, programmation et mathématiques, même si leurs rangs relatifs sont moins favorables. Sur MATH level 5, il se situe dans le premier tiers du panel évalué. À sa sortie, son résultat sur GPQA diamond le plaçait dans le top 43% des LLM de sa génération, soit une position correcte sans appartenir au groupe de tête. Sa licence open-weights autorisant l’usage commercial et sa gratuité constituent ses principaux atouts pratiques.
Limites et points d’attention. Les indices synthétiques révèlent aujourd’hui un net décrochage : l’Intelligence Index place le modèle près du bas du classement, tandis que le Code Index et l’Agentic Index le classent derniers de leurs panels respectifs. Le Math Index reste lui aussi dans la partie basse. Les évaluations Arena confirment cette distance, avec un classement faible en texte et plus modeste encore en vision face aux meilleurs modèles. Après environ un an, ces performances sont largement dépassées à l’échelle de l’IA, et les modèles de cet âge sont souvent retirés des catalogues des éditeurs. La coupure des connaissances en août 2024 limite aussi son intérêt pour les informations récentes.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).