Gemini 3.6 Flash
Gemini 3.6 Flash est un LLM propriétaire de Google, sorti le 21 juillet 2026. Il se distingue par une fenêtre de contexte de 1 048 576 tokens, soit environ un million, et par des connaissances arrêtées au 31 mars 2026.
Gemini 3.6 Flash est un LLM propriétaire de Google, sorti le 21 juillet 2026. Il se distingue par une fenêtre de contexte de 1 048 576 tokens, soit environ un million, et par des connaissances arrêtées au 31 mars 2026.
Son positionnement est économique : sa tarification se situe 28% sous la moyenne des LLM similaires et environ 3,7 fois sous celle des modèles frontière. Ce rapport entre grand contexte, résultats compétitifs et coût contenu constitue son principal argument.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🔒 Propriétaire |
| Date de sortie | 21 juillet 2026 |
| Connaissances jusqu'à | 2026-03-31 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,audio,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 239 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 249 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 257 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 91ᵉ / 263 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 96,0 % | 12ᵉ / 259 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 95,0 % | 29ᵉ / 230 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 94,0 % | 201ᵉ / 258 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 83,0 % | 38ᵉ / 261 | benchable | ✅ Mesuré |
| CharXiv-R | 89,4 % | 5ᵉ / 47 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 83,0 % | 3ᵉ / 21 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 78,0 % | 9ᵉ / 15 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 58,7 % | 14ᵉ / 43 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 54,0 % | 7ᵉ / 21 | llm-stats | Auto-déclaré |
| DeepSWE 1.1 | 49,0 % | 13ᵉ / 18 | llm-stats | n.d. |
| GDPval-AA | 47,4 % | 15ᵉ / 42 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Reasoning (Baseline)
Classements Arena (Elo)
Arena Code · 101 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1682 |
| 2ᵉ | Claude Fable 5 | 1630 |
| 3ᵉ | GPT-5.6 Sol | 1625 |
| ⋯ | ⋯ | |
| 13ᵉ | Muse Spark 1.1 | 1536 |
| 14ᵉ | seed-2.1-pro-preview | 1528 |
| 15ᵉ | Gemini 3.6 Flash | 1526 |
| 16ᵉ | Claude Sonnet 4.6 | 1523 |
| 17ᵉ | GLM-5.1 | 1520 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1505 |
| 3ᵉ | Claude Opus 4.7 | 1502 |
| ⋯ | ⋯ | |
| 10ᵉ | Kimi K3 | 1486 |
| 11ᵉ | GPT-5.6 Sol | 1485 |
| 12ᵉ | Gemini 3.6 Flash | 1485 |
| 13ᵉ | Claude Opus 4.8 | 1484 |
| 14ᵉ | GPT-5.5 | 1482 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| 1,5 $ | 7,5 $ | n.d. | |
| Google Vertex | 1,5 $ | 7,5 $ | 0,15 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 28 % en dessous de la moyenne des LLM similaires, et 3,7 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,42 $ |
| Latence moyenne par benchmark — Benchable | 6 min 01 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Gemini 3.6 Flash se place dans le haut du classement d’Arena text, au 12e rang sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec Claude Fable 5 est faible et les deux modèles sont proches. Dans Arena Code, il occupe le 15e rang sur 101, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Les résultats Benchable en Coding et Mathematics restent élevés. Sa fenêtre d’environ un million de tokens favorise le traitement de contextes particulièrement longs.
Limites et points d'attention. Kimi K3 est nettement devant dans Arena Code. Plusieurs tests Benchable atteignent leur plafond : les scores en Hallucinations, Reasoning et Ethics sont partagés par de nombreux modèles et ne permettent pas de les départager. Email Classification illustre aussi cette saturation, avec un score élevé mais un rang en retrait et largement partagé. Son caractère propriétaire ne convient pas aux usages qui exigent un modèle ouvert. Gemini 3.6 Flash reste pertinent pour les traitements textuels à grand contexte et les projets sensibles aux coûts.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).