Gemini 3.6 Flash

Gemini 3.6 Flash est un LLM propriétaire de Google, sorti le 21 juillet 2026. Il se distingue par une fenêtre de contexte de 1 048 576 tokens, soit environ un million, et par des connaissances arrêtées au 31 mars 2026.

Gemini 3.6 Flash est un LLM propriétaire de Google, sorti le 21 juillet 2026. Il se distingue par une fenêtre de contexte de 1 048 576 tokens, soit environ un million, et par des connaissances arrêtées au 31 mars 2026.

Son positionnement est économique : sa tarification se situe 28% sous la moyenne des LLM similaires et environ 3,7 fois sous celle des modèles frontière. Ce rapport entre grand contexte, résultats compétitifs et coût contenu constitue son principal argument.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids🔒 Propriétaire
Date de sortie21 juillet 2026
Connaissances jusqu'à2026-03-31
Multimodaloui
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image,audio,video → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 239benchable✅ Mesuré
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 249benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 257benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %91ᵉ / 263benchable✅ Mesuré
Benchable : Coding (Baseline)96,0 %12ᵉ / 259benchable✅ Mesuré
Benchable : Mathematics (Baseline)95,0 %29ᵉ / 230benchable✅ Mesuré
Benchable : General Knowledge (Baseline)94,0 %201ᵉ / 258benchable✅ Mesuré
Benchable : Instruction Following (Baseline)83,0 %38ᵉ / 261benchable✅ Mesuré
CharXiv-R89,4 %5ᵉ / 47llm-statsAuto-déclaré
OSWorld-Verified83,0 %3ᵉ / 21llm-statsAuto-déclaré
Terminal-Bench 2.178,0 %9ᵉ / 15llm-statsAuto-déclaré
SWE-Bench Pro58,7 %14ᵉ / 43llm-statsAuto-déclaré
MRCR v2 (8-needle)54,0 %7ᵉ / 21llm-statsAuto-déclaré
DeepSWE 1.149,0 %13ᵉ / 18llm-statsn.d.
GDPval-AA47,4 %15ᵉ / 42llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ Gemini 3.6 Flash100 %

Benchable : Reasoning (Baseline)

▶ Gemini 3.6 Flash100 %

Classements Arena (Elo)

Arena Code · 101 modèles classés

RangModèleElo
1ᵉKimi K31682
2ᵉClaude Fable 51630
3ᵉGPT-5.6 Sol1625
13ᵉMuse Spark 1.11536
14ᵉseed-2.1-pro-preview1528
15ᵉGemini 3.6 Flash1526
16ᵉClaude Sonnet 4.61523
17ᵉGLM-5.11520

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61505
3ᵉClaude Opus 4.71502
10ᵉKimi K31486
11ᵉGPT-5.6 Sol1485
12ᵉGemini 3.6 Flash1485
13ᵉClaude Opus 4.81484
14ᵉGPT-5.51482

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
google1,5 $7,5 $n.d.
Google Vertex1,5 $7,5 $0,15 $

Prix en dollars US par million de tokens.

Sa tarification se situe 28 % en dessous de la moyenne des LLM similaires, et 3,7 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,42 $
Latence moyenne par benchmark — Benchable6 min 01 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Gemini 3.6 Flash se place dans le haut du classement d’Arena text, au 12e rang sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec Claude Fable 5 est faible et les deux modèles sont proches. Dans Arena Code, il occupe le 15e rang sur 101, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Les résultats Benchable en Coding et Mathematics restent élevés. Sa fenêtre d’environ un million de tokens favorise le traitement de contextes particulièrement longs.

Limites et points d'attention. Kimi K3 est nettement devant dans Arena Code. Plusieurs tests Benchable atteignent leur plafond : les scores en Hallucinations, Reasoning et Ethics sont partagés par de nombreux modèles et ne permettent pas de les départager. Email Classification illustre aussi cette saturation, avec un score élevé mais un rang en retrait et largement partagé. Son caractère propriétaire ne convient pas aux usages qui exigent un modèle ouvert. Gemini 3.6 Flash reste pertinent pour les traitements textuels à grand contexte et les projets sensibles aux coûts.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).