Gemini 3 Flash

Gemini 3 Flash est un LLM propriétaire de Google, lancé le 17 décembre 2025. Il se distingue par une fenêtre de contexte d’environ un million de tokens et par un positionnement très économique, avec des tarifs inférieurs de 75% à la moyenne des modèles similaires.

Gemini 3 Flash est un LLM propriétaire de Google, lancé le 17 décembre 2025. Il se distingue par une fenêtre de contexte d’environ un million de tokens et par un positionnement très économique, avec des tarifs inférieurs de 75% à la moyenne des modèles similaires.

À sa sortie, il figurait dans le top 17% des LLM de sa génération sur GPQA diamond. Son profil associe de solides résultats en connaissances générales et en mathématiques de niveau lycée à un coût environ onze fois inférieur à celui des modèles frontière. Ses connaissances s’arrêtent au 31 janvier 2025.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids🔒 Propriétaire
Date de sortie17 décembre 2025
Connaissances jusqu'à2025-01-31
Multimodaloui
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image,audio,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index27.472ᵉ / 137
Math Index55.728ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202599,7 %7ᵉ / 108llm-statsAuto-déclaré
Global PIQA92,8 %2ᵉ / 13llm-statsAuto-déclaré
MMMLU91,8 %3ᵉ / 49llm-statsAuto-déclaré
GPQA90,4 %18ᵉ / 219llm-statsAuto-déclaré
t2-bench90,2 %2ᵉ / 23llm-statsAuto-déclaré
VideoMMMU86,9 %2ᵉ / 26llm-statsAuto-déclaré
MMMU-Pro81,2 %7ᵉ / 64llm-statsAuto-déclaré
CharXiv-R80,3 %19ᵉ / 45llm-statsAuto-déclaré
SWE-Bench Verified78,0 %19ᵉ / 102llm-statsAuto-déclaré
LiveCodeBench Pro77,2 %4ᵉ / 4llm-statsAuto-déclaré
LiveBench72,4 %24ᵉ / 38llm-statsn.d.
ScreenSpot Pro69,1 %8ᵉ / 23llm-statsAuto-déclaré
SimpleQA68,7 %7ᵉ / 45llm-statsAuto-déclaré
FACTS Grounding61,9 %10ᵉ / 13llm-statsAuto-déclaré
MCP Atlas57,4 %28ᵉ / 30llm-statsAuto-déclaré
Toolathlon49,4 %14ᵉ / 30llm-statsAuto-déclaré
Terminal-Bench 2.047,6 %37ᵉ / 49llm-statsAuto-déclaré
Humanity's Last Exam43,5 %27ᵉ / 89llm-statsAuto-déclaré
Finance Agent v242,5 %14ᵉ / 26llm-statsn.d.
ARC-AGI v233,6 %11ᵉ / 16llm-statsAuto-déclaré
MRCR v2 (8-needle)22,1 %16ᵉ / 19llm-statsAuto-déclaré
Legal Agent Benchmark0,0 %9ᵉ / 12llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Gemini 3 Flash27.4
Nova 2.0 Pro Preview21.8

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Gemini 3 Flash55.7

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text147322ᵉ / 200Claude Fable 5 (1507)
Arena Text145942ᵉ / 200Claude Fable 5 (1507)
Arena Image-to-Code145718ᵉ / 31Claude Fable 5 (1627)
Arena Code143738ᵉ / 99Kimi K3 (1679)
Arena Image-to-Code142623ᵉ / 31Claude Fable 5 (1627)
Arena Document141328ᵉ / 32Claude Opus 4.6 (1508)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Google Vertex0,5 $3 $0,05 $
google0,5 $3 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 76 % en dessous de la moyenne des LLM similaires, et 11 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)4,99 $
Durée d'exécution — PinchBench3 h 17 min
Indice valeur/coût — PinchBench25,88
Coût moyen par benchmark — Benchable0,03 $
Latence moyenne par benchmark — Benchable2 min 00 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Gemini 3 Flash atteint la première place sur les évaluations Benchable consacrées aux connaissances générales, à l’éthique et aux hallucinations. Il se classe aussi parmi les meilleurs sur OTIS Mock AIME 2024-2025, qui mesure la résolution de problèmes d’olympiades mathématiques de niveau lycée. Ses résultats dans Arena text le placent dans le haut du classement, même si sa position varie entre les deux mesures disponibles. Sa fenêtre de contexte de 1 048 576 tokens constitue un autre trait distinctif. Enfin, son prix très inférieur à la moyenne rend l’usage intensif nettement plus économique que celui des modèles haut de gamme.

Limites et points d’attention. L’Intelligence Index situe le modèle près du milieu du classement, tandis que le Math Index reste intermédiaire malgré son excellent résultat sur OTIS Mock AIME. Le benchmark Mathematics (Baseline) confirme ce contraste, avec un score élevé mais un rang moins favorable. La classification d’e-mails se situe dans la seconde moitié du classement, tout comme Arena image-to-code. Les connaissances sont arrêtées au 31 janvier 2025, ce qui limite la prise en compte des événements ultérieurs. Gemini 3 Flash convient surtout aux traitements à grand contexte, aux tâches de connaissances générales et aux problèmes mathématiques, lorsque le coût constitue un critère central.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).