Gemini 3 Flash
Gemini 3 Flash est un LLM propriétaire de Google, lancé le 17 décembre 2025. Il se distingue par une fenêtre de contexte d’environ un million de tokens et par un positionnement très économique, avec des tarifs inférieurs de 75% à la moyenne des modèles similaires.
Gemini 3 Flash est un LLM propriétaire de Google, lancé le 17 décembre 2025. Il se distingue par une fenêtre de contexte d’environ un million de tokens et par un positionnement très économique, avec des tarifs inférieurs de 75% à la moyenne des modèles similaires.
À sa sortie, il figurait dans le top 17% des LLM de sa génération sur GPQA diamond. Son profil associe de solides résultats en connaissances générales et en mathématiques de niveau lycée à un coût environ onze fois inférieur à celui des modèles frontière. Ses connaissances s’arrêtent au 31 janvier 2025.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🔒 Propriétaire |
| Date de sortie | 17 décembre 2025 |
| Connaissances jusqu'à | 2025-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,audio,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 27.4 | 72ᵉ / 137 |
| Math Index | 55.7 | 28ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 99,7 % | 7ᵉ / 108 | llm-stats | Auto-déclaré |
| Global PIQA | 92,8 % | 2ᵉ / 13 | llm-stats | Auto-déclaré |
| MMMLU | 91,8 % | 3ᵉ / 49 | llm-stats | Auto-déclaré |
| GPQA | 90,4 % | 18ᵉ / 219 | llm-stats | Auto-déclaré |
| t2-bench | 90,2 % | 2ᵉ / 23 | llm-stats | Auto-déclaré |
| VideoMMMU | 86,9 % | 2ᵉ / 26 | llm-stats | Auto-déclaré |
| MMMU-Pro | 81,2 % | 7ᵉ / 64 | llm-stats | Auto-déclaré |
| CharXiv-R | 80,3 % | 19ᵉ / 45 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 78,0 % | 19ᵉ / 102 | llm-stats | Auto-déclaré |
| LiveCodeBench Pro | 77,2 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| LiveBench | 72,4 % | 24ᵉ / 38 | llm-stats | n.d. |
| ScreenSpot Pro | 69,1 % | 8ᵉ / 23 | llm-stats | Auto-déclaré |
| SimpleQA | 68,7 % | 7ᵉ / 45 | llm-stats | Auto-déclaré |
| FACTS Grounding | 61,9 % | 10ᵉ / 13 | llm-stats | Auto-déclaré |
| MCP Atlas | 57,4 % | 28ᵉ / 30 | llm-stats | Auto-déclaré |
| Toolathlon | 49,4 % | 14ᵉ / 30 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 47,6 % | 37ᵉ / 49 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 43,5 % | 27ᵉ / 89 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 42,5 % | 14ᵉ / 26 | llm-stats | n.d. |
| ARC-AGI v2 | 33,6 % | 11ᵉ / 16 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 22,1 % | 16ᵉ / 19 | llm-stats | Auto-déclaré |
| Legal Agent Benchmark | 0,0 % | 9ᵉ / 12 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1473 | 22ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1459 | 42ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Image-to-Code | 1457 | 18ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1437 | 38ᵉ / 99 | Kimi K3 (1679) |
| Arena Image-to-Code | 1426 | 23ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Document | 1413 | 28ᵉ / 32 | Claude Opus 4.6 (1508) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google Vertex | 0,5 $ | 3 $ | 0,05 $ |
| 0,5 $ | 3 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 76 % en dessous de la moyenne des LLM similaires, et 11 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 4,99 $ |
| Durée d'exécution — PinchBench | 3 h 17 min |
| Indice valeur/coût — PinchBench | 25,88 |
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 2 min 00 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Gemini 3 Flash atteint la première place sur les évaluations Benchable consacrées aux connaissances générales, à l’éthique et aux hallucinations. Il se classe aussi parmi les meilleurs sur OTIS Mock AIME 2024-2025, qui mesure la résolution de problèmes d’olympiades mathématiques de niveau lycée. Ses résultats dans Arena text le placent dans le haut du classement, même si sa position varie entre les deux mesures disponibles. Sa fenêtre de contexte de 1 048 576 tokens constitue un autre trait distinctif. Enfin, son prix très inférieur à la moyenne rend l’usage intensif nettement plus économique que celui des modèles haut de gamme.
Limites et points d’attention. L’Intelligence Index situe le modèle près du milieu du classement, tandis que le Math Index reste intermédiaire malgré son excellent résultat sur OTIS Mock AIME. Le benchmark Mathematics (Baseline) confirme ce contraste, avec un score élevé mais un rang moins favorable. La classification d’e-mails se situe dans la seconde moitié du classement, tout comme Arena image-to-code. Les connaissances sont arrêtées au 31 janvier 2025, ce qui limite la prise en compte des événements ultérieurs. Gemini 3 Flash convient surtout aux traitements à grand contexte, aux tâches de connaissances générales et aux problèmes mathématiques, lorsque le coût constitue un critère central.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).