Gemini 2.5 Flash
Gemini 2.5 Flash est un LLM propriétaire de Google, lancé le 20 mai 2025. Désormais ancien à l’échelle de l’IA, il représentait à sa sortie une option performante de sa génération, notamment grâce à une fenêtre de contexte d’environ un million de tokens.
Gemini 2.5 Flash est un LLM propriétaire de Google, lancé le 20 mai 2025. Désormais ancien à l’échelle de l’IA, il représentait à sa sortie une option performante de sa génération, notamment grâce à une fenêtre de contexte d’environ un million de tokens.
Son positionnement reste avant tout économique : sa tarification se situe 85% sous la moyenne des LLM similaires et environ 18,3 fois sous celle des modèles frontière. Ses connaissances s’arrêtent au 31 janvier 2025 et ses poids ne sont pas ouverts.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🔒 Propriétaire |
| Date de sortie | 20 mai 2025 |
| Connaissances jusqu'à | 2025-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 20.1 | 103ᵉ / 137 |
| Math Index | 73.3 | 21ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Global-MMLU-Lite | 88,4 % | 3ᵉ / 14 | llm-stats | Auto-déclaré |
| AIME 2024 | 88,0 % | 11ᵉ / 52 | llm-stats | Auto-déclaré |
| FACTS Grounding | 85,3 % | 2ᵉ / 13 | llm-stats | Auto-déclaré |
| GPQA | 82,8 % | 61ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMU | 79,7 % | 13ᵉ / 61 | llm-stats | Auto-déclaré |
| AIME 2025 | 72,0 % | 80ᵉ / 108 | llm-stats | Auto-déclaré |
| Vibe-Eval | 65,4 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| LiveCodeBench v5 | 63,9 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 61,9 % | 10ᵉ / 22 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 60,4 % | 76ᵉ / 102 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 56,7 % | 5ᵉ / 10 | llm-stats | Auto-déclaré |
| MRCR | 32,0 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
| SimpleQA | 26,9 % | 27ᵉ / 45 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 11,0 % | 77ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 115ᵉ | grok-3-preview-02-24 | 1412 |
| 116ᵉ | GLM-4.5 | 1411 |
| 117ᵉ | Gemini 2.5 Flash | 1410 |
| 118ᵉ | mistral-medium-2508 | 1410 |
| 119ᵉ | grok-4-0709 | 1410 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 52ᵉ | o3 | 1216 |
| 53ᵉ | Qwen3 VL 235B A22B Instruct | 1215 |
| 54ᵉ | Gemini 2.5 Flash | 1214 |
| 55ᵉ | GPT-4.1 | 1214 |
| 56ᵉ | GPT-5 | 1211 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google Vertex (EU) | 0,3 $ | 2,5 $ | 0,03 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 86 % en dessous de la moyenne des LLM similaires, et 18,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,07 $ |
| Latence moyenne par benchmark — Benchable | 4 min 09 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Gemini 2.5 Flash figurait dans le top 8% des LLM de sa génération sur GPQA. Il obtient aussi des résultats de premier plan en General Knowledge et en Ethics, ainsi qu’un score presque maximal en Email Classification. Son Math Index le place dans la partie haute des modèles évalués sur cet indice. Sa fenêtre de contexte de 1 048 576 tokens constitue un autre trait distinctif, tandis que son prix très inférieur à la moyenne favorise les traitements à grand volume.
Limites et points d’attention. Près d’un an après sa sortie, Gemini 2.5 Flash est largement dépassé par les modèles plus récents et peut déjà ne plus occuper une place active dans le catalogue de Google. Son Intelligence Index se situe dans le bas du classement. Les évaluations Arena text et Arena vision le placent également loin des modèles en tête. Les résultats Benchable en Mathematics et en Coding restent corrects en valeur absolue, mais leurs classements sont modestes. Le classement en Hallucinations demeure lui aussi peu favorable malgré un score élevé, ce qui invite à distinguer le pourcentage brut de la performance relative. Enfin, la coupure des connaissances au 31 janvier 2025 limite la couverture des événements ultérieurs.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).