Gemini 2.5 Pro
Publié par Google le 20 mai 2025, Gemini 2.5 Pro est un LLM propriétaire dont les poids ne sont pas ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux références actuelles.
Publié par Google le 20 mai 2025, Gemini 2.5 Pro est un LLM propriétaire dont les poids ne sont pas ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux références actuelles.
À sa sortie, il figurait dans le top 1 % de sa génération sur GPQA diamond. Sa fenêtre de contexte d’environ 1,0 million de tokens reste marquante. Son autre avantage est économique, avec une tarification inférieure de 37 % à la moyenne des LLM similaires et environ 4,4 fois moins élevée que celle des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🔒 Propriétaire |
| Date de sortie | 20 mai 2025 |
| Connaissances jusqu'à | 2025-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 25.8 | 75ᵉ / 137 |
| Code Index | 33.3 | 56ᵉ / 74 |
| Agentic Index | 7.1 | 55ᵉ / 68 |
| Math Index | 87.7 | 12ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MRCR | 93,0 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| AIME 2024 | 92,0 % | 5ᵉ / 52 | llm-stats | Auto-déclaré |
| Global-MMLU-Lite | 88,6 % | 2ᵉ / 14 | llm-stats | Auto-déclaré |
| Video-MME | 84,8 % | 7ᵉ / 17 | llm-stats | Auto-déclaré |
| AIME 2025 | 83,0 % | 60ᵉ / 108 | llm-stats | Auto-déclaré |
| GPQA | 83,0 % | 60ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMU | 79,6 % | 14ᵉ / 61 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 76,5 % | 4ᵉ / 22 | llm-stats | Auto-déclaré |
| LiveCodeBench v5 | 75,6 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 72,7 % | 2ᵉ / 10 | llm-stats | Auto-déclaré |
| Vibe-Eval | 65,6 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 63,2 % | 74ᵉ / 102 | llm-stats | Auto-déclaré |
| SimpleQA | 50,8 % | 14ᵉ / 45 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 17,8 % | 60ᵉ / 89 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 4,9 % | 16ᵉ / 16 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1446 | 59ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Document | 1422 | 24ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Image-to-Code | 1276 | 31ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Vision | 1245 | 34ᵉ / 135 | Claude Fable 5 (1318) |
| Arena Code | 1204 | 93ᵉ / 99 | Kimi K3 (1679) |
| Arena Text-to-Speech | 1113 | 34ᵉ / 88 | Gemini 3.1 Flash TTS (1309) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google Vertex (Global) | 1,25 $ | 10 $ | 0,125 $ |
| 1,25 $ | 10 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 1,19 $ |
| Latence moyenne par benchmark — Benchable | 28 min 11 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Gemini 2.5 Pro se distinguait à sa sortie par ses résultats en raisonnement scientifique sur GPQA diamond. Les évaluations plus récentes confirment surtout une solide aptitude mathématique, avec un Math Index situé parmi les meilleurs du panel. Le modèle atteint également le top 10 sur Coding (Baseline), ainsi que la première place sur Ethics (Baseline). Sa très grande fenêtre de contexte favorise le traitement de volumes importants de texte. Son prix constitue enfin un avantage net, particulièrement face aux modèles haut de gamme.
Limites et points d’attention. Son classement global est désormais modeste, avec un Intelligence Index en milieu de tableau. Le Code Index et l’Agentic Index le placent dans le bas de leurs classements respectifs, ce qui nuance son excellent résultat sur Coding (Baseline). Les évaluations Arena sont également défavorables : le modèle reste loin de la tête en texte, descend dans le dernier quart en document et termine dernier en image-to-code. Son score sur Hallucinations (Baseline) ne le distingue pas du milieu du classement. Compte tenu de son ancienneté, ses performances sont aujourd’hui probablement dépassées et ce type de modèle est souvent retiré du catalogue de l’éditeur.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).