Gemini 2.5 Pro

Publié par Google le 20 mai 2025, Gemini 2.5 Pro est un LLM propriétaire dont les poids ne sont pas ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux références actuelles.

Publié par Google le 20 mai 2025, Gemini 2.5 Pro est un LLM propriétaire dont les poids ne sont pas ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux références actuelles.

À sa sortie, il figurait dans le top 1 % de sa génération sur GPQA diamond. Sa fenêtre de contexte d’environ 1,0 million de tokens reste marquante. Son autre avantage est économique, avec une tarification inférieure de 37 % à la moyenne des LLM similaires et environ 4,4 fois moins élevée que celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids🔒 Propriétaire
Date de sortie20 mai 2025
Connaissances jusqu'à2025-01-31
Multimodaloui
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index25.875ᵉ / 137
Code Index33.356ᵉ / 74
Agentic Index7.155ᵉ / 68
Math Index87.712ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MRCR93,0 %1ᵉ / 7llm-statsAuto-déclaré
AIME 202492,0 %5ᵉ / 52llm-statsAuto-déclaré
Global-MMLU-Lite88,6 %2ᵉ / 14llm-statsAuto-déclaré
Video-MME84,8 %7ᵉ / 17llm-statsAuto-déclaré
AIME 202583,0 %60ᵉ / 108llm-statsAuto-déclaré
GPQA83,0 %60ᵉ / 219llm-statsAuto-déclaré
MMMU79,6 %14ᵉ / 61llm-statsAuto-déclaré
Aider-Polyglot76,5 %4ᵉ / 22llm-statsAuto-déclaré
LiveCodeBench v575,6 %1ᵉ / 9llm-statsAuto-déclaré
Aider-Polyglot Edit72,7 %2ᵉ / 10llm-statsAuto-déclaré
Vibe-Eval65,6 %2ᵉ / 8llm-statsAuto-déclaré
SWE-Bench Verified63,2 %74ᵉ / 102llm-statsAuto-déclaré
SimpleQA50,8 %14ᵉ / 45llm-statsAuto-déclaré
Humanity's Last Exam17,8 %60ᵉ / 89llm-statsAuto-déclaré
ARC-AGI v24,9 %16ᵉ / 16llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Gemini 2.5 Pro25.8
Nova 2.0 Pro Preview21.8

Code Index

Nova 2.0 Pro Preview34.0
▶ Gemini 2.5 Pro33.3

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text144659ᵉ / 200Claude Fable 5 (1507)
Arena Document142224ᵉ / 32Claude Opus 4.6 (1508)
Arena Image-to-Code127631ᵉ / 31Claude Fable 5 (1627)
Arena Vision124534ᵉ / 135Claude Fable 5 (1318)
Arena Code120493ᵉ / 99Kimi K3 (1679)
Arena Text-to-Speech111334ᵉ / 88Gemini 3.1 Flash TTS (1309)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Google Vertex (Global)1,25 $10 $0,125 $
google1,25 $10 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable1,19 $
Latence moyenne par benchmark — Benchable28 min 11 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Gemini 2.5 Pro se distinguait à sa sortie par ses résultats en raisonnement scientifique sur GPQA diamond. Les évaluations plus récentes confirment surtout une solide aptitude mathématique, avec un Math Index situé parmi les meilleurs du panel. Le modèle atteint également le top 10 sur Coding (Baseline), ainsi que la première place sur Ethics (Baseline). Sa très grande fenêtre de contexte favorise le traitement de volumes importants de texte. Son prix constitue enfin un avantage net, particulièrement face aux modèles haut de gamme.

Limites et points d’attention. Son classement global est désormais modeste, avec un Intelligence Index en milieu de tableau. Le Code Index et l’Agentic Index le placent dans le bas de leurs classements respectifs, ce qui nuance son excellent résultat sur Coding (Baseline). Les évaluations Arena sont également défavorables : le modèle reste loin de la tête en texte, descend dans le dernier quart en document et termine dernier en image-to-code. Son score sur Hallucinations (Baseline) ne le distingue pas du milieu du classement. Compte tenu de son ancienneté, ses performances sont aujourd’hui probablement dépassées et ce type de modèle est souvent retiré du catalogue de l’éditeur.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).