gemini-2.5-pro-preview-03-25

gemini-2.5-pro-preview-03-25 est un grand modèle de langage de Google. Son profil Benchable se distingue surtout en programmation et en mathématiques, où ses positions relatives sont meilleures que dans les autres épreuves évaluées.

gemini-2.5-pro-preview-03-25 est un grand modèle de langage de Google. Son profil Benchable se distingue surtout en programmation et en mathématiques, où ses positions relatives sont meilleures que dans les autres épreuves évaluées.

Le modèle obtient aussi des scores bruts élevés en éthique, connaissances générales, classification d’e-mails et hallucinations. Ces résultats demandent toutefois une lecture prudente : chaque benchmark est plafonné et réunit plusieurs modèles au même niveau, ce qui réduit sa capacité à les départager.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,8 %43ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Hallucinations (Baseline)96,0 %67ᵉ / 146benchable✅ Mesuré
Benchable : Coding (Baseline)96,0 %7ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)95,8 %18ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)84,0 %19ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ gemini-2.5-pro-preview-…100 %
command-r-plus-08-202499 %

Benchable : General Knowledge (Baseline)

▶ gemini-2.5-pro-preview-…100 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable1,04 $
Latence moyenne par benchmark — Benchable29 min 21 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. La programmation constitue le résultat le plus solide de gemini-2.5-pro-preview-03-25 : il partage la 7e place du benchmark Coding avec cinq autres modèles, sur 162 participants. Il atteint aussi la 18e place en Mathematics, à égalité avec un autre modèle sur 140. Ce profil place ses résultats techniques devant ses positions en connaissances générales, classification d’e-mails et hallucinations. En Ethics, le score maximal est atteint, mais il est partagé avec 71 autres modèles.

Limites et points d'attention. Les scores bruts élevés masquent des classements moins favorables sur plusieurs tâches. En General Knowledge, le modèle partage la 43e place malgré un score maximal. Il partage la 55e place en Email Classification et la 67e en Hallucinations. Cette dernière épreuve constitue son classement relatif le plus faible. Les six benchmarks sont plafonnés et comportent de nombreux ex æquo, notamment 42 autres modèles au même niveau en Email Classification. Ils distinguent donc imparfaitement gemini-2.5-pro-preview-03-25 des modèles affichant des scores voisins.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).