Gemini 2.0 Pro Exp

Avec environ un an d’ancienneté, Gemini 2.0 Pro Exp est déjà très ancien à l’échelle de l’IA. Ce LLM de Google, lancé le 5 février 2025, appartient à une génération rapidement dépassée par le rythme de renouvellement des modèles.

Avec environ un an d’ancienneté, Gemini 2.0 Pro Exp est déjà très ancien à l’échelle de l’IA. Ce LLM de Google, lancé le 5 février 2025, appartient à une génération rapidement dépassée par le rythme de renouvellement des modèles.

À sa sortie, Gemini 2.0 Pro Exp se distinguait surtout par ses résultats en sciences et en mathématiques. Il figurait dans le haut du panier de sa génération sur GPQA diamond, mais échouait sur les problèmes de mathématiques de recherche les plus difficiles.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids▫ n.d.
Date de sortie5 février 2025

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 583,5 %14ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond65,7 %35ᵉ / 85epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: MATH level 5

GPT-598 %
▶ Gemini 2.0 Pro Exp83 %

Epoch: GPQA diamond

▶ Gemini 2.0 Pro Exp66 %

Notre analyse

Forces. À sa sortie, Gemini 2.0 Pro Exp figurait dans le top 9% des 45 LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Ce classement en faisait alors un modèle particulièrement solide pour ce type de raisonnement. Sur MATH level 5, son score de 83% le place encore dans le premier quart du classement considéré, avec une 14e place sur 59.

Limites et points d’attention. Son positionnement s’est érodé avec l’arrivée de modèles plus récents. Sur GPQA diamond, il occupe désormais le milieu du tableau, au 35e rang sur 85. FrontierMath révèle une limite plus nette sur les mathématiques de recherche très difficiles : le modèle obtient 0% et partage la 17e place avec 16 autres modèles. Ce benchmark plafonné reste toutefois peu discriminant dans ce cas. Après environ un an, ses performances sont probablement largement dépassées, et les modèles de cet âge sont souvent retirés du catalogue de leur éditeur.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.