Gemini 2.5 Pro Preview
Gemini 2.5 Pro Preview est un LLM de Google sorti le 5 juin 2025. Âgé d’environ un an, il est déjà ancien à l’échelle de l’IA et doit être replacé parmi les modèles de sa période.
Gemini 2.5 Pro Preview est un LLM de Google sorti le 5 juin 2025. Âgé d’environ un an, il est déjà ancien à l’échelle de l’IA et doit être replacé parmi les modèles de sa période.
À son lancement, il figurait dans le haut du panier de sa génération pour le raisonnement scientifique. Il se distinguait aussi en mathématiques, y compris sur des problèmes de recherche particulièrement difficiles.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | ▫ n.d. |
| Date de sortie | 5 juin 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 95,9 % | 7ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 84,8 % | 15ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 30,0 % | 10ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 10,3 % | 14ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 2,1 % | 15ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: MATH level 5
Epoch: GPQA diamond
Notre analyse
Forces. À sa sortie, Gemini 2.5 Pro Preview appartenait au top 2% des 54 LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Il reste dans le top 10 sur MATH level 5, avec 96%, ainsi que sur la version publique de FrontierMath, consacrée aux mathématiques de recherche très difficiles. Ces résultats situent clairement le modèle parmi les références de sa période pour le raisonnement mathématique et scientifique.
Limites et points d’attention. Son ancienneté d’environ un an est très importante dans un secteur qui évolue rapidement. Ses performances sont aujourd’hui largement dépassées, et cette version Preview est probablement retirée du catalogue de Google. Les épreuves les plus exigeantes révèlent aussi une forte limite : le modèle tombe à 10% sur FrontierMath Private et à 2% sur FrontierMath Tier-4 Private. Le score nul sur Tier-4 Public est partagé par les 15 modèles évalués. Ces benchmarks plafonnés produisent des ex æquo nombreux et ne permettent pas de départager finement les modèles.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.