Gemini 2.5 Deep Think
Gemini 2.5 Deep Think est un LLM de Google, sorti le 1 août 2025 aux États-Unis. Son évaluation disponible met l’accent sur FrontierMath, un benchmark consacré à des problèmes de mathématiques de recherche particulièrement difficiles.
Gemini 2.5 Deep Think est un LLM de Google, sorti le 1 août 2025 aux États-Unis. Son évaluation disponible met l’accent sur FrontierMath, un benchmark consacré à des problèmes de mathématiques de recherche particulièrement difficiles.
Le modèle obtient des résultats mesurables sur deux versions privées de FrontierMath, dont une sélection Tier 4 plus exigeante. Ces évaluations le placent dans la partie supérieure des classements, sans atteindre les toutes premières positions.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | ▫ n.d. |
| Date de sortie | 1 août 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: FrontierMath-2025-02-28-Private | 29,0 % | 6ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 10,4 % | 8ᵉ / 25 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: FrontierMath-2025-02-28-Private
Epoch: FrontierMath-Tier-4-2025-07-01-Private
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America,United States of America |
Notre analyse
Forces. Gemini 2.5 Deep Think se classe dans le premier tiers sur FrontierMath-2025-02-28-Private, consacré aux mathématiques de recherche très difficiles. Il reste également dans la première moitié du classement sur FrontierMath-Tier-4-2025-07-01-Private, malgré une sélection de problèmes particulièrement exigeante. Cette régularité sur deux évaluations privées concordantes constitue son principal point fort mesuré.
Limites et points d’attention. Les taux de réussite restent minoritaires sur les deux variantes de FrontierMath et chutent nettement sur le Tier 4. Le modèle se situe autour de la vingtième place dans les deux classements, ce qui le maintient à distance des meilleurs systèmes évalués. Ces résultats décrivent donc une capacité réelle en mathématiques de recherche, mais aussi une forte marge d’échec sur les problèmes les plus difficiles. Gemini 2.5 Deep Think présente surtout un intérêt pour les usages centrés sur le raisonnement mathématique avancé et son évaluation.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.