Gemini 3 Pro
Gemini 3 Pro est un LLM propriétaire de Google, lancé le 18 novembre 2025. À sa sortie, il se classait dans le top 1 % des modèles de sa génération sur GPQA diamond, avec un positionnement particulièrement solide en sciences, en mathématiques difficiles et en exactitude factuelle.
Gemini 3 Pro est un LLM propriétaire de Google, lancé le 18 novembre 2025. À sa sortie, il se classait dans le top 1 % des modèles de sa génération sur GPQA diamond, avec un positionnement particulièrement solide en sciences, en mathématiques difficiles et en exactitude factuelle.
Sa fenêtre de contexte atteint 1 048 576 tokens, tandis que ses connaissances couvrent les informations jusqu’au 31 janvier 2025. Son tarif est économique et se situe dans la moyenne des LLM similaires, à un niveau environ 2,8 fois inférieur à celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🔒 Propriétaire |
| Date de sortie | 18 novembre 2025 |
| Connaissances jusqu'à | 2025-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,audio,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 33.1 | 48ᵉ / 137 |
| Math Index | 86.7 | 14ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 100,0 % | 1ᵉ / 108 | llm-stats | Auto-déclaré |
| Global PIQA | 93,4 % | 1ᵉ / 13 | llm-stats | Auto-déclaré |
| GPQA | 91,9 % | 14ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMLU | 91,8 % | 3ᵉ / 49 | llm-stats | Auto-déclaré |
| VideoMMMU | 87,6 % | 1ᵉ / 26 | llm-stats | Auto-déclaré |
| t2-bench | 85,4 % | 7ᵉ / 23 | llm-stats | Auto-déclaré |
| CharXiv-R | 81,4 % | 16ᵉ / 45 | llm-stats | Auto-déclaré |
| LiveCodeBench Pro | 81,3 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| MMMU-Pro | 81,0 % | 9ᵉ / 64 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 76,2 % | 32ᵉ / 102 | llm-stats | Auto-déclaré |
| LiveBench | 73,4 % | 21ᵉ / 38 | llm-stats | n.d. |
| ScreenSpot Pro | 72,7 % | 5ᵉ / 23 | llm-stats | Auto-déclaré |
| SimpleQA | 72,1 % | 6ᵉ / 45 | llm-stats | Auto-déclaré |
| FACTS Grounding | 70,5 % | 8ᵉ / 13 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 54,2 % | 30ᵉ / 49 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 45,8 % | 25ᵉ / 89 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 31,1 % | 12ᵉ / 16 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 26,3 % | 13ᵉ / 19 | llm-stats | Auto-déclaré |
| MathArena Apex | 23,4 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1486 | 8ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Image-to-Code | 1453 | 19ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1439 | 36ᵉ / 99 | Kimi K3 (1679) |
| Arena Document | 1434 | 21ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Vision | 1289 | 7ᵉ / 135 | Claude Fable 5 (1318) |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Matériel | Google TPU v7 Ironwood |
| Pays | United States of America |
Notre analyse
Forces. Gemini 3 Pro figure dans le top 10 sur GPQA diamond (questions scientifiques de niveau doctorat) et FrontierMath Public (mathématiques de recherche très difficiles). Son résultat élevé sur OTIS Mock AIME confirme de bonnes aptitudes en résolution de problèmes mathématiques de niveau olympiade. Il se place aussi presque en tête sur SimpleQA Verified, ce qui souligne sa capacité à fournir des réponses factuelles vérifiables. Dans Arena text, il appartient au groupe de tête face à 200 modèles. Sa très grande fenêtre de contexte constitue un autre atout pour traiter d’importants volumes de texte dans une même requête.
Limites et points d’attention. Son Intelligence Index reste nettement moins bien classé que ses meilleurs résultats spécialisés, signe d’un profil plus convaincant sur certaines tâches que sur l’ensemble des capacités évaluées. Les performances en programmation sont moins dominantes : SWE-Bench verified le situe dans la seconde moitié du classement, Arena code loin des premiers et Arena image-to-code au milieu du tableau. Le résultat sur FrontierMath Private est également bien inférieur à celui obtenu sur la partie publique. Les poids ne sont pas ouverts et les connaissances s’arrêtent au 31 janvier 2025. Le modèle convient surtout aux usages textuels, scientifiques, mathématiques et factuels exigeant un contexte très étendu.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.