Gemini 3 Pro

Gemini 3 Pro est un LLM propriétaire de Google, lancé le 18 novembre 2025. À sa sortie, il se classait dans le top 1 % des modèles de sa génération sur GPQA diamond, avec un positionnement particulièrement solide en sciences, en mathématiques difficiles et en exactitude factuelle.

Gemini 3 Pro est un LLM propriétaire de Google, lancé le 18 novembre 2025. À sa sortie, il se classait dans le top 1 % des modèles de sa génération sur GPQA diamond, avec un positionnement particulièrement solide en sciences, en mathématiques difficiles et en exactitude factuelle.

Sa fenêtre de contexte atteint 1 048 576 tokens, tandis que ses connaissances couvrent les informations jusqu’au 31 janvier 2025. Son tarif est économique et se situe dans la moyenne des LLM similaires, à un niveau environ 2,8 fois inférieur à celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids🔒 Propriétaire
Date de sortie18 novembre 2025
Connaissances jusqu'à2025-01-31
Multimodaloui
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image,audio,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index33.148ᵉ / 137
Math Index86.714ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 2025100,0 %1ᵉ / 108llm-statsAuto-déclaré
Global PIQA93,4 %1ᵉ / 13llm-statsAuto-déclaré
GPQA91,9 %14ᵉ / 219llm-statsAuto-déclaré
MMMLU91,8 %3ᵉ / 49llm-statsAuto-déclaré
VideoMMMU87,6 %1ᵉ / 26llm-statsAuto-déclaré
t2-bench85,4 %7ᵉ / 23llm-statsAuto-déclaré
CharXiv-R81,4 %16ᵉ / 45llm-statsAuto-déclaré
LiveCodeBench Pro81,3 %2ᵉ / 4llm-statsAuto-déclaré
MMMU-Pro81,0 %9ᵉ / 64llm-statsAuto-déclaré
SWE-Bench Verified76,2 %32ᵉ / 102llm-statsAuto-déclaré
LiveBench73,4 %21ᵉ / 38llm-statsn.d.
ScreenSpot Pro72,7 %5ᵉ / 23llm-statsAuto-déclaré
SimpleQA72,1 %6ᵉ / 45llm-statsAuto-déclaré
FACTS Grounding70,5 %8ᵉ / 13llm-statsAuto-déclaré
Terminal-Bench 2.054,2 %30ᵉ / 49llm-statsAuto-déclaré
Humanity's Last Exam45,8 %25ᵉ / 89llm-statsAuto-déclaré
ARC-AGI v231,1 %12ᵉ / 16llm-statsAuto-déclaré
MRCR v2 (8-needle)26,3 %13ᵉ / 19llm-statsAuto-déclaré
MathArena Apex23,4 %7ᵉ / 7llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ Gemini 3 Pro33.1
Qwen3.5 397B A17B32.0

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Gemini 3 Pro86.7

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text14868ᵉ / 200Claude Fable 5 (1507)
Arena Image-to-Code145319ᵉ / 31Claude Fable 5 (1627)
Arena Code143936ᵉ / 99Kimi K3 (1679)
Arena Document143421ᵉ / 32Claude Opus 4.6 (1508)
Arena Vision12897ᵉ / 135Claude Fable 5 (1318)

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
MatérielGoogle TPU v7 Ironwood
PaysUnited States of America

Notre analyse

Forces. Gemini 3 Pro figure dans le top 10 sur GPQA diamond (questions scientifiques de niveau doctorat) et FrontierMath Public (mathématiques de recherche très difficiles). Son résultat élevé sur OTIS Mock AIME confirme de bonnes aptitudes en résolution de problèmes mathématiques de niveau olympiade. Il se place aussi presque en tête sur SimpleQA Verified, ce qui souligne sa capacité à fournir des réponses factuelles vérifiables. Dans Arena text, il appartient au groupe de tête face à 200 modèles. Sa très grande fenêtre de contexte constitue un autre atout pour traiter d’importants volumes de texte dans une même requête.

Limites et points d’attention. Son Intelligence Index reste nettement moins bien classé que ses meilleurs résultats spécialisés, signe d’un profil plus convaincant sur certaines tâches que sur l’ensemble des capacités évaluées. Les performances en programmation sont moins dominantes : SWE-Bench verified le situe dans la seconde moitié du classement, Arena code loin des premiers et Arena image-to-code au milieu du tableau. Le résultat sur FrontierMath Private est également bien inférieur à celui obtenu sur la partie publique. Les poids ne sont pas ouverts et les connaissances s’arrêtent au 31 janvier 2025. Le modèle convient surtout aux usages textuels, scientifiques, mathématiques et factuels exigeant un contexte très étendu.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.