Gemini 3.1 Pro Preview

Gemini 3.1 Pro Preview est un LLM de Google sorti le 19 février 2026. Sa fenêtre de contexte de 1 048 576 tokens constitue l’un de ses traits marquants, avec un positionnement solide en intelligence générale et en programmation.

Gemini 3.1 Pro Preview est un LLM de Google sorti le 19 février 2026. Sa fenêtre de contexte de 1 048 576 tokens constitue l’un de ses traits marquants, avec un positionnement solide en intelligence générale et en programmation.

Le modèle adopte un tarif économique, inférieur de 4% à la moyenne des LLM similaires et environ 2,8 fois moins élevé que celui des modèles frontière. À sa sortie, il figurait dans le top 4% des LLM de sa génération sur GPQA diamond.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids▫ n.d.
Date de sortie19 février 2026
Multimodaloui
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)audio,file,image,text,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index46.510ᵉ / 137
Code Index68.89ᵉ / 74
Agentic Index21.436ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 155benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)96,0 %13ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)95,9 %15ᵉ / 140benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202595,6 %7ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond94,1 %2ᵉ / 85epoch✅ Mesuré
Benchable : Instruction Following (Baseline)93,9 %5ᵉ / 163benchable✅ Mesuré
LiveBench: Mathematics91,0 %2ᵉ / 7livebench✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public88,9 %1ᵉ / 33epoch✅ Mesuré
LiveBench: Language85,4 %1ᵉ / 7livebench✅ Mesuré
LiveBench: Reasoning84,0 %1ᵉ / 7livebench✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)81,0 %6ᵉ / 19pinchbench✅ Mesuré
LiveBench: IF79,1 %1ᵉ / 7livebench✅ Mesuré
LiveBench: Data Analysis78,5 %1ᵉ / 7livebench✅ Mesuré
Epoch: SimpleQA Verified77,3 %1ᵉ / 26epoch✅ Mesuré
LiveBench: Global average77,1 %1ᵉ / 7livebench✅ Mesuré
LiveBench: Coding76,5 %3ᵉ / 7livebench✅ Mesuré
Epoch: SWE-Bench verified75,6 %4ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private59,6 %6ᵉ / 17epoch✅ Mesuré
Epoch: Chess Puzzles55,0 %3ᵉ / 20epoch✅ Mesuré
LiveBench: Agentic Coding45,4 %4ᵉ / 7livebench✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private36,9 %3ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private26,8 %7ᵉ / 18epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private16,7 %4ᵉ / 25epoch✅ Mesuré
Epoch: EBR-bench14,3 %3ᵉ / 7epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
t2-bench99,3 %1ᵉ / 23llm-statsAuto-déclaré
LiveCodeBench Pro96,2 %1ᵉ / 4llm-statsAuto-déclaré
GPQA94,3 %3ᵉ / 219llm-statsAuto-déclaré
MMMLU92,6 %2ᵉ / 49llm-statsAuto-déclaré
BrowseComp85,9 %8ᵉ / 57llm-statsAuto-déclaré
SWE-Bench Verified80,6 %8ᵉ / 102llm-statsAuto-déclaré
MMMU-Pro80,5 %11ᵉ / 64llm-statsAuto-déclaré
LiveBench79,9 %4ᵉ / 38llm-statsn.d.
ARC-AGI v277,1 %2ᵉ / 16llm-statsAuto-déclaré
MCP Atlas69,2 %18ᵉ / 30llm-statsAuto-déclaré
Terminal-Bench 2.068,5 %12ᵉ / 49llm-statsAuto-déclaré
SciCode59,0 %2ᵉ / 18llm-statsAuto-déclaré
SWE-Bench Pro54,2 %32ᵉ / 41llm-statsAuto-déclaré
Humanity's Last Exam51,4 %16ᵉ / 89llm-statsAuto-déclaré
Finance Agent v243,0 %13ᵉ / 26llm-statsn.d.
FrontierSWE40,0 %9ᵉ / 14llm-statsn.d.
APEX-Agents33,5 %3ᵉ / 7llm-statsAuto-déclaré
GDPval-AA32,5 %34ᵉ / 39llm-statsn.d.
MRCR v2 (8-needle)26,3 %13ᵉ / 19llm-statsAuto-déclaré
Legal Agent Benchmark0,0 %9ᵉ / 12llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Gemini 3.1 Pro Preview46.5
DeepSeek V4 Pro40.8

Code Index

▶ Gemini 3.1 Pro Preview68.8

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text148511ᵉ / 200Claude Fable 5 (1507)
Arena Image-to-Code148215ᵉ / 31Claude Fable 5 (1627)
Arena Code144434ᵉ / 99Kimi K3 (1679)
Arena Document144119ᵉ / 32Claude Opus 4.6 (1508)
Arena Vision127815ᵉ / 135Claude Fable 5 (1318)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Google Vertex2 $12 $0,2 $
google2,5 $15 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)26,43 $
Durée d'exécution — PinchBench2 h 50 min
Indice valeur/coût — PinchBench5,23
Coût moyen par benchmark — Benchable0,7 $
Latence moyenne par benchmark — Benchable22 min 11 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Gemini 3.1 Pro Preview se classe dans le top 10 de l’Intelligence Index et du Code Index. Dans l’Arena text, il occupe la 11e place sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier est faible, les deux modèles sont proches en duel. Sa grande fenêtre de contexte et son tarif économique renforcent son intérêt pour le traitement de longs contenus et les tâches de programmation à coût contenu.

Limites et points d’attention. L’Agentic Index le situe en retrait, à la 36e place sur 68. Dans l’Arena image-to-code, il se classe 15e sur 31, derrière Claude Fable 5 et deux entrées Claude Opus 4.7. Le premier est nettement devant. Dans l’Arena code, il tombe à la 34e place sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. L’écart avec Kimi K3 est important. Les résultats Benchable sont largement plafonnés et départagent peu les modèles. Gemini 3.1 Pro Preview reste pertinent pour le texte, les longs contextes et le code à coût maîtrisé. Pour un résultat plus abouti en programmation, on lui préférera Kimi K3, Claude Fable 5 ou GPT-5.6 Sol.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).