Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview est un LLM de Google sorti le 19 février 2026. Sa fenêtre de contexte de 1 048 576 tokens constitue l’un de ses traits marquants, avec un positionnement solide en intelligence générale et en programmation.
Gemini 3.1 Pro Preview est un LLM de Google sorti le 19 février 2026. Sa fenêtre de contexte de 1 048 576 tokens constitue l’un de ses traits marquants, avec un positionnement solide en intelligence générale et en programmation.
Le modèle adopte un tarif économique, inférieur de 4% à la moyenne des LLM similaires et environ 2,8 fois moins élevé que celui des modèles frontière. À sa sortie, il figurait dans le top 4% des LLM de sa génération sur GPQA diamond.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | ▫ n.d. |
| Date de sortie | 19 février 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | audio,file,image,text,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 46.5 | 10ᵉ / 137 |
| Code Index | 68.8 | 9ᵉ / 74 |
| Agentic Index | 21.4 | 36ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 96,0 % | 13ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 95,9 % | 15ᵉ / 140 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 95,6 % | 7ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 94,1 % | 2ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 93,9 % | 5ᵉ / 163 | benchable | ✅ Mesuré |
| LiveBench: Mathematics | 91,0 % | 2ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 88,9 % | 1ᵉ / 33 | epoch | ✅ Mesuré |
| LiveBench: Language | 85,4 % | 1ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Reasoning | 84,0 % | 1ᵉ / 7 | livebench | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 81,0 % | 6ᵉ / 19 | pinchbench | ✅ Mesuré |
| LiveBench: IF | 79,1 % | 1ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Data Analysis | 78,5 % | 1ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: SimpleQA Verified | 77,3 % | 1ᵉ / 26 | epoch | ✅ Mesuré |
| LiveBench: Global average | 77,1 % | 1ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Coding | 76,5 % | 3ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: SWE-Bench verified | 75,6 % | 4ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 59,6 % | 6ᵉ / 17 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 55,0 % | 3ᵉ / 20 | epoch | ✅ Mesuré |
| LiveBench: Agentic Coding | 45,4 % | 4ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 36,9 % | 3ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 26,8 % | 7ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 16,7 % | 4ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: EBR-bench | 14,3 % | 3ᵉ / 7 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| t2-bench | 99,3 % | 1ᵉ / 23 | llm-stats | Auto-déclaré |
| LiveCodeBench Pro | 96,2 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| GPQA | 94,3 % | 3ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMLU | 92,6 % | 2ᵉ / 49 | llm-stats | Auto-déclaré |
| BrowseComp | 85,9 % | 8ᵉ / 57 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 80,6 % | 8ᵉ / 102 | llm-stats | Auto-déclaré |
| MMMU-Pro | 80,5 % | 11ᵉ / 64 | llm-stats | Auto-déclaré |
| LiveBench | 79,9 % | 4ᵉ / 38 | llm-stats | n.d. |
| ARC-AGI v2 | 77,1 % | 2ᵉ / 16 | llm-stats | Auto-déclaré |
| MCP Atlas | 69,2 % | 18ᵉ / 30 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 68,5 % | 12ᵉ / 49 | llm-stats | Auto-déclaré |
| SciCode | 59,0 % | 2ᵉ / 18 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 54,2 % | 32ᵉ / 41 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 51,4 % | 16ᵉ / 89 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 43,0 % | 13ᵉ / 26 | llm-stats | n.d. |
| FrontierSWE | 40,0 % | 9ᵉ / 14 | llm-stats | n.d. |
| APEX-Agents | 33,5 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| GDPval-AA | 32,5 % | 34ᵉ / 39 | llm-stats | n.d. |
| MRCR v2 (8-needle) | 26,3 % | 13ᵉ / 19 | llm-stats | Auto-déclaré |
| Legal Agent Benchmark | 0,0 % | 9ᵉ / 12 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1485 | 11ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Image-to-Code | 1482 | 15ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1444 | 34ᵉ / 99 | Kimi K3 (1679) |
| Arena Document | 1441 | 19ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Vision | 1278 | 15ᵉ / 135 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google Vertex | 2 $ | 12 $ | 0,2 $ |
| 2,5 $ | 15 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 26,43 $ |
| Durée d'exécution — PinchBench | 2 h 50 min |
| Indice valeur/coût — PinchBench | 5,23 |
| Coût moyen par benchmark — Benchable | 0,7 $ |
| Latence moyenne par benchmark — Benchable | 22 min 11 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Gemini 3.1 Pro Preview se classe dans le top 10 de l’Intelligence Index et du Code Index. Dans l’Arena text, il occupe la 11e place sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier est faible, les deux modèles sont proches en duel. Sa grande fenêtre de contexte et son tarif économique renforcent son intérêt pour le traitement de longs contenus et les tâches de programmation à coût contenu.
Limites et points d’attention. L’Agentic Index le situe en retrait, à la 36e place sur 68. Dans l’Arena image-to-code, il se classe 15e sur 31, derrière Claude Fable 5 et deux entrées Claude Opus 4.7. Le premier est nettement devant. Dans l’Arena code, il tombe à la 34e place sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. L’écart avec Kimi K3 est important. Les résultats Benchable sont largement plafonnés et départagent peu les modèles. Gemini 3.1 Pro Preview reste pertinent pour le texte, les longs contextes et le code à coût maîtrisé. Pour un résultat plus abouti en programmation, on lui préférera Kimi K3, Claude Fable 5 ou GPT-5.6 Sol.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).