Google: Gemini 3.1 Pro Preview Custom Tools
Google: Gemini 3.1 Pro Preview Custom Tools est un LLM de Google sorti le 25 février 2026. Il se caractérise par une fenêtre de contexte de 1 048 756 tokens, soit environ 1,0 million, ainsi que par un positionnement économique.
Google: Gemini 3.1 Pro Preview Custom Tools est un LLM de Google sorti le 25 février 2026. Il se caractérise par une fenêtre de contexte de 1 048 756 tokens, soit environ 1,0 million, ainsi que par un positionnement économique.
La tarification débute à 2 $ par million de tokens en entrée et atteint 12 $ en sortie. Elle se situe 4% sous la moyenne des LLM similaires. Le modèle coûte aussi environ 2.8 fois moins cher que les modèles frontière, avec un profil particulièrement solide en Coding.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | ▫ n.d. |
| Date de sortie | 25 février 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 756 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,audio,image,video,file → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 100ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 96,9 % | 5ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 95,9 % | 16ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 94,9 % | 4ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Reasoning (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google AI Studio | 2 $ | 12 $ | 0,2 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,73 $ |
| Latence moyenne par benchmark — Benchable | 19 min 28 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Le Coding constitue le résultat le plus probant du modèle. Il intègre le top 10 de ce benchmark, à la cinquième place sur 162 modèles. Sa fenêtre d'environ un million de tokens lui donne aussi une capacité de contexte particulièrement étendue. Son prix renforce ce positionnement : il reste inférieur à la moyenne des LLM similaires et nettement plus bas que celui des modèles frontière. Cette combinaison associe donc performance en programmation, contexte étendu et coût économique.
Limites et points d'attention. Plusieurs résultats Benchable sont plafonnés et départagent mal les modèles. Dans Hallucinations, Reasoning et Ethics, la première place est partagée avec respectivement 45, 14 et 71 autres modèles. General Knowledge illustre aussi cette faible discrimination : malgré un score maximal, le modèle partage la 47e place avec 24 concurrents. Email Classification est plus clairement en retrait, à la 100e place sur 163. Le modèle convient surtout aux tâches de programmation mobilisant un long contexte, avec un budget inférieur à celui des offres haut de gamme.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).