Google: Gemini 3.1 Pro Preview Custom Tools

Google: Gemini 3.1 Pro Preview Custom Tools est un LLM de Google sorti le 25 février 2026. Il se caractérise par une fenêtre de contexte de 1 048 756 tokens, soit environ 1,0 million, ainsi que par un positionnement économique.

Google: Gemini 3.1 Pro Preview Custom Tools est un LLM de Google sorti le 25 février 2026. Il se caractérise par une fenêtre de contexte de 1 048 756 tokens, soit environ 1,0 million, ainsi que par un positionnement économique.

La tarification débute à 2 $ par million de tokens en entrée et atteint 12 $ en sortie. Elle se situe 4% sous la moyenne des LLM similaires. Le modèle coûte aussi environ 2.8 fois moins cher que les modèles frontière, avec un profil particulièrement solide en Coding.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids▫ n.d.
Date de sortie25 février 2026
Multimodaloui
Fenêtre de contexte1 048 756 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,audio,image,video,file → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 155benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)96,9 %5ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)95,9 %16ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)94,9 %4ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ Gemini 3.1 Pro …100 %

Benchable : Reasoning (Baseline)

▶ Gemini 3.1 Pro …100 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Google AI Studio2 $12 $0,2 $

Prix en dollars US par million de tokens.

Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,73 $
Latence moyenne par benchmark — Benchable19 min 28 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Le Coding constitue le résultat le plus probant du modèle. Il intègre le top 10 de ce benchmark, à la cinquième place sur 162 modèles. Sa fenêtre d'environ un million de tokens lui donne aussi une capacité de contexte particulièrement étendue. Son prix renforce ce positionnement : il reste inférieur à la moyenne des LLM similaires et nettement plus bas que celui des modèles frontière. Cette combinaison associe donc performance en programmation, contexte étendu et coût économique.

Limites et points d'attention. Plusieurs résultats Benchable sont plafonnés et départagent mal les modèles. Dans Hallucinations, Reasoning et Ethics, la première place est partagée avec respectivement 45, 14 et 71 autres modèles. General Knowledge illustre aussi cette faible discrimination : malgré un score maximal, le modèle partage la 47e place avec 24 concurrents. Email Classification est plus clairement en retrait, à la 100e place sur 163. Le modèle convient surtout aux tâches de programmation mobilisant un long contexte, avec un budget inférieur à celui des offres haut de gamme.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).