gemini-3.1-flash-image-preview

gemini-3.1-flash-image-preview est un LLM de Google. Son profil Benchable couvre le raisonnement, le code, les connaissances générales, l’éthique, la classification d’e-mails et les hallucinations.

gemini-3.1-flash-image-preview est un LLM de Google. Son profil Benchable couvre le raisonnement, le code, les connaissances générales, l’éthique, la classification d’e-mails et les hallucinations.

Le modèle se distingue surtout en Coding, où il figure dans le top 10, puis en Reasoning. Ses scores bruts sont très élevés sur l’ensemble des épreuves, mais ces benchmarks plafonnés départagent mal les nombreux modèles proches du maximum.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,0 %75ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)99,0 %73ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %16ᵉ / 155benchable✅ Mesuré
Benchable : Coding (Baseline)96,0 %7ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)91,0 %71ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)77,0 %34ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ gemini-3.1-flash-image-…100 %

Benchable : General Knowledge (Baseline)

olmo-3-32b-think99 %
▶ gemini-3.1-flash-image-…99 %
uncensored99 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,12 $
Latence moyenne par benchmark — Benchable11 min 56 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Coding constitue le résultat le plus marquant : gemini-3.1-flash-image-preview partage la 7e place avec cinq autres modèles. Il obtient aussi une place solide en Reasoning, à la 16e position avec quatorze autres modèles. Ces résultats placent le code et le raisonnement au premier plan de son profil évalué. Le modèle atteint également le plafond de Hallucinations et partage la première place avec 45 autres modèles. Ce résultat confirme un score maximal dans cette épreuve, sans établir de supériorité entre les nombreux ex æquo.

Limites et points d’attention. Les scores bruts donnent une impression d’excellence uniforme, mais les classements sont beaucoup moins favorables en General Knowledge et Ethics, autour des 73e à 75e places. Email Classification se situe aussi plus loin, à la 55e place. Les ex æquo sont très nombreux dans chaque épreuve, jusqu’à 42 autres modèles en Email Classification. Tous les benchmarks fournis sont plafonnés et non discriminants : ils décrivent un niveau élevé sur ces tests, mais mesurent mal les écarts réels. Le modèle paraît surtout pertinent pour les tâches de code et de raisonnement représentées par Benchable.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).