gemini-3.1-flash-image

gemini-3.1-flash-image est un LLM de Google évalué sur six domaines, du raisonnement au code, en passant par les connaissances générales, la classification d’e-mails et l’éthique. Son profil est contrasté : ses meilleurs classements concernent Reasoning et Coding, tandis que General…

gemini-3.1-flash-image est un LLM de Google évalué sur six domaines, du raisonnement au code, en passant par les connaissances générales, la classification d’e-mails et l’éthique. Son profil est contrasté : ses meilleurs classements concernent Reasoning et Coding, tandis que General Knowledge et Ethics le placent nettement plus bas.

Plusieurs scores bruts sont proches du maximum, mais les ex æquo nombreux réduisent leur portée. Le cas d’Email Classification est révélateur : un résultat très élevé correspond seulement à une place intermédiaire, tant le benchmark est plafonné.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)96,0 %112ᵉ / 161benchable✅ Mesuré
Benchable : Reasoning (Baseline)96,0 %32ᵉ / 155benchable✅ Mesuré
Benchable : Coding (Baseline)94,0 %32ᵉ / 162benchable✅ Mesuré
Benchable : Ethics (Baseline)92,0 %140ᵉ / 159benchable✅ Mesuré
Benchable : Mathematics (Baseline)92,0 %61ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)78,0 %33ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ gemini-3.1-flash-image100 %

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
skyfall-36b-v298 %
▶ gemini-3.1-flash-image98 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,24 $
Latence moyenne par benchmark — Benchable10 min 39 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Reasoning et Coding constituent les résultats les plus convaincants de gemini-3.1-flash-image : le modèle partage la 32e place dans les deux classements, sur respectivement 155 et 162 modèles. Sur Hallucinations, il obtient 100% et partage la première place avec 45 autres modèles. Ce résultat confirme la réussite du test, mais le plafond atteint par de nombreux concurrents empêche de les départager. Email Classification affiche également un score brut élevé de 98%.

Limites et points d’attention. Les benchmarks plafonnés rendent plusieurs scores peu discriminants. En Email Classification, gemini-3.1-flash-image partage seulement la 55e place avec 42 autres modèles malgré ses 98%. General Knowledge le situe plus nettement en retrait, à la 112e place sur 161. Ethics constitue sa faiblesse principale : son score de 92% correspond au 140e rang sur 159. Le modèle présente donc un profil plus favorable en raisonnement et en code qu’en connaissances générales et en éthique.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).