gpt-3.5-turbo-0613

gpt-3.5-turbo-0613 est un LLM propriétaire d’OpenAI. Son profil Benchable est très contrasté : le modèle obtient son résultat le plus solide en classification d’e-mails, mais se montre nettement moins convaincant dans le suivi d’instructions et les connaissances générales.

gpt-3.5-turbo-0613 est un LLM propriétaire d’OpenAI. Son profil Benchable est très contrasté : le modèle obtient son résultat le plus solide en classification d’e-mails, mais se montre nettement moins convaincant dans le suivi d’instructions et les connaissances générales.

Cette version illustre surtout les écarts possibles entre tâches au sein d’un même modèle. Son score brut élevé en Email Classification ne suffit pas à le distinguer, car ce benchmark plafonné regroupe de nombreux modèles à des niveaux proches.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Instruction Following (Baseline)49,0 %113ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)0,0 %153ᵉ / 161benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
olmo-3-32b-think97 %
▶ gpt-3.5-turbo-061397 %

Benchable : Instruction Following (Baseline)

▶ gpt-3.5-turbo-061349 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable2 min 23 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. La classification d’e-mails constitue le principal point fort de gpt-3.5-turbo-0613. Le modèle atteint 97% sur Email Classification (Baseline). Ce résultat indique une forte réussite sur cette évaluation précise. Il partage toutefois la 100e place sur 163 avec 21 autres modèles, ce qui limite la portée comparative du score.

Limites et points d’attention. Le suivi d’instructions est en retrait : avec 49% sur Instruction Following (Baseline), le modèle partage la 113e place sur 163 avec un autre modèle. General Knowledge (Baseline) constitue sa faiblesse la plus nette. Son score de 0% le place au 153e rang sur 161, à égalité avec huit autres modèles. Les trois benchmarks sont signalés comme plafonnés et non discriminants. Ils décrivent donc les points forts et les faiblesses de cette version, mais ne permettent pas d’établir une hiérarchie fine entre les modèles ex æquo.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).