OpenAI: GPT-3.5 Turbo 16k

Publié par OpenAI le 28 août 2023, GPT-3.5 Turbo 16k est un LLM propriétaire désormais très ancien à l’échelle de l’IA. Sa fenêtre de contexte de 16 385 tokens constitue son principal trait distinctif. Près de trois ans après sa sortie, cette génération est probablement dépassée par les…

Publié par OpenAI le 28 août 2023, GPT-3.5 Turbo 16k est un LLM propriétaire désormais très ancien à l’échelle de l’IA. Sa fenêtre de contexte de 16 385 tokens constitue son principal trait distinctif. Près de trois ans après sa sortie, cette génération est probablement dépassée par les modèles actuels.

Ses connaissances s’arrêtent au 30 septembre 2021, soit presque deux ans avant son lancement. Son tarif se situe dans la moyenne du marché. Il reste toutefois 44 % supérieur à la moyenne des LLM similaires, tout en étant environ 1,8 fois moins cher que les modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie28 août 2023
Connaissances jusqu'à2021-09-30
Multimodalnon
Fenêtre de contexte16 385 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)99,0 %73ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)95,5 %117ᵉ / 161benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

ui-tars-1.5-7b99 %
▶ GPT-3.5 Turbo 1…99 %
uncensored99 %

Benchable : General Knowledge (Baseline)

▶ GPT-3.5 Turbo 1…96 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI3 $4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 44 % au-dessus de la moyenne des LLM similaires, et 1,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,14 $
Latence moyenne par benchmark — Benchable1 min 58 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, GPT-3.5 Turbo 16k se distinguait surtout par sa fenêtre de contexte de 16 385 tokens. Ses résultats frôlent le plafond dans Ethics (Baseline) et General Knowledge (Baseline). Ils indiquent une réussite élevée sur ces tests de base. Son positionnement tarifaire global reste dans la moyenne et son coût demeure nettement inférieur à celui des modèles frontière.

Limites et points d’attention. Les deux benchmarks cités sont plafonnés et départagent mal les modèles. Dans Ethics (Baseline), GPT-3.5 Turbo 16k partage sa place avec 30 autres modèles et se situe autour du milieu du classement. Dans General Knowledge (Baseline), il apparaît en retrait et partage sa place avec trois concurrents. Son tarif est aussi 44 % plus élevé que la moyenne des LLM similaires. La limite de connaissances fixée au 30 septembre 2021 réduit fortement l’actualité de ses réponses. Son ancienneté le place désormais derrière les générations récentes. Les modèles de cette période sont également souvent retirés du catalogue de leur éditeur.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).