GPT OSS 20B

GPT OSS 20B est un LLM open-weight d’OpenAI, publié le 5 août 2025 sous licence Apache 2.0, avec usage commercial autorisé. Ses 21 milliards de paramètres, dont 3,6 milliards actifs, ciblent les déploiements locaux, spécialisés ou à plus faible latence.

GPT OSS 20B est un LLM open-weight d’OpenAI, publié le 5 août 2025 sous licence Apache 2.0, avec usage commercial autorisé. Ses 21 milliards de paramètres, dont 3,6 milliards actifs, ciblent les déploiements locaux, spécialisés ou à plus faible latence.

Le modèle combine une fenêtre de contexte de 131 072 tokens, un raisonnement configurable et plusieurs fonctions intégrées, notamment l’exécution de code Python, la navigation web et les sorties structurées. Son entraînement représente 5,5 × 10²³ FLOP, soit environ 152 000 heures-GPU H100. À sa sortie, il se classait dans le top 30% de sa génération sur GPQA.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie5 août 2025
Multimodalnon
Paramètres21 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202598,7 %10ᵉ / 108llm-statsAuto-déclaré
MMLU85,3 %38ᵉ / 98llm-statsAuto-déclaré
CodeForces74,3 %10ᵉ / 16llm-statsAuto-déclaré
GPQA71,5 %111ᵉ / 219llm-statsAuto-déclaré
TAU-bench Retail54,8 %22ᵉ / 24llm-statsAuto-déclaré
HealthBench42,5 %8ᵉ / 8llm-statsAuto-déclaré
Humanity's Last Exam10,9 %78ᵉ / 89llm-statsAuto-déclaré
HealthBench Hard10,8 %8ᵉ / 9llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Darkbloomgratuitgratuitn.d.
DekaLLM0,029 $0,14 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)0,45 $
Durée d'exécution — PinchBench1 h 51 min
Indice valeur/coût — PinchBench132,8
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable14 min 24 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement5,5 × 10²³ FLOP
MatérielNVIDIA H100 SXM5 80GB
PaysUnited States of America

Notre analyse

Forces. GPT OSS 20B se distingue particulièrement en Keyword Topic Relevance Classification, où il occupe la première place parmi les modèles évalués. Ses résultats sont également très élevés en connaissances générales et en éthique, tandis que la classification d’e-mails, le code et le raisonnement restent solides. Le modèle prend en charge l’appel de fonctions, la navigation web, l’exécution de code Python, les sorties structurées et l’accès à la chaîne de pensée. Sa licence Apache 2.0, ses poids ouverts et sa compatibilité avec Transformers, vLLM, PyTorch/Triton, Ollama et LM Studio facilitent différents modes d’exploitation. Son tarif minimal est gratuit, avec un positionnement annoncé 100% sous la moyenne des LLM similaires.

Limites et points d’attention. Les scores bruts élevés masquent des classements plus modestes sur plusieurs évaluations généralistes. GPT OSS 20B reste hors du groupe de tête en code et en raisonnement, et se situe plus bas encore en classification d’e-mails malgré son bon score. Ses connaissances s’arrêtent au 30 juin 2024. Le format de réponse harmony est obligatoire pour assurer son bon fonctionnement, ce qui impose une contrainte d’intégration. Les poids MoE sont quantifiés en MXFP4. Le modèle convient surtout aux usages locaux ou spécialisés recherchant des poids ouverts, un coût minimal et des fonctions de raisonnement ou d’outillage intégrées.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).