GPT OSS 20B
GPT OSS 20B est un LLM open-weight d’OpenAI, publié le 5 août 2025 sous licence Apache 2.0, avec usage commercial autorisé. Ses 21 milliards de paramètres, dont 3,6 milliards actifs, ciblent les déploiements locaux, spécialisés ou à plus faible latence.
GPT OSS 20B est un LLM open-weight d’OpenAI, publié le 5 août 2025 sous licence Apache 2.0, avec usage commercial autorisé. Ses 21 milliards de paramètres, dont 3,6 milliards actifs, ciblent les déploiements locaux, spécialisés ou à plus faible latence.
Le modèle combine une fenêtre de contexte de 131 072 tokens, un raisonnement configurable et plusieurs fonctions intégrées, notamment l’exécution de code Python, la navigation web et les sorties structurées. Son entraînement représente 5,5 × 10²³ FLOP, soit environ 152 000 heures-GPU H100. À sa sortie, il se classait dans le top 30% de sa génération sur GPQA.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 5 août 2025 |
| Multimodal | non |
| Paramètres | 21 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 98,7 % | 10ᵉ / 108 | llm-stats | Auto-déclaré |
| MMLU | 85,3 % | 38ᵉ / 98 | llm-stats | Auto-déclaré |
| CodeForces | 74,3 % | 10ᵉ / 16 | llm-stats | Auto-déclaré |
| GPQA | 71,5 % | 111ᵉ / 219 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 54,8 % | 22ᵉ / 24 | llm-stats | Auto-déclaré |
| HealthBench | 42,5 % | 8ᵉ / 8 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 10,9 % | 78ᵉ / 89 | llm-stats | Auto-déclaré |
| HealthBench Hard | 10,8 % | 8ᵉ / 9 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Darkbloom | gratuit | gratuit | n.d. |
| DekaLLM | 0,029 $ | 0,14 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 0,45 $ |
| Durée d'exécution — PinchBench | 1 h 51 min |
| Indice valeur/coût — PinchBench | 132,8 |
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 14 min 24 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 5,5 × 10²³ FLOP |
| Matériel | NVIDIA H100 SXM5 80GB |
| Pays | United States of America |
Notre analyse
Forces. GPT OSS 20B se distingue particulièrement en Keyword Topic Relevance Classification, où il occupe la première place parmi les modèles évalués. Ses résultats sont également très élevés en connaissances générales et en éthique, tandis que la classification d’e-mails, le code et le raisonnement restent solides. Le modèle prend en charge l’appel de fonctions, la navigation web, l’exécution de code Python, les sorties structurées et l’accès à la chaîne de pensée. Sa licence Apache 2.0, ses poids ouverts et sa compatibilité avec Transformers, vLLM, PyTorch/Triton, Ollama et LM Studio facilitent différents modes d’exploitation. Son tarif minimal est gratuit, avec un positionnement annoncé 100% sous la moyenne des LLM similaires.
Limites et points d’attention. Les scores bruts élevés masquent des classements plus modestes sur plusieurs évaluations généralistes. GPT OSS 20B reste hors du groupe de tête en code et en raisonnement, et se situe plus bas encore en classification d’e-mails malgré son bon score. Ses connaissances s’arrêtent au 30 juin 2024. Le format de réponse harmony est obligatoire pour assurer son bon fonctionnement, ce qui impose une contrainte d’intégration. Les poids MoE sont quantifiés en MXFP4. Le modèle convient surtout aux usages locaux ou spécialisés recherchant des poids ouverts, un coût minimal et des fonctions de raisonnement ou d’outillage intégrées.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).