GPT OSS 120B
GPT OSS 120B est un LLM open-weight publié par OpenAI le 5 août 2025 sous licence Apache 2.0, avec usage commercial autorisé. Ses 117 milliards de paramètres, dont environ 5 milliards actifs, reposent sur une architecture MoE quantifiée en MXFP4, conçue pour fonctionner sur un seul GPU…
GPT OSS 120B est un LLM open-weight publié par OpenAI le 5 août 2025 sous licence Apache 2.0, avec usage commercial autorisé. Ses 117 milliards de paramètres, dont environ 5 milliards actifs, reposent sur une architecture MoE quantifiée en MXFP4, conçue pour fonctionner sur un seul GPU de 80GB.
Le modèle associe une fenêtre de contexte de 131 072 tokens à un effort de raisonnement configurable, au fine-tuning, au function calling, à l’exécution de code Python et aux sorties structurées. Son entraînement représente 4,9 × 10²⁴ FLOP, soit environ 1,4 million d’heures-GPU H100. Son tarif affiché comme gratuit le place 100% sous la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 5 août 2025 |
| Multimodal | non |
| Paramètres | 117 milliards |
| Paramètres actifs | 5 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 23.8 | 85ᵉ / 137 |
| Code Index | 30.4 | 58ᵉ / 74 |
| Agentic Index | 13.2 | 49ᵉ / 68 |
| Math Index | 93.4 | 6ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 92,5 % | 31ᵉ / 108 | llm-stats | Auto-déclaré |
| MMLU | 90,0 % | 10ᵉ / 98 | llm-stats | Auto-déclaré |
| MMMLU | 83,8 % | 34ᵉ / 49 | llm-stats | Auto-déclaré |
| CodeForces | 82,1 % | 6ᵉ / 16 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 81,9 % | 15ᵉ / 53 | llm-stats | Auto-déclaré |
| MMLU-Pro | 80,7 % | 47ᵉ / 125 | llm-stats | Auto-déclaré |
| GPQA | 80,1 % | 78ᵉ / 219 | llm-stats | Auto-déclaré |
| IFBench | 69,5 % | 17ᵉ / 27 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 67,8 % | 15ᵉ / 24 | llm-stats | Auto-déclaré |
| t2-bench | 63,9 % | 18ᵉ / 23 | llm-stats | Auto-déclaré |
| HealthBench | 57,6 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| HealthBench Hard | 30,0 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 14,9 % | 68ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 177ᵉ | GLM-4.5V | 1354 |
| 178ᵉ | gemini-2.0-flash-lite-preview-02-05 | 1353 |
| 179ᵉ | GPT OSS 120B | 1353 |
| 180ᵉ | gemini-1.5-pro-002 | 1351 |
| 181ᵉ | amazon-nova-experimental-chat-10-20 | 1350 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DekaLLM | 0,03 $ | 0,18 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 99 % en dessous de la moyenne des LLM similaires, et 183,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 0,5 $ |
| Durée d'exécution — PinchBench | 3 h 00 min |
| Indice valeur/coût — PinchBench | 158,9 |
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 13 min 26 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 4,9 × 10²⁴ FLOP |
| Matériel | NVIDIA H100 SXM5 80GB |
| Pays | United States of America |
Notre analyse
Forces. GPT OSS 120B se distingue surtout en mathématiques, avec un Math Index situé dans le top 10. À sa sortie, il appartenait aussi au top 20% des LLM de sa génération sur GPQA diamond, ce qui le plaçait favorablement pour le raisonnement scientifique exigeant. Les évaluations Benchable montrent des résultats élevés en connaissances générales, classification d’e-mails, raisonnement et mathématiques, même si les classements relatifs sont plus contrastés. Le modèle prend en charge la navigation web, l’exécution de code Python, le function calling et l’accès à la chaîne de pensée. Son faible nombre de paramètres actifs réduit les besoins d’exécution par rapport à sa taille totale.
Limites et points d'attention. Son classement dans l’Arena text reste proche du bas du tableau, tandis que l’Intelligence Index se situe dans la seconde moitié du panel. Les positions du Code Index et de l’Agentic Index indiquent également des performances moins compétitives que son niveau en mathématiques. Le score Benchable en éthique paraît élevé en valeur absolue, mais son rang est parmi les plus faibles du panel concerné. Le format harmony est requis pour un fonctionnement correct, ce qui impose une intégration adaptée. GPT OSS 120B cible surtout le déploiement local ou en production d’un modèle ouvert, personnalisable et très économique, avec une priorité donnée au raisonnement mathématique et aux usages outillés.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).