GPT OSS 120B

GPT OSS 120B est un LLM open-weight publié par OpenAI le 5 août 2025 sous licence Apache 2.0, avec usage commercial autorisé. Ses 117 milliards de paramètres, dont environ 5 milliards actifs, reposent sur une architecture MoE quantifiée en MXFP4, conçue pour fonctionner sur un seul GPU…

GPT OSS 120B est un LLM open-weight publié par OpenAI le 5 août 2025 sous licence Apache 2.0, avec usage commercial autorisé. Ses 117 milliards de paramètres, dont environ 5 milliards actifs, reposent sur une architecture MoE quantifiée en MXFP4, conçue pour fonctionner sur un seul GPU de 80GB.

Le modèle associe une fenêtre de contexte de 131 072 tokens à un effort de raisonnement configurable, au fine-tuning, au function calling, à l’exécution de code Python et aux sorties structurées. Son entraînement représente 4,9 × 10²⁴ FLOP, soit environ 1,4 million d’heures-GPU H100. Son tarif affiché comme gratuit le place 100% sous la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie5 août 2025
Multimodalnon
Paramètres117 milliards
Paramètres actifs5 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index23.885ᵉ / 137
Code Index30.458ᵉ / 74
Agentic Index13.249ᵉ / 68
Math Index93.46ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202592,5 %31ᵉ / 108llm-statsAuto-déclaré
MMLU90,0 %10ᵉ / 98llm-statsAuto-déclaré
MMMLU83,8 %34ᵉ / 49llm-statsAuto-déclaré
CodeForces82,1 %6ᵉ / 16llm-statsAuto-déclaré
LiveCodeBench v681,9 %15ᵉ / 53llm-statsAuto-déclaré
MMLU-Pro80,7 %47ᵉ / 125llm-statsAuto-déclaré
GPQA80,1 %78ᵉ / 219llm-statsAuto-déclaré
IFBench69,5 %17ᵉ / 27llm-statsAuto-déclaré
TAU-bench Retail67,8 %15ᵉ / 24llm-statsAuto-déclaré
t2-bench63,9 %18ᵉ / 23llm-statsAuto-déclaré
HealthBench57,6 %2ᵉ / 8llm-statsAuto-déclaré
HealthBench Hard30,0 %5ᵉ / 9llm-statsAuto-déclaré
Humanity's Last Exam14,9 %68ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GPT OSS 120B23.8
Nova 2.0 Pro Preview21.8

Code Index

Nova 2.0 Pro Preview34.0
▶ GPT OSS 120B30.4

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
177ᵉGLM-4.5V1354
178ᵉgemini-2.0-flash-lite-preview-02-051353
179ᵉGPT OSS 120B1353
180ᵉgemini-1.5-pro-0021351
181ᵉamazon-nova-experimental-chat-10-201350

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DekaLLM0,03 $0,18 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 99 % en dessous de la moyenne des LLM similaires, et 183,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)0,5 $
Durée d'exécution — PinchBench3 h 00 min
Indice valeur/coût — PinchBench158,9
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable13 min 26 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement4,9 × 10²⁴ FLOP
MatérielNVIDIA H100 SXM5 80GB
PaysUnited States of America

Notre analyse

Forces. GPT OSS 120B se distingue surtout en mathématiques, avec un Math Index situé dans le top 10. À sa sortie, il appartenait aussi au top 20% des LLM de sa génération sur GPQA diamond, ce qui le plaçait favorablement pour le raisonnement scientifique exigeant. Les évaluations Benchable montrent des résultats élevés en connaissances générales, classification d’e-mails, raisonnement et mathématiques, même si les classements relatifs sont plus contrastés. Le modèle prend en charge la navigation web, l’exécution de code Python, le function calling et l’accès à la chaîne de pensée. Son faible nombre de paramètres actifs réduit les besoins d’exécution par rapport à sa taille totale.

Limites et points d'attention. Son classement dans l’Arena text reste proche du bas du tableau, tandis que l’Intelligence Index se situe dans la seconde moitié du panel. Les positions du Code Index et de l’Agentic Index indiquent également des performances moins compétitives que son niveau en mathématiques. Le score Benchable en éthique paraît élevé en valeur absolue, mais son rang est parmi les plus faibles du panel concerné. Le format harmony est requis pour un fonctionnement correct, ce qui impose une intégration adaptée. GPT OSS 120B cible surtout le déploiement local ou en production d’un modèle ouvert, personnalisable et très économique, avec une priorité donnée au raisonnement mathématique et aux usages outillés.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).