OpenAI: gpt-oss-safeguard-20b

Sorti le 29 octobre 2025, OpenAI: gpt-oss-safeguard-20b est un LLM à poids ouverts spécialisé dans le raisonnement de sécurité. Construit sur gpt-oss, il compte 21 milliards de paramètres, dont 3.6 milliards actifs, et vise les GPU dotés de 16GB de VRAM.

Sorti le 29 octobre 2025, OpenAI: gpt-oss-safeguard-20b est un LLM à poids ouverts spécialisé dans le raisonnement de sécurité. Construit sur gpt-oss, il compte 21 milliards de paramètres, dont 3.6 milliards actifs, et vise les GPU dotés de 16GB de VRAM.

Le modèle classe des textes selon les politiques de sécurité qui lui sont fournies. Il cible le filtrage des entrées et sorties de LLM ainsi que l’étiquetage de contenu, en ligne ou hors ligne, pour des usages de Trust and Safety. Sa fenêtre de 131 072 tokens accompagne un effort de raisonnement réglable sur low, medium ou high.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🟢 Poids ouverts
Date de sortie29 octobre 2025
Multimodalnon
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Ethics (Baseline)98,0 %105ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)97,0 %102ᵉ / 161benchable✅ Mesuré
Benchable : Coding (Baseline)95,0 %17ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)94,0 %42ᵉ / 155benchable✅ Mesuré
Benchable : Mathematics (Baseline)89,0 %78ᵉ / 140benchable✅ Mesuré
Benchable : Hallucinations (Baseline)86,0 %102ᵉ / 146benchable✅ Mesuré
Benchable : Instruction Following (Baseline)69,0 %57ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ gpt-oss-safegua…99 %

Benchable : Ethics (Baseline)

▶ gpt-oss-safegua…98 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Groq0,075 $0,3 $0,0375 $

Prix en dollars US par million de tokens.

Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 73,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable2 min 09 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. OpenAI: gpt-oss-safeguard-20b obtient ses positions les plus favorables sur Email Classification et Coding, malgré de nombreux ex æquo liés au plafonnement de ces tests. Reasoning se situe aussi dans la première moitié du classement Benchable. Le modèle expose son processus de raisonnement et applique des politiques de sécurité fournies au moment de l’utilisation, ce qui répond à des besoins de classification configurables. Son tarif est très économique, inférieur de 96% à la moyenne des LLM similaires et environ 73.3 fois moins élevé que celui des modèles frontière.

Limites et points d'attention. Les scores Benchable élevés sont peu discriminants, car les benchmarks sont plafonnés et regroupent de nombreux modèles à égalité. Ethics et General Knowledge apparaissent dans la seconde moitié de leurs classements respectifs, tandis que Mathematics se situe en milieu de tableau. Ces résultats décrivent donc mieux un modèle spécialisé dans la sécurité qu’un généraliste de premier plan. L’intégration impose exclusivement le format de réponse harmony. Le modèle convient surtout au filtrage de LLM et à l’étiquetage de contenus selon des politiques de Trust and Safety configurées.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).