Step-3.5-Flash

Publié par StepFun le 2 février 2026, Step-3.5-Flash est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Son positionnement associe une fenêtre de contexte de 262 144 tokens à un tarif très économique, inférieur de 95% à la moyenne des modèles similaires.

Publié par StepFun le 2 février 2026, Step-3.5-Flash est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Son positionnement associe une fenêtre de contexte de 262 144 tokens à un tarif très économique, inférieur de 95% à la moyenne des modèles similaires.

Son architecture Transformer Sparse Mixture-of-Experts compte 45 couches et 196 milliards de paramètres, dont environ 11 milliards actifs par token. Le routage mobilise huit experts parmi 288 par couche, avec un expert partagé. La prédiction simultanée de quatre tokens complète cette architecture, accessible par API cloud ou en déploiement local avec vLLM, SGLang, Hugging Face Transformers et llama.cpp.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurStepFun
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie2 février 2026
Multimodalnon
Paramètres196 milliards
Fenêtre de contexte65 536 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index26.074ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202597,3 %12ᵉ / 108llm-statsAuto-déclaré
Tau-bench88,2 %1ᵉ / 6llm-statsAuto-déclaré
LiveCodeBench v686,4 %8ᵉ / 53llm-statsAuto-déclaré
IMO-AnswerBench85,4 %9ᵉ / 19llm-statsAuto-déclaré
SWE-Bench Verified74,4 %37ᵉ / 102llm-statsAuto-déclaré
BrowseComp69,0 %28ᵉ / 57llm-statsAuto-déclaré
Terminal-Bench 2.051,0 %34ᵉ / 49llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Step-3.5-Flash26.0
Nova 2.0 Pro Preview21.8

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
134ᵉQwen3 VL 235B A22B Thinking1395
135ᵉhunyuan-vision-1.5-thinking1395
136ᵉStep-3.5-Flash1395
137ᵉamazon-nova-experimental-chat-12-101394
138ᵉMiMo-V2-Flash1393

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
SiliconFlow0,1 $0,3 $n.d.
stepfun0,1 $0,4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)1,12 $
Durée d'exécution — PinchBench4 h 02 min
Indice valeur/coût — PinchBench170,77
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable1 h 08 min

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Step-3.5-Flash obtient des résultats parfaits et se classe parmi les meilleurs sur les six tests Benchable disponibles. Cette régularité couvre le suivi d’instructions, les connaissances générales, le raisonnement, l’éthique, la classification d’e-mails et le contrôle des hallucinations. À sa sortie, il figurait aussi dans le top 24% des LLM de sa génération sur SWE-Bench Verified, ce qui le situait favorablement pour les tâches de développement logiciel. Son coût constitue un autre avantage net : il est environ 55 fois moins cher que les modèles frontière, avec des tarifs de 0,1 $ par million de tokens en entrée et 0,3 $ en sortie.

Limites et points d'attention. Les résultats globaux sont moins dominants que les tests Benchable pris isolément. L’Intelligence Index situe Step-3.5-Flash dans la seconde moitié du classement, tandis que son score Arena text le place au 134e rang sur 200, loin du modèle en tête. L’architecture MoE réduit le nombre de paramètres actifs par token, mais le modèle conserve 196 milliards de paramètres au total, un volume important pour un déploiement local. Step-3.5-Flash vise donc surtout les usages sensibles au coût, avec un long contexte, ainsi que le raisonnement, le codage et les agents.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).