Step-3.5-Flash
Publié par StepFun le 2 février 2026, Step-3.5-Flash est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Son positionnement associe une fenêtre de contexte de 262 144 tokens à un tarif très économique, inférieur de 95% à la moyenne des modèles similaires.
Publié par StepFun le 2 février 2026, Step-3.5-Flash est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Son positionnement associe une fenêtre de contexte de 262 144 tokens à un tarif très économique, inférieur de 95% à la moyenne des modèles similaires.
Son architecture Transformer Sparse Mixture-of-Experts compte 45 couches et 196 milliards de paramètres, dont environ 11 milliards actifs par token. Le routage mobilise huit experts parmi 288 par couche, avec un expert partagé. La prédiction simultanée de quatre tokens complète cette architecture, accessible par API cloud ou en déploiement local avec vLLM, SGLang, Hugging Face Transformers et llama.cpp.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | StepFun |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 2 février 2026 |
| Multimodal | non |
| Paramètres | 196 milliards |
| Fenêtre de contexte | 65 536 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 26.0 | 74ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 97,3 % | 12ᵉ / 108 | llm-stats | Auto-déclaré |
| Tau-bench | 88,2 % | 1ᵉ / 6 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 86,4 % | 8ᵉ / 53 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 85,4 % | 9ᵉ / 19 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 74,4 % | 37ᵉ / 102 | llm-stats | Auto-déclaré |
| BrowseComp | 69,0 % | 28ᵉ / 57 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 51,0 % | 34ᵉ / 49 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 134ᵉ | Qwen3 VL 235B A22B Thinking | 1395 |
| 135ᵉ | hunyuan-vision-1.5-thinking | 1395 |
| 136ᵉ | Step-3.5-Flash | 1395 |
| 137ᵉ | amazon-nova-experimental-chat-12-10 | 1394 |
| 138ᵉ | MiMo-V2-Flash | 1393 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| SiliconFlow | 0,1 $ | 0,3 $ | n.d. |
| stepfun | 0,1 $ | 0,4 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 1,12 $ |
| Durée d'exécution — PinchBench | 4 h 02 min |
| Indice valeur/coût — PinchBench | 170,77 |
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 1 h 08 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Step-3.5-Flash obtient des résultats parfaits et se classe parmi les meilleurs sur les six tests Benchable disponibles. Cette régularité couvre le suivi d’instructions, les connaissances générales, le raisonnement, l’éthique, la classification d’e-mails et le contrôle des hallucinations. À sa sortie, il figurait aussi dans le top 24% des LLM de sa génération sur SWE-Bench Verified, ce qui le situait favorablement pour les tâches de développement logiciel. Son coût constitue un autre avantage net : il est environ 55 fois moins cher que les modèles frontière, avec des tarifs de 0,1 $ par million de tokens en entrée et 0,3 $ en sortie.
Limites et points d'attention. Les résultats globaux sont moins dominants que les tests Benchable pris isolément. L’Intelligence Index situe Step-3.5-Flash dans la seconde moitié du classement, tandis que son score Arena text le place au 134e rang sur 200, loin du modèle en tête. L’architecture MoE réduit le nombre de paramètres actifs par token, mais le modèle conserve 196 milliards de paramètres au total, un volume important pour un déploiement local. Step-3.5-Flash vise donc surtout les usages sensibles au coût, avec un long contexte, ainsi que le raisonnement, le codage et les agents.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).