Sakana: Fugu Ultra
Sorti le 24 juin 2026, Sakana: Fugu Ultra est un LLM de Sakana AI au positionnement premium. Il se distingue surtout par une fenêtre de contexte de 1 million de tokens, adaptée au traitement de très longs contenus dans une même requête.
Sorti le 24 juin 2026, Sakana: Fugu Ultra est un LLM de Sakana AI au positionnement premium. Il se distingue surtout par une fenêtre de contexte de 1 million de tokens, adaptée au traitement de très longs contenus dans une même requête.
Son profil combine des scores élevés sur les tests de référence de Benchable et un résultat plus mesuré dans l'évaluation agentique OpenClaw. Son prix dépasse nettement la moyenne des LLM similaires, tout en restant légèrement inférieur à celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Sakana AI |
| Poids | ▫ n.d. |
| Date de sortie | 24 juin 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 98,0 % | 16ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 88,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 69,5 % | 11ᵉ / 19 | pinchbench | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Email Classification (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Sakana | 5 $ | 30 $ | 0,5 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 91,05 $ |
| Durée d'exécution — PinchBench | 7 h 26 min |
| Indice valeur/coût — PinchBench | 0,84 |
| Coût moyen par benchmark — Benchable | 3,31 $ |
| Latence moyenne par benchmark — Benchable | 25 min 00 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Sakana: Fugu Ultra obtient des résultats élevés en classification d'e-mails, en raisonnement et en suivi d'instructions. Sur Hallucinations, il atteint le plafond du benchmark, une place partagée avec 45 autres modèles. Ces évaluations confirment une bonne maîtrise des tâches de référence couvertes. La fenêtre de contexte de 1 million de tokens constitue son principal atout concret pour analyser de longs documents ou conserver un historique étendu. Sur OpenClaw, il réussit 70% des 147 tâches, ce qui atteste aussi de capacités agentiques opérationnelles.
Limites et points d'attention. Les benchmarks Benchable sont plafonnés et départagent mal les modèles aux scores élevés. La première place sur Hallucinations et les bons classements sur les autres tests doivent donc être interprétés avec prudence. OpenClaw situe Fugu Ultra près du milieu du classement, au 11e rang sur 19, loin d'une position dominante sur les tâches agentiques. Le tarif se place 140% au-dessus de la moyenne des LLM similaires. Il reste environ 1,1 fois moins cher que les modèles frontière, mais conserve un positionnement coûteux. Fugu Ultra convient surtout aux usages qui valorisent un contexte massif et acceptent ce surcoût.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).