Sakana: Fugu Ultra

Sorti le 24 juin 2026, Sakana: Fugu Ultra est un LLM de Sakana AI au positionnement premium. Il se distingue surtout par une fenêtre de contexte de 1 million de tokens, adaptée au traitement de très longs contenus dans une même requête.

Sorti le 24 juin 2026, Sakana: Fugu Ultra est un LLM de Sakana AI au positionnement premium. Il se distingue surtout par une fenêtre de contexte de 1 million de tokens, adaptée au traitement de très longs contenus dans une même requête.

Son profil combine des scores élevés sur les tests de référence de Benchable et un résultat plus mesuré dans l'évaluation agentique OpenClaw. Son prix dépasse nettement la moyenne des LLM similaires, tout en restant légèrement inférieur à celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurSakana AI
Poids▫ n.d.
Date de sortie24 juin 2026
Multimodaloui
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %16ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)88,0 %11ᵉ / 163benchable✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)69,5 %11ᵉ / 19pinchbench✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ Fugu Ultra100 %

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ Fugu Ultra99 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Sakana5 $30 $0,5 $

Prix en dollars US par million de tokens.

Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)91,05 $
Durée d'exécution — PinchBench7 h 26 min
Indice valeur/coût — PinchBench0,84
Coût moyen par benchmark — Benchable3,31 $
Latence moyenne par benchmark — Benchable25 min 00 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Sakana: Fugu Ultra obtient des résultats élevés en classification d'e-mails, en raisonnement et en suivi d'instructions. Sur Hallucinations, il atteint le plafond du benchmark, une place partagée avec 45 autres modèles. Ces évaluations confirment une bonne maîtrise des tâches de référence couvertes. La fenêtre de contexte de 1 million de tokens constitue son principal atout concret pour analyser de longs documents ou conserver un historique étendu. Sur OpenClaw, il réussit 70% des 147 tâches, ce qui atteste aussi de capacités agentiques opérationnelles.

Limites et points d'attention. Les benchmarks Benchable sont plafonnés et départagent mal les modèles aux scores élevés. La première place sur Hallucinations et les bons classements sur les autres tests doivent donc être interprétés avec prudence. OpenClaw situe Fugu Ultra près du milieu du classement, au 11e rang sur 19, loin d'une position dominante sur les tâches agentiques. Le tarif se place 140% au-dessus de la moyenne des LLM similaires. Il reste environ 1,1 fois moins cher que les modèles frontière, mais conserve un positionnement coûteux. Fugu Ultra convient surtout aux usages qui valorisent un contexte massif et acceptent ce surcoût.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).