Muse Spark 1.1
Sorti le 9 juillet 2026, Muse Spark 1.1 est un LLM propriétaire de Meta. Il se distingue par une fenêtre de contexte d’environ 1,0 million de tokens et par un positionnement tarifaire très économique.
Sorti le 9 juillet 2026, Muse Spark 1.1 est un LLM propriétaire de Meta. Il se distingue par une fenêtre de contexte d’environ 1,0 million de tokens et par un positionnement tarifaire très économique.
À sa sortie, il figurait dans le top 2% des 87 LLM de sa génération sur Humanity's Last Exam. Son prix, inférieur de 40% à la moyenne des modèles similaires et environ 4,4 fois moins élevé que celui des modèles frontière, renforce son intérêt économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | 🔒 Propriétaire |
| Date de sortie | 9 juillet 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Email Classification (Baseline) | 89,0 % | 150ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 87,0 % | 86ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 86,9 % | 92ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 86,2 % | 14ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 84,0 % | 142ᵉ / 159 | benchable | ✅ Mesuré |
| CharXiv-R | 88,4 % | 5ᵉ / 45 | llm-stats | Auto-déclaré |
| MCP Atlas | 88,1 % | 1ᵉ / 30 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 80,8 % | 4ᵉ / 19 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 80,0 % | 8ᵉ / 13 | llm-stats | Auto-déclaré |
| BabyVision | 76,3 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| Toolathlon | 75,6 % | 1ᵉ / 30 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 62,1 % | 3ᵉ / 89 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 61,5 % | 11ᵉ / 41 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 57,2 % | 2ᵉ / 26 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Email Classification (Baseline)
Benchable : Mathematics (Baseline)
Classements Arena (Elo)
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 9ᵉ | Claude Opus 4.6 | 1542 |
| 10ᵉ | Claude Sonnet 5 | 1542 |
| 11ᵉ | Muse Spark 1.1 | 1538 |
| 12ᵉ | Claude Opus 4.6 | 1536 |
| 13ᵉ | Claude Opus 4.8 | 1534 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| 4ᵉ | Claude Opus 4.6 | 1498 |
| 5ᵉ | Claude Opus 4.7 | 1494 |
| 6ᵉ | Muse Spark 1.1 | 1493 |
| 7ᵉ | Muse Spark | 1487 |
| 8ᵉ | Gemini 3 Pro | 1486 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Meta | 1,25 $ | 4,25 $ | 0,15 $ |
| meta | 1,25 $ | 4,25 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,31 $ |
| Latence moyenne par benchmark — Benchable | 14 min 26 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Muse Spark 1.1 se classe sixième sur 200 dans Arena text, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec Claude Fable 5 est faible et les deux modèles sont proches. Le modèle figure aussi dans le top 15 en Instruction Following, son meilleur résultat parmi les benchmarks de base. Sa grande fenêtre de contexte et son tarif très économique le rendent pertinent pour les tâches textuelles à grand contexte sensibles au coût.
Limites et points d'attention. En code, Muse Spark 1.1 occupe la 11e place de l’arène, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est nettement devant. Son résultat au benchmark Coding le situe aussi dans la seconde moitié du classement. Le modèle apparaît davantage en retrait sur Ethics, près du bas du tableau. Les scores élevés en Email Classification et Mathematics sont peu discriminants, car ces benchmarks sont plafonnés et plusieurs modèles partagent les mêmes places. Pour un résultat plus abouti en code, Kimi K3, Claude Fable 5 ou GPT-5.6 Sol constituent de meilleurs choix.
Sources des données : Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).