Muse Spark
Muse Spark est un LLM propriétaire de Meta, lancé le 8 avril 2026 aux États-Unis. Ses poids ne sont pas ouverts. Son profil associe de solides résultats en raisonnement scientifique et mathématique à une bonne restitution de connaissances factuelles.
Muse Spark est un LLM propriétaire de Meta, lancé le 8 avril 2026 aux États-Unis. Ses poids ne sont pas ouverts. Son profil associe de solides résultats en raisonnement scientifique et mathématique à une bonne restitution de connaissances factuelles.
À sa sortie, Muse Spark se classait dans le top 13% des LLM de sa génération sur GPQA diamond. Les évaluations Arena le placent également dans le haut du classement en texte et en vision, tandis que le traitement de documents apparaît moins convaincant. Ce positionnement repose sur trois sources de données concordantes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | 🔒 Propriétaire |
| Date de sortie | 8 avril 2026 |
| Multimodal | oui |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Tau2 Telecom | 91,5 % | 15ᵉ / 34 | llm-stats | Auto-déclaré |
| GPQA | 89,5 % | 24ᵉ / 219 | llm-stats | Auto-déclaré |
| CharXiv-R | 86,4 % | 8ᵉ / 45 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 84,1 % | 3ᵉ / 23 | llm-stats | Auto-déclaré |
| MMMU-Pro | 80,4 % | 12ᵉ / 64 | llm-stats | Auto-déclaré |
| LiveCodeBench Pro | 80,0 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| MedXpertQA | 78,4 % | 1ᵉ / 12 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 77,4 % | 25ᵉ / 102 | llm-stats | Auto-déclaré |
| DeepSearchQA | 74,8 % | 8ᵉ / 8 | llm-stats | Auto-déclaré |
| SimpleVQA | 71,3 % | 4ᵉ / 13 | llm-stats | Auto-déclaré |
| ERQA | 64,7 % | 7ᵉ / 22 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 59,0 % | 24ᵉ / 49 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 58,4 % | 4ᵉ / 89 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 52,4 % | 36ᵉ / 41 | llm-stats | Auto-déclaré |
| HealthBench Hard | 42,8 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 42,5 % | 9ᵉ / 16 | llm-stats | Auto-déclaré |
| GDPval-AA | 38,8 % | 26ᵉ / 39 | llm-stats | n.d. |
| FrontierScience Research | 38,3 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| ZEROBench | 33,0 % | 4ᵉ / 9 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 5ᵉ | Claude Opus 4.7 | 1494 |
| 6ᵉ | Muse Spark 1.1 | 1493 |
| 7ᵉ | Muse Spark | 1487 |
| 8ᵉ | Gemini 3 Pro | 1486 |
| 9ᵉ | Kimi K3 | 1486 |
Arena Document · 32 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Opus 4.6 | 1508 |
| 2ᵉ | Claude Fable 5 | 1507 |
| 3ᵉ | Claude Opus 4.6 | 1507 |
| ⋯ | ⋯ | |
| 15ᵉ | Kimi K2.6 | 1449 |
| 16ᵉ | Claude Sonnet 4.5 | 1446 |
| 17ᵉ | Muse Spark | 1445 |
| 18ᵉ | Qwen3.7-Plus | 1444 |
| 19ᵉ | Gemini 3.1 Pro Preview | 1441 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| 4ᵉ | Claude Opus 4.7 | 1299 |
| 5ᵉ | Claude Opus 4.6 | 1298 |
| 6ᵉ | Muse Spark | 1295 |
| 7ᵉ | Gemini 3 Pro | 1289 |
| 8ᵉ | GPT-5.5 | 1286 |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | United States of America |
Notre analyse
Forces. Muse Spark excelle sur GPQA diamond (questions scientifiques de niveau doctorat) et obtient aussi un résultat élevé sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée). Il atteint le top 10 sur SimpleQA Verified, qui évalue les réponses factuelles vérifiables, ainsi que sur FrontierMath-2025-02-28-Private, consacré à des problèmes de mathématiques de recherche très difficiles. Dans Arena, il figure parmi les dix premiers en texte et en vision, avec des scores Elo relativement proches de ceux des modèles en tête. À sa sortie, son classement sur GPQA diamond le situait clairement dans le haut du panier de sa génération.
Limites et points d'attention. Les performances deviennent nettement moins fortes sur FrontierMath-Tier-4-2025-07-01-Private, le niveau le plus exigeant des évaluations mathématiques fournies. Muse Spark se situe aussi dans la seconde moitié d'Arena document, loin de son positionnement en texte et en vision. Ce contraste indique un profil plus solide pour le raisonnement scientifique, les questions factuelles et les interactions générales que pour l'analyse documentaire. Ses poids non ouverts limitent par ailleurs les possibilités de déploiement autonome et de modification du modèle. Muse Spark cible ainsi surtout les usages nécessitant de fortes capacités scientifiques, mathématiques, factuelles ou visuelles.
Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.