Muse Spark

Muse Spark est un LLM propriétaire de Meta, lancé le 8 avril 2026 aux États-Unis. Ses poids ne sont pas ouverts. Son profil associe de solides résultats en raisonnement scientifique et mathématique à une bonne restitution de connaissances factuelles.

Muse Spark est un LLM propriétaire de Meta, lancé le 8 avril 2026 aux États-Unis. Ses poids ne sont pas ouverts. Son profil associe de solides résultats en raisonnement scientifique et mathématique à une bonne restitution de connaissances factuelles.

À sa sortie, Muse Spark se classait dans le top 13% des LLM de sa génération sur GPQA diamond. Les évaluations Arena le placent également dans le haut du classement en texte et en vision, tandis que le traitement de documents apparaît moins convaincant. Ce positionnement repose sur trois sources de données concordantes.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids🔒 Propriétaire
Date de sortie8 avril 2026
Multimodaloui

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Tau2 Telecom91,5 %15ᵉ / 34llm-statsAuto-déclaré
GPQA89,5 %24ᵉ / 219llm-statsAuto-déclaré
CharXiv-R86,4 %8ᵉ / 45llm-statsAuto-déclaré
ScreenSpot Pro84,1 %3ᵉ / 23llm-statsAuto-déclaré
MMMU-Pro80,4 %12ᵉ / 64llm-statsAuto-déclaré
LiveCodeBench Pro80,0 %3ᵉ / 4llm-statsAuto-déclaré
MedXpertQA78,4 %1ᵉ / 12llm-statsAuto-déclaré
SWE-Bench Verified77,4 %25ᵉ / 102llm-statsAuto-déclaré
DeepSearchQA74,8 %8ᵉ / 8llm-statsAuto-déclaré
SimpleVQA71,3 %4ᵉ / 13llm-statsAuto-déclaré
ERQA64,7 %7ᵉ / 22llm-statsAuto-déclaré
Terminal-Bench 2.059,0 %24ᵉ / 49llm-statsAuto-déclaré
Humanity's Last Exam58,4 %4ᵉ / 89llm-statsAuto-déclaré
SWE-Bench Pro52,4 %36ᵉ / 41llm-statsAuto-déclaré
HealthBench Hard42,8 %1ᵉ / 9llm-statsAuto-déclaré
ARC-AGI v242,5 %9ᵉ / 16llm-statsAuto-déclaré
GDPval-AA38,8 %26ᵉ / 39llm-statsn.d.
FrontierScience Research38,3 %1ᵉ / 4llm-statsAuto-déclaré
ZEROBench33,0 %4ᵉ / 9llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
5ᵉClaude Opus 4.71494
6ᵉMuse Spark 1.11493
7ᵉMuse Spark1487
8ᵉGemini 3 Pro1486
9ᵉKimi K31486

Arena Document · 32 modèles classés

RangModèleElo
1ᵉClaude Opus 4.61508
2ᵉClaude Fable 51507
3ᵉClaude Opus 4.61507
15ᵉKimi K2.61449
16ᵉClaude Sonnet 4.51446
17ᵉMuse Spark1445
18ᵉQwen3.7-Plus1444
19ᵉGemini 3.1 Pro Preview1441

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
4ᵉClaude Opus 4.71299
5ᵉClaude Opus 4.61298
6ᵉMuse Spark1295
7ᵉGemini 3 Pro1289
8ᵉGPT-5.51286

Entraînement & empreinte

IndicateurValeur
PaysUnited States of America

Notre analyse

Forces. Muse Spark excelle sur GPQA diamond (questions scientifiques de niveau doctorat) et obtient aussi un résultat élevé sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée). Il atteint le top 10 sur SimpleQA Verified, qui évalue les réponses factuelles vérifiables, ainsi que sur FrontierMath-2025-02-28-Private, consacré à des problèmes de mathématiques de recherche très difficiles. Dans Arena, il figure parmi les dix premiers en texte et en vision, avec des scores Elo relativement proches de ceux des modèles en tête. À sa sortie, son classement sur GPQA diamond le situait clairement dans le haut du panier de sa génération.

Limites et points d'attention. Les performances deviennent nettement moins fortes sur FrontierMath-Tier-4-2025-07-01-Private, le niveau le plus exigeant des évaluations mathématiques fournies. Muse Spark se situe aussi dans la seconde moitié d'Arena document, loin de son positionnement en texte et en vision. Ce contraste indique un profil plus solide pour le raisonnement scientifique, les questions factuelles et les interactions générales que pour l'analyse documentaire. Ses poids non ouverts limitent par ailleurs les possibilités de déploiement autonome et de modification du modèle. Muse Spark cible ainsi surtout les usages nécessitant de fortes capacités scientifiques, mathématiques, factuelles ou visuelles.


Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.