Seed 2.1 Pro

Seed 2.1 Pro est un LLM propriétaire de ByteDance, sorti le 24 juin 2026. Ses poids ne sont pas ouverts, ce qui le positionne comme un modèle contrôlé par son éditeur plutôt que comme une base librement modifiable.

Seed 2.1 Pro est un LLM propriétaire de ByteDance, sorti le 24 juin 2026. Ses poids ne sont pas ouverts, ce qui le positionne comme un modèle contrôlé par son éditeur plutôt que comme une base librement modifiable.

À sa sortie, Seed 2.1 Pro se situait dans le haut du panier de sa génération sur Humanity's Last Exam, un benchmark exigeant de connaissances et de raisonnement. Ce résultat le plaçait parmi les LLM les plus performants de son époque sur cette évaluation.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurByteDance
Poids🔒 Propriétaire
Date de sortie24 juin 2026
Multimodaloui

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
CharXiv-D95,5 %1ᵉ / 16llm-statsAuto-déclaré
MathVision94,5 %2ᵉ / 32llm-statsAuto-déclaré
MathVista90,7 %1ᵉ / 38llm-statsAuto-déclaré
Video-MME89,2 %1ᵉ / 17llm-statsAuto-déclaré
GDPval87,9 %1ᵉ / 3llm-statsAuto-déclaré
Beyond AIME87,0 %2ᵉ / 5llm-statsAuto-déclaré
RealWorldQA86,7 %2ᵉ / 25llm-statsAuto-déclaré
CharXiv-R86,4 %8ᵉ / 45llm-statsAuto-déclaré
BrowseComp86,2 %7ᵉ / 57llm-statsAuto-déclaré
MCP Atlas83,8 %3ᵉ / 30llm-statsAuto-déclaré
EmbSpatialBench83,4 %6ᵉ / 8llm-statsAuto-déclaré
MMMU-Pro82,7 %4ᵉ / 64llm-statsAuto-déclaré
BLINK81,4 %1ᵉ / 13llm-statsAuto-déclaré
LongVideoBench80,6 %1ᵉ / 4llm-statsAuto-déclaré
TVBench80,5 %1ᵉ / 3llm-statsAuto-déclaré
OSWorld78,8 %1ᵉ / 20llm-statsAuto-déclaré
LVBench78,0 %1ᵉ / 23llm-statsAuto-déclaré
FrontierScience Olympiad75,0 %2ᵉ / 3llm-statsAuto-déclaré
MotionBench74,9 %1ᵉ / 3llm-statsAuto-déclaré
SimpleVQA74,5 %3ᵉ / 13llm-statsAuto-déclaré
BabyVision73,7 %3ᵉ / 9llm-statsAuto-déclaré
DynaMath73,1 %6ᵉ / 7llm-statsAuto-déclaré
OfficeQA Pro72,2 %1ᵉ / 7llm-statsAuto-déclaré
ERQA72,0 %1ᵉ / 22llm-statsAuto-déclaré
Terminal-Bench 2.171,0 %10ᵉ / 13llm-statsAuto-déclaré
SuperGPQA70,8 %4ᵉ / 34llm-statsAuto-déclaré
CyberGym70,2 %6ᵉ / 9llm-statsAuto-déclaré
VideoHolmes68,2 %1ᵉ / 3llm-statsAuto-déclaré
OCRBench_V263,2 %3ᵉ / 7llm-statsAuto-déclaré
WildClawBench61,7 %2ᵉ / 4llm-statsAuto-déclaré
SciCode59,8 %1ᵉ / 18llm-statsAuto-déclaré
SuperChem59,8 %1ᵉ / 3llm-statsAuto-déclaré
SWE-Bench Pro57,5 %20ᵉ / 41llm-statsAuto-déclaré
ZEROBench56,3 %2ᵉ / 9llm-statsAuto-déclaré
Humanity's Last Exam55,7 %9ᵉ / 89llm-statsAuto-déclaré
VisuLogic54,3 %1ᵉ / 3llm-statsAuto-déclaré
WorldVQA53,0 %2ᵉ / 5llm-statsAuto-déclaré
VisFactor51,4 %1ᵉ / 3llm-statsAuto-déclaré
Artifacts Bench51,0 %1ᵉ / 3llm-statsAuto-déclaré
ClawEval-MM51,0 %2ᵉ / 3llm-statsAuto-déclaré
Toolathlon50,6 %12ᵉ / 30llm-statsAuto-déclaré
Program Bench50,3 %4ᵉ / 5llm-statsAuto-déclaré
NL2Repo47,0 %3ᵉ / 12llm-statsAuto-déclaré
Agents' Last Exam41,4 %4ᵉ / 4llm-statsAuto-déclaré
APEX-Agents33,8 %2ᵉ / 7llm-statsAuto-déclaré
DeepSWE32,7 %7ᵉ / 9llm-statsAuto-déclaré
MathArena Apex31,3 %6ᵉ / 7llm-statsAuto-déclaré
FrontierScience Research28,3 %3ᵉ / 4llm-statsAuto-déclaré
PostTrainBench16,5 %5ᵉ / 5llm-statsAuto-déclaré
HorizonMath2,0 %2ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Seed 2.1 Pro figurait à sa sortie dans le top 7% des 86 LLM de sa génération évalués sur Humanity's Last Exam. Cette position indique une performance relative élevée sur un test conçu pour confronter les modèles à des questions complexes de connaissances et de raisonnement. Elle situe concrètement le modèle parmi les meilleurs de sa cohorte, composée de LLM sortis au cours des quelque 18 mois précédents.

Limites et points d'attention. La licence propriétaire et la fermeture des poids restreignent l'examen direct du modèle ainsi que les modifications portant sur ses paramètres. L'évaluation disponible repose par ailleurs sur une seule source de données concordante. Le classement sur Humanity's Last Exam établit donc un point fort précis, mais circonscrit à ce benchmark et à la génération de modèles considérée lors de la sortie.


Sources des données : LLM-Stats (llm-stats.com).