Seed 2.1 Pro
Seed 2.1 Pro est un LLM propriétaire de ByteDance, sorti le 24 juin 2026. Ses poids ne sont pas ouverts, ce qui le positionne comme un modèle contrôlé par son éditeur plutôt que comme une base librement modifiable.
Seed 2.1 Pro est un LLM propriétaire de ByteDance, sorti le 24 juin 2026. Ses poids ne sont pas ouverts, ce qui le positionne comme un modèle contrôlé par son éditeur plutôt que comme une base librement modifiable.
À sa sortie, Seed 2.1 Pro se situait dans le haut du panier de sa génération sur Humanity's Last Exam, un benchmark exigeant de connaissances et de raisonnement. Ce résultat le plaçait parmi les LLM les plus performants de son époque sur cette évaluation.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | ByteDance |
| Poids | 🔒 Propriétaire |
| Date de sortie | 24 juin 2026 |
| Multimodal | oui |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| CharXiv-D | 95,5 % | 1ᵉ / 16 | llm-stats | Auto-déclaré |
| MathVision | 94,5 % | 2ᵉ / 32 | llm-stats | Auto-déclaré |
| MathVista | 90,7 % | 1ᵉ / 38 | llm-stats | Auto-déclaré |
| Video-MME | 89,2 % | 1ᵉ / 17 | llm-stats | Auto-déclaré |
| GDPval | 87,9 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Beyond AIME | 87,0 % | 2ᵉ / 5 | llm-stats | Auto-déclaré |
| RealWorldQA | 86,7 % | 2ᵉ / 25 | llm-stats | Auto-déclaré |
| CharXiv-R | 86,4 % | 8ᵉ / 45 | llm-stats | Auto-déclaré |
| BrowseComp | 86,2 % | 7ᵉ / 57 | llm-stats | Auto-déclaré |
| MCP Atlas | 83,8 % | 3ᵉ / 30 | llm-stats | Auto-déclaré |
| EmbSpatialBench | 83,4 % | 6ᵉ / 8 | llm-stats | Auto-déclaré |
| MMMU-Pro | 82,7 % | 4ᵉ / 64 | llm-stats | Auto-déclaré |
| BLINK | 81,4 % | 1ᵉ / 13 | llm-stats | Auto-déclaré |
| LongVideoBench | 80,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| TVBench | 80,5 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| OSWorld | 78,8 % | 1ᵉ / 20 | llm-stats | Auto-déclaré |
| LVBench | 78,0 % | 1ᵉ / 23 | llm-stats | Auto-déclaré |
| FrontierScience Olympiad | 75,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| MotionBench | 74,9 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| SimpleVQA | 74,5 % | 3ᵉ / 13 | llm-stats | Auto-déclaré |
| BabyVision | 73,7 % | 3ᵉ / 9 | llm-stats | Auto-déclaré |
| DynaMath | 73,1 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| OfficeQA Pro | 72,2 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| ERQA | 72,0 % | 1ᵉ / 22 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 71,0 % | 10ᵉ / 13 | llm-stats | Auto-déclaré |
| SuperGPQA | 70,8 % | 4ᵉ / 34 | llm-stats | Auto-déclaré |
| CyberGym | 70,2 % | 6ᵉ / 9 | llm-stats | Auto-déclaré |
| VideoHolmes | 68,2 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| OCRBench_V2 | 63,2 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| WildClawBench | 61,7 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| SciCode | 59,8 % | 1ᵉ / 18 | llm-stats | Auto-déclaré |
| SuperChem | 59,8 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 57,5 % | 20ᵉ / 41 | llm-stats | Auto-déclaré |
| ZEROBench | 56,3 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 55,7 % | 9ᵉ / 89 | llm-stats | Auto-déclaré |
| VisuLogic | 54,3 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| WorldVQA | 53,0 % | 2ᵉ / 5 | llm-stats | Auto-déclaré |
| VisFactor | 51,4 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Artifacts Bench | 51,0 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| ClawEval-MM | 51,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Toolathlon | 50,6 % | 12ᵉ / 30 | llm-stats | Auto-déclaré |
| Program Bench | 50,3 % | 4ᵉ / 5 | llm-stats | Auto-déclaré |
| NL2Repo | 47,0 % | 3ᵉ / 12 | llm-stats | Auto-déclaré |
| Agents' Last Exam | 41,4 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| APEX-Agents | 33,8 % | 2ᵉ / 7 | llm-stats | Auto-déclaré |
| DeepSWE | 32,7 % | 7ᵉ / 9 | llm-stats | Auto-déclaré |
| MathArena Apex | 31,3 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| FrontierScience Research | 28,3 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| PostTrainBench | 16,5 % | 5ᵉ / 5 | llm-stats | Auto-déclaré |
| HorizonMath | 2,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Seed 2.1 Pro figurait à sa sortie dans le top 7% des 86 LLM de sa génération évalués sur Humanity's Last Exam. Cette position indique une performance relative élevée sur un test conçu pour confronter les modèles à des questions complexes de connaissances et de raisonnement. Elle situe concrètement le modèle parmi les meilleurs de sa cohorte, composée de LLM sortis au cours des quelque 18 mois précédents.
Limites et points d'attention. La licence propriétaire et la fermeture des poids restreignent l'examen direct du modèle ainsi que les modifications portant sur ses paramètres. L'évaluation disponible repose par ailleurs sur une seule source de données concordante. Le classement sur Humanity's Last Exam établit donc un point fort précis, mais circonscrit à ce benchmark et à la génération de modèles considérée lors de la sortie.
Sources des données : LLM-Stats (llm-stats.com).