Seal-0
Seal-0 est un benchmark public conçu en 2025 par les auteurs de SealQA, Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng et Tu Vu. Il évalue les capacités de recherche agentique, notamment l’utilisation d’outils pour retrouver des informations pertinentes.
Seal-0 est un benchmark public conçu en 2025 par les auteurs de SealQA, Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng et Tu Vu. Il évalue les capacités de recherche agentique, notamment l’utilisation d’outils pour retrouver des informations pertinentes.
Les modèles doivent répondre en anglais à des questions factuelles malgré des résultats de recherche web conflictuels, bruités ou inutiles. Seal-0 mesure ainsi la robustesse du raisonnement factuel en contexte de recherche augmentée, à travers l’exactitude des réponses produites.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs SealQA (Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng, Tu Vu) |
| Capacités mesurées | Recherche augmentee robuste : raisonnement factuel face a des resultats de recherche web conflictuels, bruites ou inutiles. |
| Modalité | Texte |
| Type de questions | Questions factuelles (fact-seeking) avec resultats de recherche bruites/conflictuels |
| Métrique d'évaluation | Exactitude (accuracy) |
| Accès | Public |
| Langues | Anglais |
| Année de publication | 2025 |
| Ressources | Article scientifique |
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 57,4 % | 27 janvier 2026 | Auto-déclaré |
| 2 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 56,3 % | 5 septembre 2025 | Auto-déclaré |
| 3 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 47,2 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,9 % | 16 février 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,1 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 41,4 % | 24 février 2026 | Auto-déclaré |
Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 47,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Seal-0 indique qu’un modèle parvient fréquemment à extraire les informations utiles, à résister aux résultats trompeurs ou non pertinents et à produire une réponse factuelle correcte. Dans la base, Kimi K2.5 obtient le meilleur résultat avec 57 %, tandis que la médiane des six modèles évalués atteint 47 %. Cet écart modéré place le modèle en tête sans suggérer une saturation complète du benchmark. Il montre aussi que les perturbations introduites dans les résultats de recherche restent discriminantes pour les systèmes considérés.
La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le caractère public de Seal-0 peut également accroître, au fil du temps, le risque de contamination par exposition aux questions. Enfin, sa portée reste ciblée sur des questions factuelles en anglais associées à des résultats web bruités ou conflictuels. Le classement renseigne donc précisément sur la recherche augmentée robuste dans ce cadre, et non sur l’ensemble des capacités générales d’un modèle.
Sources des scores : llm-stats.