Seal-0

Seal-0 est un benchmark public conçu en 2025 par les auteurs de SealQA, Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng et Tu Vu. Il évalue les capacités de recherche agentique, notamment l’utilisation d’outils pour retrouver des informations pertinentes.

Seal-0 est un benchmark public conçu en 2025 par les auteurs de SealQA, Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng et Tu Vu. Il évalue les capacités de recherche agentique, notamment l’utilisation d’outils pour retrouver des informations pertinentes.

Les modèles doivent répondre en anglais à des questions factuelles malgré des résultats de recherche web conflictuels, bruités ou inutiles. Seal-0 mesure ainsi la robustesse du raisonnement factuel en contexte de recherche augmentée, à travers l’exactitude des réponses produites.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs SealQA (Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng, Tu Vu)
Capacités mesuréesRecherche augmentee robuste : raisonnement factuel face a des resultats de recherche web conflictuels, bruites ou inutiles.
ModalitéTexte
Type de questionsQuestions factuelles (fact-seeking) avec resultats de recherche bruites/conflictuels
Métrique d'évaluationExactitude (accuracy)
AccèsPublic
LanguesAnglais
Année de publication2025
RessourcesArticle scientifique

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.5Moonshot AI🟢 Ouvert57,4 %27 janvier 2026Auto-déclaré
2Kimi K2 0905Moonshot AI🔒 Propriétaire56,3 %5 septembre 2025Auto-déclaré
3Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert47,2 %24 février 2026Auto-déclaré
4Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert46,9 %16 février 2026Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert44,1 %24 février 2026Auto-déclaré
6Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert41,4 %24 février 2026Auto-déclaré

Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 47,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Seal-0 indique qu’un modèle parvient fréquemment à extraire les informations utiles, à résister aux résultats trompeurs ou non pertinents et à produire une réponse factuelle correcte. Dans la base, Kimi K2.5 obtient le meilleur résultat avec 57 %, tandis que la médiane des six modèles évalués atteint 47 %. Cet écart modéré place le modèle en tête sans suggérer une saturation complète du benchmark. Il montre aussi que les perturbations introduites dans les résultats de recherche restent discriminantes pour les systèmes considérés.

La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Le caractère public de Seal-0 peut également accroître, au fil du temps, le risque de contamination par exposition aux questions. Enfin, sa portée reste ciblée sur des questions factuelles en anglais associées à des résultats web bruités ou conflictuels. Le classement renseigne donc précisément sur la recherche augmentée robuste dans ce cadre, et non sur l’ensemble des capacités générales d’un modèle.


Sources des scores : llm-stats.