Keyword Topic Relevance Classification

Benchable : Keyword Topic Relevance Classification est un benchmark textuel créé par Benchable. Il évalue la capacité d’un modèle d’IA à déterminer si un mot-clé est pertinent par rapport à un thème ou à un sujet donné.

Benchable : Keyword Topic Relevance Classification est un benchmark textuel créé par Benchable. Il évalue la capacité d’un modèle d’IA à déterminer si un mot-clé est pertinent par rapport à un thème ou à un sujet donné.

Présenté sous la forme d’une classification textuelle binaire, ce test mesure une aptitude ciblée de compréhension et d’association sémantique. Il sert à comparer les modèles sur une tâche délimitée, utile pour apprécier leur capacité à distinguer les mots-clés thématiquement pertinents de ceux qui ne le sont pas.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesMesure la capacité d'un modèle à déterminer si un mot-clé est pertinent par rapport à un thème ou sujet donné.
ModalitéTexte
Type de questionsclassification textuelle binaire

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert100,0 %29 juillet 2025✅ Mesuré
2Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert100,0 %31 juillet 2025✅ Mesuré
3qwen3-235b-a22b-07-25Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
4Kimi K2Moonshot AI▫ n.d.90,0 %6 novembre 2025✅ Mesuré
5Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert90,0 %28 août 2025✅ Mesuré
6qwen3-coder-480b-a35b-07-25Alibaba Cloud / Qwen Team▫ n.d.90,0 %✅ Mesuré

Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 95,0 %.

Notre analyse

Un score élevé indique qu’un modèle classe correctement une forte proportion de mots-clés selon leur pertinence thématique. Dans la base, la médiane de 90 % et le résultat de 100 % obtenu par GPT OSS 20B signalent des performances globalement élevées sur cette tâche. Cette concentration vers le haut peut toutefois limiter le pouvoir discriminant du benchmark entre les meilleurs modèles et suggérer un possible effet de saturation.

La fiabilité bénéficie du fait que les scores sont au moins partiellement mesurés par un tiers, ce qui apporte davantage de rigueur qu’un classement reposant uniquement sur des résultats auto-déclarés. Cette modalité ne constitue cependant pas, à elle seule, une garantie contre les risques méthodologiques tels que la contamination. Le classement révèle surtout une hiérarchie sur une capacité étroite, la classification binaire de pertinence entre un mot-clé et un sujet. Il ne doit donc pas être interprété comme une mesure générale des performances d’un modèle. Parmi les neuf modèles évalués, GPT OSS 20B occupe la première place avec un score maximal.


Sources des scores : benchable.