castorini/monot5-base-msmarco-10k

Publié par castorini le 28 mars 2022, castorini/monot5-base-msmarco-10k est un cross-encoder de 297 millions de paramètres, tous actifs. Ce reranker fondé sur T5-base a été affiné pendant 10 000 étapes, soit une époque, sur les passages de MS MARCO.

Publié par castorini le 28 mars 2022, castorini/monot5-base-msmarco-10k est un cross-encoder de 297 millions de paramètres, tous actifs. Ce reranker fondé sur T5-base a été affiné pendant 10 000 étapes, soit une époque, sur les passages de MS MARCO.

Contrairement à un encodeur produisant des vecteurs indépendants à indexer, il évalue conjointement une requête et un passage afin de reclasser des résultats. Il sert donc surtout après une première recherche sémantique, notamment pour ordonner les documents transmis à un système RAG.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcastorini
Poids🟢 Poids ouverts
Date de sortie28 mars 2022
Représentationcross-encoder
Paramètres297 millions
Paramètres actifs297 millions
Modalités (entrée → sortie)text → embedding

Notre analyse

Forces. Sa spécialisation porte sur le reclassement de passages ou de documents, une étape utile pour améliorer l’ordre d’une liste de résultats déjà sélectionnés. L’affinage sur MS MARCO cible directement ce scénario de recherche. Par rapport à monot5-base-msmarco, cette variante affiche aussi de meilleures performances zero-shot sur des jeux de données différents de MS MARCO, ce qui indique une meilleure capacité de transfert hors de son corpus d’affinage.

Limites et points d'attention. Son résultat MTEB en Instruction Following se situe dans la seconde moitié du classement et légèrement sous la référence du benchmark, ce qui en fait un choix peu compétitif lorsque la recherche doit respecter des consignes formulées dans la requête. Son architecture cross-encoder impose également d’évaluer chaque paire requête-document, au lieu de fournir des représentations réutilisables pour l’indexation ou le clustering. Sorti en 2022, il est très ancien à l’échelle de l’IA et probablement dépassé par des rerankers plus récents. Usages pertinents : reclassement de passages pour la recherche sémantique et sélection de contexte dans un pipeline RAG.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).