castorini/monot5-3b-msmarco-10k

Publié par castorini le 28 mars 2022, castorini/monot5-3b-msmarco-10k est un cross-encoder de 3 milliards de paramètres actifs. Ce reranker repose sur T5-3B, une architecture séquence-à-séquence préentraînée, puis affinée pendant 10 000 étapes, soit une époque, sur MS MARCO Passage.

Publié par castorini le 28 mars 2022, castorini/monot5-3b-msmarco-10k est un cross-encoder de 3 milliards de paramètres actifs. Ce reranker repose sur T5-3B, une architecture séquence-à-séquence préentraînée, puis affinée pendant 10 000 étapes, soit une époque, sur MS MARCO Passage.

Le modèle sert au classement de documents dans une chaîne de recherche sémantique ou de RAG. Contrairement à un encodeur destiné à produire séparément les vecteurs d’un corpus, son architecture cross-encoder traite les éléments à comparer afin de réordonner les résultats fournis par une première étape de recherche.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcastorini
Poids🟢 Poids ouverts
Date de sortie28 mars 2022
Représentationcross-encoder
Paramètres3 milliards
Paramètres actifs3 milliards
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Instruction Following2,5 %22ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Instruction Following

▶ castorini/monot5-3b-msm…3 %

Notre analyse

Forces. Sa spécialisation sur MS MARCO Passage cible directement le reranking de passages et de documents. Sur le track MTEB Instruction Following, consacré à la qualité de recherche guidée par des instructions, il se situe dans la partie haute du classement. Son architecture T5-3B permet d’évaluer conjointement la requête et le document, une approche adaptée au reclassement précis d’une sélection de résultats dans un moteur de recherche sémantique ou un pipeline RAG.

Limites et points d’attention. Le résultat absolu sur MTEB Instruction Following reste faible malgré un rang relativement favorable, ce qui invite à ne pas confondre position comparative et niveau de qualité. Avec 3 milliards de paramètres actifs, le modèle est lourd pour un reranker, surtout lorsque de nombreux couples requête-document doivent être évalués. Son fonctionnement de cross-encoder convient au reclassement, mais pas à la création directe d’un index de vecteurs ni au clustering à grande échelle. Sorti en 2022, il appartient à une génération très ancienne à l’échelle de l’IA et est probablement dépassé par des modèles plus récents. Usages pertinents : reranking de passages MS MARCO, recherche sémantique et amélioration d’une sélection documentaire dans un système RAG.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).