jhu-clsp/FollowIR-7B
Publié le 29 avril 2024 par jhu-clsp, FollowIR-7B est un cross-encoder de 7 milliards de paramètres, tous actifs. Il repose sur Mistral-7B-Instruct-v0.2, affiné avec des données de recherche d’information assorties d’instructions humaines provenant de pistes TREC du jeu FollowIR.
Publié le 29 avril 2024 par jhu-clsp, FollowIR-7B est un cross-encoder de 7 milliards de paramètres, tous actifs. Il repose sur Mistral-7B-Instruct-v0.2, affiné avec des données de recherche d’information assorties d’instructions humaines provenant de pistes TREC du jeu FollowIR.
Le modèle sert principalement au reranking en recherche sémantique et dans les pipelines RAG. Il évalue conjointement une requête et un document, puis indique leur pertinence par une sortie « true » ou « false ». Cette architecture ne produit pas d’embeddings indépendants directement adaptés au clustering ou à l’indexation vectorielle préalable.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | jhu-clsp |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 29 avril 2024 |
| Représentation | cross-encoder |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Instruction Following | 12,2 % | 1ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Instruction Following
Notre analyse
Forces. FollowIR-7B se distingue dans l’Instruction Following de MTEB, où il occupe la première place parmi 196 modèles avec un score de 12 %. Son point fort est donc la recherche guidée par des consignes, notamment lorsque la notion de pertinence dépasse la simple proximité sémantique entre une requête et un document. L’affinage sur des instructions rédigées par des humains et issues de pistes TREC cible précisément ce scénario. Dans un moteur de recherche ou un système RAG, il peut servir de seconde étape pour réordonner les documents obtenus par un moteur de récupération initial.
Limites et points d'attention. Avec 7 milliards de paramètres actifs, l’évaluation de chaque paire requête-document est plus lourde qu’une comparaison entre vecteurs pré-calculés. Son fonctionnement de cross-encoder impose aussi de traiter séparément chaque document candidat, ce qui limite son intérêt pour la recherche exhaustive à grande échelle. Sorti il y a environ deux ans, il appartient désormais à une génération ancienne à l’échelle de l’IA et est probablement dépassé par des modèles plus récents. Usages pertinents : reranking instructionnel de résultats de recherche et sélection finale de passages dans un pipeline RAG.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).