sentence-transformers/sentence-t5-base
Publié par Sentence Transformers le 9 février 2022 sous licence ouverte Apache 2.0, sentence-transformers/sentence-t5-base est un modèle d’embedding dense de 223 millions de paramètres actifs. Il exploite uniquement l’encodeur de T5-base, avec des poids stockés en FP16, et produit des…
Publié par Sentence Transformers le 9 février 2022 sous licence ouverte Apache 2.0, sentence-transformers/sentence-t5-base est un modèle d’embedding dense de 223 millions de paramètres actifs. Il exploite uniquement l’encodeur de T5-base, avec des poids stockés en FP16, et produit des vecteurs de 768 dimensions.
Le modèle transforme des phrases et des paragraphes en représentations numériques destinées à la similarité sémantique. Ces vecteurs peuvent alimenter une recherche sémantique, la sélection de passages pour un système RAG, le rapprochement de contenus similaires ou le clustering. Converti de TensorFlow vers PyTorch, il fonctionne avec sentence-transformers 2.2.0 ou une version ultérieure.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 février 2022 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 223 millions |
| Paramètres actifs | 223 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 33,6 % | 156ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Dutch | 36,4 % | 85ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Dutch
Notre analyse
Forces. sentence-transformers/sentence-t5-base offre une architecture d’encodage adaptée à la comparaison de phrases et de paragraphes, avec une représentation dense de taille fixe. Son résultat sur MTEB Dutch est relativement moins faible que celui obtenu sur BEIR, ce qui indique une aptitude plus crédible sur les tâches néerlandaises de classification, de clustering et de comparaison de paires que sur la recherche documentaire généraliste sans adaptation. La licence Apache 2.0 facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales.
Limites et points d’attention. Le classement sur MTEB Dutch reste dans la partie basse du panel évalué, tandis que BEIR place le modèle encore plus loin parmi les systèmes comparés pour le zero-shot retrieval sur des domaines hétérogènes. Ses 768 dimensions imposent aussi un index plus volumineux et davantage de calcul par comparaison que des embeddings de dimension inférieure. Sorti en 2022, il est très ancien à l’échelle de l’IA, se compare surtout aux modèles de sa période et apparaît probablement dépassé, ce type de référence étant souvent retiré des catalogues actuels. Usages pertinents : bases existantes compatibles, expérimentation locale, similarité de phrases et pipelines RAG dont les performances sont validées sur les données ciblées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).