Octen/octen-vl-embedding-large
Publié par Octen le 15 mai 2026, Octen/octen-vl-embedding-large est un modèle d’embedding dense qui transforme les textes en vecteurs de 4 096 dimensions. Ses évaluations couvrent notamment le français et l’allemand, ainsi que plusieurs domaines spécialisés.
Publié par Octen le 15 mai 2026, Octen/octen-vl-embedding-large est un modèle d’embedding dense qui transforme les textes en vecteurs de 4 096 dimensions. Ses évaluations couvrent notamment le français et l’allemand, ainsi que plusieurs domaines spécialisés.
Le modèle sert à indexer et rapprocher des contenus selon leur sens, notamment pour la recherche sémantique, la sélection de passages dans un système RAG, la mesure de similarité et le clustering de documents. Il produit des représentations numériques plutôt que du texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Octen |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 15 mai 2026 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Longueur de séquence max | 32 000 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 69,3 % | 7ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 67,0 % | 13ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 81,0 % | 12ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 59,8 % | 12ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 70,9 % | 12ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB German
Notre analyse
Forces. Les résultats RTEB montrent un positionnement particulièrement solide en retrieval juridique et en allemand, deux tracks où le modèle figure dans le top 10. La recherche financière est également compétitive, tandis que les évaluations en français et dans la santé confirment une couverture de plusieurs langues et domaines spécialisés. Ce profil convient au rapprochement de textes juridiques, de contenus financiers, de questions-réponses médicales et de documents en français ou en allemand.
Limites et points d’attention. Le niveau mesuré est plus faible sur RTEB French et RTEB Healthcare que sur les tracks Finance, German et Legal, même si les classements restent favorables. Les vecteurs denses de 4 096 dimensions augmentent la taille des index, la mémoire nécessaire et le coût des calculs de similarité par rapport à des représentations moins dimensionnelles. Usages pertinents : moteurs de recherche sémantique multilingues, sélection de passages pour le RAG, détection de contenus proches et clustering de corpus juridiques, financiers ou médicaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).