Octen/octen-vl-embedding-large

Publié par Octen le 15 mai 2026, Octen/octen-vl-embedding-large est un modèle d’embedding dense qui transforme les textes en vecteurs de 4 096 dimensions. Ses évaluations couvrent notamment le français et l’allemand, ainsi que plusieurs domaines spécialisés.

Publié par Octen le 15 mai 2026, Octen/octen-vl-embedding-large est un modèle d’embedding dense qui transforme les textes en vecteurs de 4 096 dimensions. Ses évaluations couvrent notamment le français et l’allemand, ainsi que plusieurs domaines spécialisés.

Le modèle sert à indexer et rapprocher des contenus selon leur sens, notamment pour la recherche sémantique, la sélection de passages dans un système RAG, la mesure de similarité et le clustering de documents. Il produit des représentations numériques plutôt que du texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOcten
Poids🟢 Poids ouverts
Date de sortie15 mai 2026
Dimension du vecteur4 096
Représentationdense
Longueur de séquence max32 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal69,3 %7ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare67,0 %13ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance81,0 %12ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French59,8 %12ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German70,9 %12ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ Octen/octen-vl-embeddin…81 %

MTEB: RTEB German

nvidia/Nemotron-3-Embed…77 %
voyageai/voyage-4-large…77 %
▶ Octen/octen-vl-embeddin…71 %
telepix/PIXIE-Rune-v1.070 %

Notre analyse

Forces. Les résultats RTEB montrent un positionnement particulièrement solide en retrieval juridique et en allemand, deux tracks où le modèle figure dans le top 10. La recherche financière est également compétitive, tandis que les évaluations en français et dans la santé confirment une couverture de plusieurs langues et domaines spécialisés. Ce profil convient au rapprochement de textes juridiques, de contenus financiers, de questions-réponses médicales et de documents en français ou en allemand.

Limites et points d’attention. Le niveau mesuré est plus faible sur RTEB French et RTEB Healthcare que sur les tracks Finance, German et Legal, même si les classements restent favorables. Les vecteurs denses de 4 096 dimensions augmentent la taille des index, la mémoire nécessaire et le coût des calculs de similarité par rapport à des représentations moins dimensionnelles. Usages pertinents : moteurs de recherche sémantique multilingues, sélection de passages pour le RAG, détection de contenus proches et clustering de corpus juridiques, financiers ou médicaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).