Octen/octen-vl-embedding

Publié par Octen le 15 mai 2026, Octen/octen-vl-embedding est un modèle d’embedding dense qui représente chaque texte par un vecteur de 2 048 dimensions. Cette représentation numérique sert à mesurer la proximité sémantique entre des contenus.

Publié par Octen le 15 mai 2026, Octen/octen-vl-embedding est un modèle d’embedding dense qui représente chaque texte par un vecteur de 2 048 dimensions. Cette représentation numérique sert à mesurer la proximité sémantique entre des contenus.

Le modèle peut alimenter un moteur de recherche sémantique, la sélection de passages pour un système RAG, le rapprochement de documents similaires ou leur clustering. Ses évaluations RTEB couvrent notamment l’allemand et le français, ainsi que des corpus juridiques, financiers et médicaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOcten
Poids🟢 Poids ouverts
Date de sortie15 mai 2026
Dimension du vecteur2 048
Représentationdense
Longueur de séquence max32 000 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal67,1 %9ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare59,1 %37ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance72,2 %28ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French51,5 %37ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German64,9 %28ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ Octen/octen-vl-embedding72 %

MTEB: RTEB Legal

▶ Octen/octen-vl-embedding67 %

Notre analyse

Forces. Le principal point fort ressort de RTEB Legal, où le modèle se classe dans le top 10 sur 205 modèles, pour la recherche parmi des décisions, des textes législatifs et des résumés juridiques. RTEB German le place également dans la partie haute du classement sur des contenus juridiques, médicaux et professionnels. Les résultats en finance indiquent aussi une aptitude solide à retrouver des informations dans des benchmarks et des questions-réponses spécialisés. Cette couverture de plusieurs domaines et de corpus allemands ou français élargit les scénarios de recherche documentaire.

Limites et points d'attention. RTEB Healthcare est moins favorable que les évaluations juridiques, allemandes et financières, ce qui invite à valider la qualité sur chaque corpus médical ciblé. RTEB French présente le score le plus faible des cinq tracks, malgré un classement relatif encore favorable parmi 216 modèles. Les vecteurs denses de 2 048 dimensions augmentent le volume des index et le coût de calcul de la recherche par rapport à des représentations moins dimensionnées. Usages pertinents : recherche juridique, exploration de corpus financiers, RAG documentaire, similarité sémantique et clustering, avec une évaluation spécifique recommandée pour les contenus médicaux et français.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).