Octen/Octen-Embedding-0.6B

Publié par Octen le 10 janvier 2026 sous licence ouverte Apache 2.0, Octen/Octen-Embedding-0.6B est un modèle dense de 596 millions de paramètres, affiné par LoRA à partir de Qwen3-Embedding-0.6B. Il produit des vecteurs de 1 024 dimensions et accepte jusqu’à 32 768 tokens.

Publié par Octen le 10 janvier 2026 sous licence ouverte Apache 2.0, Octen/Octen-Embedding-0.6B est un modèle dense de 596 millions de paramètres, affiné par LoRA à partir de Qwen3-Embedding-0.6B. Il produit des vecteurs de 1 024 dimensions et accepte jusqu’à 32 768 tokens.

Le modèle couvre plus de 100 langues, notamment l’anglais et le chinois. Il transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la similarité, au clustering, à la recherche interlingue et à la classification par embeddings. Son intégration repose sur Sentence Transformers ou Transformers, avec normalisation L2 des vecteurs dans ce dernier cas.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOcten
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie10 janvier 2026
Dimension du vecteur1 024
Représentationdense
Paramètres596 millions
Paramètres actifs596 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal71,1 %6ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare56,9 %44ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance73,5 %25ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French46,1 %57ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German65,7 %22ᵉ / 209mteb✅ Mesuré
MTEB: Thai58,6 %19ᵉ / 28mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ Octen/Octen-Embedding-0…73 %

MTEB: RTEB Legal

▶ Octen/Octen-Embedding-0…71 %

Notre analyse

Forces. Les résultats MTEB placent surtout Octen/Octen-Embedding-0.6B parmi les modèles les mieux classés de RTEB Legal, ce qui souligne son intérêt pour la recherche dans des décisions, des textes législatifs et des synthèses juridiques. Le modèle obtient aussi des positions solides sur RTEB German et RTEB Finance, avec une aptitude à la recherche multilingue et spécialisée. Sa fenêtre de 32 768 tokens facilite le traitement de documents longs, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires. Ses 596 millions de paramètres restent adaptés à des déploiements plus contenus que ceux de modèles d’embedding beaucoup plus volumineux.

Limites et points d'attention. Le classement Thai se situe dans le bas du panel évalué, tandis que RTEB Healthcare reste plus proche du milieu de tableau. RTEB French affiche un positionnement moins fort que les tracks juridique et allemand. Les vecteurs de 1 024 dimensions imposent par ailleurs un stockage et un calcul de similarité plus importants que des représentations de dimension inférieure, particulièrement à grande échelle. Usages pertinents : recherche juridique, financière ou multilingue, RAG sur documents longs, rapprochement de documents et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).