Octen/Octen-Embedding-0.6B
Publié par Octen le 10 janvier 2026 sous licence ouverte Apache 2.0, Octen/Octen-Embedding-0.6B est un modèle dense de 596 millions de paramètres, affiné par LoRA à partir de Qwen3-Embedding-0.6B. Il produit des vecteurs de 1 024 dimensions et accepte jusqu’à 32 768 tokens.
Publié par Octen le 10 janvier 2026 sous licence ouverte Apache 2.0, Octen/Octen-Embedding-0.6B est un modèle dense de 596 millions de paramètres, affiné par LoRA à partir de Qwen3-Embedding-0.6B. Il produit des vecteurs de 1 024 dimensions et accepte jusqu’à 32 768 tokens.
Le modèle couvre plus de 100 langues, notamment l’anglais et le chinois. Il transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la similarité, au clustering, à la recherche interlingue et à la classification par embeddings. Son intégration repose sur Sentence Transformers ou Transformers, avec normalisation L2 des vecteurs dans ce dernier cas.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Octen |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 10 janvier 2026 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 596 millions |
| Paramètres actifs | 596 millions |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 71,1 % | 6ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 56,9 % | 44ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 73,5 % | 25ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 46,1 % | 57ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 65,7 % | 22ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Thai | 58,6 % | 19ᵉ / 28 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB Legal
Notre analyse
Forces. Les résultats MTEB placent surtout Octen/Octen-Embedding-0.6B parmi les modèles les mieux classés de RTEB Legal, ce qui souligne son intérêt pour la recherche dans des décisions, des textes législatifs et des synthèses juridiques. Le modèle obtient aussi des positions solides sur RTEB German et RTEB Finance, avec une aptitude à la recherche multilingue et spécialisée. Sa fenêtre de 32 768 tokens facilite le traitement de documents longs, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires. Ses 596 millions de paramètres restent adaptés à des déploiements plus contenus que ceux de modèles d’embedding beaucoup plus volumineux.
Limites et points d'attention. Le classement Thai se situe dans le bas du panel évalué, tandis que RTEB Healthcare reste plus proche du milieu de tableau. RTEB French affiche un positionnement moins fort que les tracks juridique et allemand. Les vecteurs de 1 024 dimensions imposent par ailleurs un stockage et un calcul de similarité plus importants que des représentations de dimension inférieure, particulièrement à grande échelle. Usages pertinents : recherche juridique, financière ou multilingue, RAG sur documents longs, rapprochement de documents et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).