Octen/Octen-Embedding-8B
Publié par Octen le 23 décembre 2025 sous licence ouverte Apache 2.0, Octen/Octen-Embedding-8B est un modèle dense de 8 milliards de paramètres, tous actifs. Dérivé de Qwen/Qwen3-Embedding-8B et affiné avec LoRA, il produit des vecteurs de 4 096 dimensions.
Publié par Octen le 23 décembre 2025 sous licence ouverte Apache 2.0, Octen/Octen-Embedding-8B est un modèle dense de 8 milliards de paramètres, tous actifs. Dérivé de Qwen/Qwen3-Embedding-8B et affiné avec LoRA, il produit des vecteurs de 4 096 dimensions.
Sa couverture multilingue comprend l’anglais, le chinois et plus de 100 langues. Il transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la similarité documentaire, au clustering, à la classification par embeddings et à la récupération cross-lingue, notamment dans les domaines juridique, financier et médical.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Octen |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 23 décembre 2025 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 77,6 % | 1ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 67,9 % | 9ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 83,2 % | 7ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 61,4 % | 8ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 74,1 % | 5ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Dutch | 65,6 % | 4ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 8,9 % | 5ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB Legal
Notre analyse
Forces. Octen/Octen-Embedding-8B se distingue surtout en retrieval spécialisé. Ses résultats RTEB le placent parmi les dix premiers en juridique, où il occupe la première place, ainsi qu’en finance et en santé. Il figure également dans le haut des classements pour la recherche en allemand et en français, tandis que le track Dutch confirme ses aptitudes multilingues sur plusieurs types de tâches, dont la classification et le clustering. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG. Le modèle s’utilise avec Sentence Transformers ou Transformers, avec normalisation des embeddings dans l’exemple Transformers.
Limites et points d'attention. Les résultats sont relativement moins élevés sur RTEB French et Dutch que sur les tracks juridique et financier, malgré des classements toujours situés dans le top 10. Les vecteurs denses de 4 096 dimensions alourdissent les index et rendent le stockage ainsi que la recherche vectorielle plus coûteux que des représentations de dimension inférieure. Ses 8 milliards de paramètres actifs impliquent aussi une exécution plus exigeante qu’avec un petit modèle d’embedding. Usages pertinents : retrieval juridique, financier ou médical, recherche multilingue, RAG, similarité documentaire et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).