Octen/Octen-Embedding-4B
Publié par Octen le 30 décembre 2025 sous licence ouverte Apache 2.0, Octen/Octen-Embedding-4B est un modèle d’embedding dense de 4 milliards de paramètres, tous actifs. Affiné par LoRA à partir de Qwen3-Embedding-4B, il produit des vecteurs de 2 560 dimensions.
Publié par Octen le 30 décembre 2025 sous licence ouverte Apache 2.0, Octen/Octen-Embedding-4B est un modèle d’embedding dense de 4 milliards de paramètres, tous actifs. Affiné par LoRA à partir de Qwen3-Embedding-4B, il produit des vecteurs de 2 560 dimensions.
Le modèle accepte des séquences allant jusqu’à 40 960 tokens et prend en charge les usages multilingues et interlingues. Il représente chaque texte par le vecteur du dernier token, normalisé en L2, afin d’alimenter la recherche sémantique, la recherche d’information, le RAG, la mesure de similarité et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Octen |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 30 décembre 2025 |
| Dimension du vecteur | 2 560 |
| Représentation | dense (vecteur unique issu du dernier token, normalisé L2) |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 73,9 % | 4ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 68,4 % | 5ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 80,0 % | 13ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 64,6 % | 5ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 73,3 % | 6ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Dutch | 63,8 % | 7ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB Legal
Notre analyse
Forces. Les résultats MTEB situent Octen/Octen-Embedding-4B parmi les modèles les mieux classés sur plusieurs tracks de retrieval spécialisés. Il se distingue particulièrement en recherche juridique, médicale et germanophone, tout en obtenant des positions de premier plan en français et en néerlandais. Le track financier confirme également son intérêt pour la recherche dans des corpus métier. Sa fenêtre de 40 960 tokens facilite l’indexation de documents longs, tandis que les capacités multilingues et interlingues conviennent aux corpus mêlant plusieurs langues. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes personnalisés.
Limites et points d'attention. Les scores bruts sont moins élevés sur les tracks French et Dutch que sur Finance, Legal ou German, même si leurs classements restent dans le top 10. La représentation dense de 2 560 dimensions augmente la taille des index, les besoins de stockage et le coût des recherches vectorielles par rapport à des embeddings de dimension plus réduite. L’emploi du seul dernier token comme représentation impose aussi de respecter précisément le format de calcul et la normalisation L2 pour conserver des comparaisons cohérentes. Usages pertinents : retrieval multilingue, RAG sur documents longs, recherche juridique, financière ou médicale, similarité sémantique et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).