Hanno-Labs/dinghy-law-0.6b-v1
Hanno-Labs/dinghy-law-0.6b-v1 est un modèle d’embedding juridique de 597 millions de paramètres, affiné à partir de Qwen3-Embedding-0.6B. Il produit un vecteur dense unique de 1 024 dimensions par entrée. Ses poids sont ouverts sous licence Apache 2.0.
Hanno-Labs/dinghy-law-0.6b-v1 est un modèle d’embedding juridique de 597 millions de paramètres, affiné à partir de Qwen3-Embedding-0.6B. Il produit un vecteur dense unique de 1 024 dimensions par entrée. Ses poids sont ouverts sous licence Apache 2.0.
Entraîné sur des textes juridiques en anglais, en allemand et en chinois, il traite des séquences de 8 192 tokens. Il cible la recherche dans les lois, la jurisprudence et les contrats, ainsi que le RAG, le reranking par similarité cosinus, le clustering et la déduplication. Une instruction peut accompagner la requête, tandis que le document est encodé sans instruction.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Hanno-Labs |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 13 juillet 2026 |
| Dimension du vecteur | 1 024 |
| Représentation | dense (un vecteur unique par entrée) |
| Paramètres | 597 millions |
| Paramètres actifs | 597 millions |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 59,8 % | 20ᵉ / 213 | mteb | ✅ Mesuré |
| MTEB: Legal | 65,8 % | 5ᵉ / 160 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 58,5 % | 47ᵉ / 214 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Legal
MTEB: RTEB Legal
Notre analyse
Forces. Le modèle figure dans le top 10 de MTEB Legal, son meilleur résultat relatif. Ce classement souligne son aptitude à retrouver des informations dans des décisions de justice, des textes législatifs et des questions-réponses juridiques. Son rang sur RTEB Legal confirme ce positionnement dans la recherche documentaire spécialisée. La séquence de 8 192 tokens facilite l’encodage de documents juridiques longs. La licence Apache 2.0 et les poids ouverts permettent l’auto-hébergement, l’adaptation et l’intégration dans une infrastructure privée.
Limites et points d'attention. RTEB German constitue son track le plus en retrait. Ce benchmark couvre aussi la santé et l’entreprise, deux domaines où son positionnement apparaît moins solide que sur le juridique. Les langues d’entraînement juridique se concentrent sur l’anglais, l’allemand et le chinois. Les vecteurs de 1 024 dimensions produisent des index plus lourds et des calculs de similarité plus coûteux que des représentations de dimension inférieure. L’intégration doit aussi respecter l’asymétrie d’encodage entre requêtes et documents. Comme tout modèle d’embedding, il nécessite un modèle génératif séparé dans une chaîne RAG. Usages pertinents : recherche juridique multilingue, RAG documentaire, regroupement de contrats et déduplication de corpus légaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).