Hanno-Labs/dinghy-law-0.6b-v1

Hanno-Labs/dinghy-law-0.6b-v1 est un modèle d’embedding juridique de 597 millions de paramètres, affiné à partir de Qwen3-Embedding-0.6B. Il produit un vecteur dense unique de 1 024 dimensions par entrée. Ses poids sont ouverts sous licence Apache 2.0.

Hanno-Labs/dinghy-law-0.6b-v1 est un modèle d’embedding juridique de 597 millions de paramètres, affiné à partir de Qwen3-Embedding-0.6B. Il produit un vecteur dense unique de 1 024 dimensions par entrée. Ses poids sont ouverts sous licence Apache 2.0.

Entraîné sur des textes juridiques en anglais, en allemand et en chinois, il traite des séquences de 8 192 tokens. Il cible la recherche dans les lois, la jurisprudence et les contrats, ainsi que le RAG, le reranking par similarité cosinus, le clustering et la déduplication. Une instruction peut accompagner la requête, tandis que le document est encodé sans instruction.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurHanno-Labs
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie13 juillet 2026
Dimension du vecteur1 024
Représentationdense (un vecteur unique par entrée)
Paramètres597 millions
Paramètres actifs597 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal59,8 %20ᵉ / 213mteb✅ Mesuré
MTEB: Legal65,8 %5ᵉ / 160mteb✅ Mesuré
MTEB: RTEB German58,5 %47ᵉ / 214mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Legal

Hanno-Labs/dinghy-law-8…73 %
minetta/nemotron-3-embe…69 %
▶ Hanno-Labs/dinghy-law-0…66 %

MTEB: RTEB Legal

minetta/nemotron-3-embe…65 %
▶ Hanno-Labs/dinghy-law-0…60 %

Notre analyse

Forces. Le modèle figure dans le top 10 de MTEB Legal, son meilleur résultat relatif. Ce classement souligne son aptitude à retrouver des informations dans des décisions de justice, des textes législatifs et des questions-réponses juridiques. Son rang sur RTEB Legal confirme ce positionnement dans la recherche documentaire spécialisée. La séquence de 8 192 tokens facilite l’encodage de documents juridiques longs. La licence Apache 2.0 et les poids ouverts permettent l’auto-hébergement, l’adaptation et l’intégration dans une infrastructure privée.

Limites et points d'attention. RTEB German constitue son track le plus en retrait. Ce benchmark couvre aussi la santé et l’entreprise, deux domaines où son positionnement apparaît moins solide que sur le juridique. Les langues d’entraînement juridique se concentrent sur l’anglais, l’allemand et le chinois. Les vecteurs de 1 024 dimensions produisent des index plus lourds et des calculs de similarité plus coûteux que des représentations de dimension inférieure. L’intégration doit aussi respecter l’asymétrie d’encodage entre requêtes et documents. Comme tout modèle d’embedding, il nécessite un modèle génératif séparé dans une chaîne RAG. Usages pertinents : recherche juridique multilingue, RAG documentaire, regroupement de contrats et déduplication de corpus légaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).