Hanno-Labs/dinghy-law-4b-v1
Publié par Hanno-Labs le 22 juillet 2026, dinghy-law-4b-v1 est un modèle d'embedding juridique à poids ouverts sous licence Apache 2.0. Ses 4 milliards de paramètres sont actifs. Chaque entrée devient un unique vecteur dense de 2560 dimensions.
Publié par Hanno-Labs le 22 juillet 2026, dinghy-law-4b-v1 est un modèle d'embedding juridique à poids ouverts sous licence Apache 2.0. Ses 4 milliards de paramètres sont actifs. Chaque entrée devient un unique vecteur dense de 2560 dimensions.
Affiné à partir de Qwen3-Embedding-4B, il couvre l'anglais, l'allemand et le chinois. Il sert à la recherche sémantique, au RAG, au reranking, au rapprochement de contrats, au clustering et à la déduplication de textes juridiques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Hanno-Labs |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 22 juillet 2026 |
| Dimension du vecteur | 2 560 |
| Représentation | dense uniquement : un vecteur dense unique de 2560 dimensions par entrée |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 66,5 % | 12ᵉ / 213 | mteb | ✅ Mesuré |
| MTEB: Legal | 71,2 % | 2ᵉ / 160 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 74,0 % | 7ᵉ / 214 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB German
MTEB: Legal
Notre analyse
Forces. Dinghy-law-4b-v1 figure parmi les meilleurs modèles du track Legal de MTEB pour retrouver des décisions, des textes législatifs et des réponses juridiques. Il se classe aussi dans le top 10 de RTEB German, qui évalue la recherche en allemand dans les domaines juridique, médical et économique. Son entraînement contrastif cible les lois, la jurisprudence et les contrats en anglais, en allemand et en chinois. Les requêtes peuvent recevoir une instruction propre à la tâche, tandis que les documents sont encodés directement. La licence Apache 2.0 et les poids ouverts permettent un déploiement autonome.
Limites et points d'attention. Le modèle est moins bien placé sur RTEB Legal que sur le track Legal, même s'il reste proche du groupe de tête. Ses 4 milliards de paramètres sont tous mobilisés lors de l'encodage. Cette taille accroît les ressources nécessaires au calcul des représentations. Chaque texte occupe par ailleurs 2560 valeurs dans l'index, ce qui pèse sur le stockage et le coût des recherches de similarité à grande échelle. Sa spécialisation porte sur les contenus juridiques et sur trois langues d'entraînement. Usages pertinents : recherche juridique, RAG documentaire, rapprochement de clauses, reranking, clustering et déduplication de corpus légaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).