ICT-TIME-and-Querit/BOOM_4B_v1
Publié le 31 janvier 2026 par ICT-TIME-and-Querit, ICT-TIME-and-Querit/BOOM_4B_v1 est un modèle d’embedding textuel dense de 4 milliards de paramètres, tous actifs. Adapté de Qwen/Qwen3-4B, il produit des vecteurs de 2 560 dimensions et accepte une longueur de séquence de 32 000 tokens.
Publié le 31 janvier 2026 par ICT-TIME-and-Querit, ICT-TIME-and-Querit/BOOM_4B_v1 est un modèle d’embedding textuel dense de 4 milliards de paramètres, tous actifs. Adapté de Qwen/Qwen3-4B, il produit des vecteurs de 2 560 dimensions et accepte une longueur de séquence de 32 000 tokens.
Distribué sous licence ouverte Apache 2.0, il sert à la recherche sémantique, au RAG, au reranking, à la classification, au clustering et à la mesure de similarité. Il repose sur une fusion Multi-SLERP de cinq modèles et s’utilise avec Sentence Transformers ou Transformers, avec des requêtes éventuellement accompagnées d’une instruction de tâche.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ICT-TIME-and-Querit |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 31 janvier 2026 |
| Dimension du vecteur | 2 560 |
| Représentation | dense |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 69,3 % | 23ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 70,8 % | 19ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 50,5 % | 38ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 63,6 % | 23ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 67,4 % | 37ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 64,5 % | 6ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 60,4 % | 12ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 57,6 % | 16ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 58,8 % | 42ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 75,1 % | 6ᵉ / 41 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: Chemical
Notre analyse
Forces. Les résultats MTEB placent le modèle dans le top 10 des tracks Chemical et Medical, ce qui souligne son intérêt pour la recherche et la mise en correspondance de textes scientifiques, biomédicaux, cliniques ou liés à la santé grand public. Sa fenêtre de 32 000 tokens facilite le traitement de documents longs avant leur indexation. Le pooling sur le dernier token et la possibilité d’ajouter une instruction permettent d’adapter la représentation à la tâche visée. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des systèmes de recherche internes.
Limites et points d'attention. Les performances sont moins distinctives sur RTEB Finance, où le modèle se situe derrière une part importante des modèles évalués. RTEB Healthcare affiche également un classement moins favorable que le track Medical, ce qui invite à distinguer les corpus et protocoles malgré leur proximité thématique. Les vecteurs de 2 560 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Les usages pertinents sont la recherche sémantique, le RAG et le clustering de documents longs, notamment dans les domaines chimique et médical.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).