ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1
ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 est un modèle d’embedding dense de 4 milliards de paramètres, publié par ICT-TIME-and-Querit le 2 mai 2026 sous licence ouverte Apache 2.0. Adapté de Qwen/Qwen3-4B, il produit des vecteurs de 2 560 dimensions et accepte une longueur de…
ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 est un modèle d’embedding dense de 4 milliards de paramètres, publié par ICT-TIME-and-Querit le 2 mai 2026 sous licence ouverte Apache 2.0. Adapté de Qwen/Qwen3-4B, il produit des vecteurs de 2 560 dimensions et accepte une longueur de contexte indiquée de 32k.
Son entraînement combine des données générales et multilingues. Destiné à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, il utilise un pooling sur le dernier token. Il fonctionne avec Sentence Transformers ou Transformers, avec des instructions pour les requêtes, tandis que les documents de retrieval n’en nécessitent pas.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ICT-TIME-and-Querit |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 2 mai 2026 |
| Dimension du vecteur | 2 560 |
| Représentation | dense |
| Paramètres | 4 milliards |
| Paramètres actifs | 4 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 72,1 % | 12ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 77,7 % | 10ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 78,0 % | 10ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 53,5 % | 32ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 64,0 % | 20ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 68,6 % | 35ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 64,3 % | 9ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 62,2 % | 8ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 55,2 % | 23ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 60,9 % | 39ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 75,2 % | 5ᵉ / 41 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Code Information Retrieval
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les dix premiers en Chemical et en Medical, ce qui souligne son intérêt pour la recherche et le rapprochement de textes scientifiques, biomédicaux, cliniques ou liés à la santé. Il obtient également un classement solide en Long-context Retrieval, cohérent avec sa fenêtre de 32k pour l’indexation et la recherche dans des documents longs. Sa licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La fusion Multi-SLERP de deux modèles associe un premier stade généraliste à un second intégrant des données générales, multilingues et spécialisées dans le retrieval.
Limites et points d’attention. Le positionnement est moins favorable sur RTEB Finance, où le modèle se situe derrière de nombreux concurrents, ce qui invite à valider sa pertinence sur les corpus financiers ciblés. Les vecteurs denses de 2 560 dimensions alourdissent les index et augmentent les besoins de stockage ainsi que le coût de la recherche par rapport à des représentations plus compactes. Ses 4 milliards de paramètres constituent aussi une charge notable pour le déploiement local. Usages pertinents : recherche sémantique, RAG documentaire à contexte long, similarité et clustering, notamment sur des corpus scientifiques ou médicaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).