ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1

ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 est un modèle d’embedding dense de 4 milliards de paramètres, publié par ICT-TIME-and-Querit le 2 mai 2026 sous licence ouverte Apache 2.0. Adapté de Qwen/Qwen3-4B, il produit des vecteurs de 2 560 dimensions et accepte une longueur de…

ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 est un modèle d’embedding dense de 4 milliards de paramètres, publié par ICT-TIME-and-Querit le 2 mai 2026 sous licence ouverte Apache 2.0. Adapté de Qwen/Qwen3-4B, il produit des vecteurs de 2 560 dimensions et accepte une longueur de contexte indiquée de 32k.

Son entraînement combine des données générales et multilingues. Destiné à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, il utilise un pooling sur le dernier token. Il fonctionne avec Sentence Transformers ou Transformers, avec des instructions pour les requêtes, tandis que les documents de retrieval n’en nécessitent pas.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurICT-TIME-and-Querit
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie2 mai 2026
Dimension du vecteur2 560
Représentationdense
Paramètres4 milliards
Paramètres actifs4 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval72,1 %12ᵉ / 170mteb✅ Mesuré
MTEB: Code Information Retrieval77,7 %10ᵉ / 49mteb✅ Mesuré
MTEB: Code78,0 %10ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal53,5 %32ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare64,0 %20ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance68,6 %35ᵉ / 97mteb✅ Mesuré
MTEB: Medical64,3 %9ᵉ / 158mteb✅ Mesuré
MTEB: Legal62,2 %8ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French55,2 %23ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German60,9 %39ᵉ / 209mteb✅ Mesuré
MTEB: Chemical75,2 %5ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ ICT-TIME-and-Querit/ICT…72 %

MTEB: Code Information Retrieval

▶ ICT-TIME-and-Querit/ICT…78 %

Notre analyse

Forces. Les résultats MTEB placent le modèle parmi les dix premiers en Chemical et en Medical, ce qui souligne son intérêt pour la recherche et le rapprochement de textes scientifiques, biomédicaux, cliniques ou liés à la santé. Il obtient également un classement solide en Long-context Retrieval, cohérent avec sa fenêtre de 32k pour l’indexation et la recherche dans des documents longs. Sa licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La fusion Multi-SLERP de deux modèles associe un premier stade généraliste à un second intégrant des données générales, multilingues et spécialisées dans le retrieval.

Limites et points d’attention. Le positionnement est moins favorable sur RTEB Finance, où le modèle se situe derrière de nombreux concurrents, ce qui invite à valider sa pertinence sur les corpus financiers ciblés. Les vecteurs denses de 2 560 dimensions alourdissent les index et augmentent les besoins de stockage ainsi que le coût de la recherche par rapport à des représentations plus compactes. Ses 4 milliards de paramètres constituent aussi une charge notable pour le déploiement local. Usages pertinents : recherche sémantique, RAG documentaire à contexte long, similarité et clustering, notamment sur des corpus scientifiques ou médicaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).