izhx/udever-bloom-3b

Publié par izhx le 24 octobre 2023, izhx/udever-bloom-3b est un modèle d’embedding dense de 3 milliards de paramètres, tous actifs. Fondé sur l’architecture Transformer BLOOM-3B à décodeur seul, il produit un vecteur numérique par texte et est diffusé sous licence BigScience.

Publié par izhx le 24 octobre 2023, izhx/udever-bloom-3b est un modèle d’embedding dense de 3 milliards de paramètres, tous actifs. Fondé sur l’architecture Transformer BLOOM-3B à décodeur seul, il produit un vecteur numérique par texte et est diffusé sous licence BigScience.

Le modèle sert à indexer et rapprocher des requêtes et des documents pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Son entraînement combine MS MARCO Passage Ranking, SNLI et MultiNLI. Il cible plusieurs langues naturelles et langages de programmation, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurizhx
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/spaces/bigscience/license
Date de sortie24 octobre 2023
Représentationdense (un vecteur par texte)
Paramètres3 milliards
Paramètres actifs3 milliards
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR47,7 %117ᵉ / 192mteb✅ Mesuré
MTEB: RTEB French4,0 %182ᵉ / 218mteb✅ Mesuré
MTEB: Chinese56,1 %51ᵉ / 58mteb✅ Mesuré
MTEB: Indic46,8 %47ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur positionnement relatif apparaît sur MTEB Indic, où le modèle se situe dans la première moitié du classement pour des tâches couvrant notamment le bitext mining et la classification. Ses résultats sur BEIR indiquent aussi une capacité exploitable en recherche zero-shot sur des tâches et domaines hétérogènes, tandis que MTEB Chinese confirme une prise en charge du chinois, sans position dominante. L’affinage BitFit associe perte contrastive et négatifs difficiles. Des jetons dédiés distinguent les requêtes des documents, puis l’encodage extrait le dernier état caché du dernier jeton.

Limites et points d'attention. Les résultats sont faibles en recherche française sur RTEB French et en recherche guidée par instructions sur MTEB Instruction Following. Le positionnement sur BEIR reste sous le milieu du classement, et celui de MTEB Chinese figure près du bas du tableau. Avec 3 milliards de paramètres actifs, le modèle est relativement lourd à déployer pour un système d’embedding. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents, cette génération étant souvent retirée des catalogues. Usages pertinents : expérimentation multilingue, recherche sémantique, RAG, similarité et clustering lorsque ses performances doivent être validées sur le corpus visé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).