izhx/udever-bloom-7b1

Publié par izhx le 24 octobre 2023, izhx/udever-bloom-7b1 est un modèle d’embedding fondé sur l’architecture Transformer BLOOM-7b1, de type décodeur uniquement. Son orientation est multilingue et sa diffusion relève de la licence BigScience.

Publié par izhx le 24 octobre 2023, izhx/udever-bloom-7b1 est un modèle d’embedding fondé sur l’architecture Transformer BLOOM-7b1, de type décodeur uniquement. Son orientation est multilingue et sa diffusion relève de la licence BigScience.

Le modèle produit un vecteur unique à partir du dernier état caché du dernier token. Ajusté par BitFit sur MS MARCO Passage Ranking, SNLI et MultiNLI avec une perte contrastive et des négatifs difficiles, il distingue requêtes et documents par des marqueurs spécifiques. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurizhx
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/spaces/bigscience/license
Date de sortie24 octobre 2023
Représentationvecteur unique extrait du dernier état caché au dernier token
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR49,3 %105ᵉ / 192mteb✅ Mesuré
MTEB: RTEB French6,8 %168ᵉ / 218mteb✅ Mesuré
MTEB: Chinese57,4 %49ᵉ / 58mteb✅ Mesuré
MTEB: Indic45,6 %49ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le positionnement le plus favorable apparaît sur MTEB Indic, où le modèle se situe dans la première moitié du classement pour des tâches couvrant plusieurs langues indiennes. Sur BEIR, ses résultats le placent près du milieu du tableau en recherche zero-shot à travers des domaines et des tâches de recherche d’information hétérogènes. L’entraînement contrastif avec négatifs difficiles et l’encodage différencié des requêtes et des documents correspondent directement aux besoins d’un moteur de recherche sémantique ou d’un système RAG.

Limites et points d'attention. Sur MTEB Chinese, izhx/udever-bloom-7b1 figure près du bas du classement malgré un score supérieur à ceux de ses autres tracks. Les résultats sont particulièrement faibles sur RTEB French, qui évalue la recherche en français dans les domaines juridique et général, ainsi que sur MTEB Instruction Following. Sorti il y a environ trois ans, il appartient à une génération ancienne à l’échelle de l’IA et apparaît probablement dépassé par des embeddings plus récents. Usages pertinents : expérimentation multilingue, recherche zero-shot généraliste, RAG et regroupement de textes lorsque ses performances linguistiques ont été validées sur le corpus visé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).