Qwen/Qwen2.5-Omni-3B

Qwen/Qwen2.5-Omni-3B est un modèle d’embedding multimodal publié par Qwen le 30 avril 2025 sous licence ouverte Apache 2.0. Ses 6 milliards de paramètres, tous actifs, produisent des représentations vectorielles denses de 2 048 dimensions à partir de contenus textuels, visuels, audio et…

Qwen/Qwen2.5-Omni-3B est un modèle d’embedding multimodal publié par Qwen le 30 avril 2025 sous licence ouverte Apache 2.0. Ses 6 milliards de paramètres, tous actifs, produisent des représentations vectorielles denses de 2 048 dimensions à partir de contenus textuels, visuels, audio et vidéo.

Ces vecteurs servent à la recherche sémantique, à la récupération de contenus pour le RAG, au calcul de similarité et au clustering. L’architecture Thinker-Talker traite les différentes modalités de bout en bout, tandis que TMRoPE synchronise les horodatages audio et vidéo, notamment avec des entrées fragmentées ou en flux continu.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie30 avril 2025
Dimension du vecteur2 048
Représentationdense
Paramètres6 milliards
Paramètres actifs6 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text,image,audio,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MAEB Audio-Only33,5 %49ᵉ / 60mteb✅ Mesuré
MTEB: MVEB Video-Only30,1 %32ᵉ / 32mteb✅ Mesuré
MTEB: MAEB23,4 %20ᵉ / 21mteb✅ Mesuré
MTEB: MVEB11,4 %15ᵉ / 15mteb✅ Mesuré
MTEB: MVEB Video-Text7,8 %23ᵉ / 23mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MAEB Audio-Only

speechbrain/m-ctc-t-lar…36 %
▶ Qwen/Qwen2.5-Omni-3B34 %
asapp/sew-d-tiny-100k-f…33 %

MTEB: MVEB Video-Only

VLM2Vec/VLM2Vec-V2.053 %
▶ Qwen/Qwen2.5-Omni-3B30 %

Notre analyse

Forces. Le meilleur résultat relatif du modèle apparaît sur MAEB Audio-Only, consacré à la classification, au clustering et à la comparaison de paires dans la modalité audio. Cette piste reste néanmoins située dans la partie basse du classement. La prise en charge conjointe du texte, des images, de l’audio et de la vidéo permet de construire des index multimodaux, avec une synchronisation temporelle adaptée aux contenus audiovisuels. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires.

Limites et points d’attention. Les classements MTEB sont faibles sur l’ensemble des pistes communiquées. Le modèle termine dernier sur MVEB, avant-dernier sur MAEB et MVEB Video-Text, et près du bas du tableau sur MVEB Video-Only. Ses performances paraissent donc limitées pour la recherche et la structuration de contenus audiovisuels, particulièrement dans les scénarios croisant texte et vidéo. Les vecteurs denses de 2 048 dimensions alourdissent les index et augmentent le coût de stockage et de recherche. Sorti environ un an auparavant, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : expérimentation auto-hébergée d’embeddings multimodaux et indexation audio lorsque la licence ouverte prime sur le niveau de performance.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).