Qwen/Qwen2.5-Omni-3B
Qwen/Qwen2.5-Omni-3B est un modèle d’embedding multimodal publié par Qwen le 30 avril 2025 sous licence ouverte Apache 2.0. Ses 6 milliards de paramètres, tous actifs, produisent des représentations vectorielles denses de 2 048 dimensions à partir de contenus textuels, visuels, audio et…
Qwen/Qwen2.5-Omni-3B est un modèle d’embedding multimodal publié par Qwen le 30 avril 2025 sous licence ouverte Apache 2.0. Ses 6 milliards de paramètres, tous actifs, produisent des représentations vectorielles denses de 2 048 dimensions à partir de contenus textuels, visuels, audio et vidéo.
Ces vecteurs servent à la recherche sémantique, à la récupération de contenus pour le RAG, au calcul de similarité et au clustering. L’architecture Thinker-Talker traite les différentes modalités de bout en bout, tandis que TMRoPE synchronise les horodatages audio et vidéo, notamment avec des entrées fragmentées ou en flux continu.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 30 avril 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Paramètres | 6 milliards |
| Paramètres actifs | 6 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MAEB Audio-Only | 33,5 % | 49ᵉ / 60 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Only | 30,1 % | 32ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MAEB | 23,4 % | 20ᵉ / 21 | mteb | ✅ Mesuré |
| MTEB: MVEB | 11,4 % | 15ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 7,8 % | 23ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MAEB Audio-Only
MTEB: MVEB Video-Only
Notre analyse
Forces. Le meilleur résultat relatif du modèle apparaît sur MAEB Audio-Only, consacré à la classification, au clustering et à la comparaison de paires dans la modalité audio. Cette piste reste néanmoins située dans la partie basse du classement. La prise en charge conjointe du texte, des images, de l’audio et de la vidéo permet de construire des index multimodaux, avec une synchronisation temporelle adaptée aux contenus audiovisuels. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires.
Limites et points d’attention. Les classements MTEB sont faibles sur l’ensemble des pistes communiquées. Le modèle termine dernier sur MVEB, avant-dernier sur MAEB et MVEB Video-Text, et près du bas du tableau sur MVEB Video-Only. Ses performances paraissent donc limitées pour la recherche et la structuration de contenus audiovisuels, particulièrement dans les scénarios croisant texte et vidéo. Les vecteurs denses de 2 048 dimensions alourdissent les index et augmentent le coût de stockage et de recherche. Sorti environ un an auparavant, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : expérimentation auto-hébergée d’embeddings multimodaux et indexation audio lorsque la licence ouverte prime sur le niveau de performance.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).