Qwen2.5-Omni-7B
Sorti le 27 mars 2025, Qwen2.5-Omni-7B est désormais ancien à l’échelle de l’IA et largement dépassé par les modèles récents. Qwen l’a conçu comme un modèle multimodal de bout en bout, capable de traiter du texte, des images, de l’audio et de la vidéo.
Sorti le 27 mars 2025, Qwen2.5-Omni-7B est désormais ancien à l’échelle de l’IA et largement dépassé par les modèles récents. Qwen l’a conçu comme un modèle multimodal de bout en bout, capable de traiter du texte, des images, de l’audio et de la vidéo.
Son architecture Thinker-Talker produit simultanément du texte et de la parole naturelle en streaming. Le position embedding TMRoPE synchronise les horodatages vidéo avec l’audio, tandis que les entrées découpées et les sorties immédiates ciblent les interactions vocales et vidéo en temps réel. Ses poids sont ouverts sous licence Apache 2.0, avec usage commercial autorisé.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 27 mars 2025 |
| Multimodal | oui |
| Paramètres | 7 milliards |
| Paramètres actifs | 11 milliards |
| Fenêtre de contexte | 32 768 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| FLEURS | 95,9 % | 1ᵉ / 6 | llm-stats | Auto-déclaré |
| DocVQA | 95,2 % | 3ᵉ / 26 | llm-stats | Auto-déclaré |
| GSM8k | 88,7 % | 29ᵉ / 47 | llm-stats | Auto-déclaré |
| ChartQA | 85,3 % | 14ᵉ / 24 | llm-stats | Auto-déclaré |
| TextVQA | 84,4 % | 3ᵉ / 15 | llm-stats | Auto-déclaré |
| AI2D | 83,2 % | 26ᵉ / 32 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 81,8 % | 15ᵉ / 18 | llm-stats | Auto-déclaré |
| HumanEval | 78,7 % | 46ᵉ / 65 | llm-stats | Auto-déclaré |
| MBPP | 73,2 % | 20ᵉ / 33 | llm-stats | Auto-déclaré |
| VideoMME w sub. | 72,4 % | 8ᵉ / 9 | llm-stats | Auto-déclaré |
| MATH | 71,5 % | 35ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Redux | 71,0 % | 45ᵉ / 48 | llm-stats | Auto-déclaré |
| MVBench | 70,3 % | 12ᵉ / 17 | llm-stats | Auto-déclaré |
| RealWorldQA | 70,3 % | 21ᵉ / 25 | llm-stats | Auto-déclaré |
| EgoSchema | 68,6 % | 7ᵉ / 9 | llm-stats | Auto-déclaré |
| MathVista | 67,9 % | 19ᵉ / 38 | llm-stats | Auto-déclaré |
| MultiPL-E | 65,8 % | 12ᵉ / 13 | llm-stats | Auto-déclaré |
| MMStar | 64,0 % | 18ᵉ / 22 | llm-stats | Auto-déclaré |
| MMMU | 59,2 % | 46ᵉ / 61 | llm-stats | Auto-déclaré |
| MuirBench | 59,2 % | 11ᵉ / 11 | llm-stats | Auto-déclaré |
| OCRBench_V2 | 57,8 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| MMLU-Pro | 47,0 % | 115ᵉ / 125 | llm-stats | Auto-déclaré |
| ODinW | 42,4 % | 12ᵉ / 16 | llm-stats | Auto-déclaré |
| MMMU-Pro | 36,6 % | 63ᵉ / 64 | llm-stats | Auto-déclaré |
| GPQA | 30,8 % | 206ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveBench | 29,6 % | 38ᵉ / 38 | llm-stats | Auto-déclaré |
| MathVision | 25,0 % | 32ᵉ / 32 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 6,0 % | 17ᵉ / 17 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Qwen2.5-Omni-7B réunit dans un même modèle la reconnaissance vocale, la traduction de la parole vers le texte, la compréhension audio, le raisonnement sur image, la compréhension vidéo, la génération vocale et le suivi d’instructions vocales. Parmi les évaluations MTEB rapportées, son meilleur résultat concerne MVEB Video-Only, qui mesure la qualité des embeddings vidéo en classification et en classification par paires. Sa fenêtre de contexte de 32 768 tokens et son format de 7 milliards de paramètres offrent un positionnement relativement compact. À sa sortie, son classement GPQA le situait dans le top 92% des 84 LLM de sa génération, sans le placer dans le haut du panier.
Limites et points d’attention. Les résultats MVEB sur l’audiovisuel et sur l’association entre texte et vidéo sont nettement inférieurs au score Video-Only. Ce contraste indique une meilleure aptitude à représenter la vidéo seule qu’à relier plusieurs modalités dans ces tests d’embeddings. Après environ un an, ancienneté très longue dans ce secteur, ses performances sont aujourd’hui largement dépassées et ce type de version est souvent retiré du catalogue de son éditeur. Son intérêt tient surtout à son architecture multimodale unifiée, à la génération vocale en streaming et à sa licence ouverte.
Sources des données : LLM-Stats (llm-stats.com) · MTEB — Massive Text Embedding Benchmark.