Qwen2.5-Omni-7B

Sorti le 27 mars 2025, Qwen2.5-Omni-7B est désormais ancien à l’échelle de l’IA et largement dépassé par les modèles récents. Qwen l’a conçu comme un modèle multimodal de bout en bout, capable de traiter du texte, des images, de l’audio et de la vidéo.

Sorti le 27 mars 2025, Qwen2.5-Omni-7B est désormais ancien à l’échelle de l’IA et largement dépassé par les modèles récents. Qwen l’a conçu comme un modèle multimodal de bout en bout, capable de traiter du texte, des images, de l’audio et de la vidéo.

Son architecture Thinker-Talker produit simultanément du texte et de la parole naturelle en streaming. Le position embedding TMRoPE synchronise les horodatages vidéo avec l’audio, tandis que les entrées découpées et les sorties immédiates ciblent les interactions vocales et vidéo en temps réel. Ses poids sont ouverts sous licence Apache 2.0, avec usage commercial autorisé.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie27 mars 2025
Multimodaloui
Paramètres7 milliards
Paramètres actifs11 milliards
Fenêtre de contexte32 768 tokens
Modalités (entrée → sortie)text,image,audio,video → embedding

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
FLEURS95,9 %1ᵉ / 6llm-statsAuto-déclaré
DocVQA95,2 %3ᵉ / 26llm-statsAuto-déclaré
GSM8k88,7 %29ᵉ / 47llm-statsAuto-déclaré
ChartQA85,3 %14ᵉ / 24llm-statsAuto-déclaré
TextVQA84,4 %3ᵉ / 15llm-statsAuto-déclaré
AI2D83,2 %26ᵉ / 32llm-statsAuto-déclaré
MMBench-V1.181,8 %15ᵉ / 18llm-statsAuto-déclaré
HumanEval78,7 %46ᵉ / 65llm-statsAuto-déclaré
MBPP73,2 %20ᵉ / 33llm-statsAuto-déclaré
VideoMME w sub.72,4 %8ᵉ / 9llm-statsAuto-déclaré
MATH71,5 %35ᵉ / 70llm-statsAuto-déclaré
MMLU-Redux71,0 %45ᵉ / 48llm-statsAuto-déclaré
MVBench70,3 %12ᵉ / 17llm-statsAuto-déclaré
RealWorldQA70,3 %21ᵉ / 25llm-statsAuto-déclaré
EgoSchema68,6 %7ᵉ / 9llm-statsAuto-déclaré
MathVista67,9 %19ᵉ / 38llm-statsAuto-déclaré
MultiPL-E65,8 %12ᵉ / 13llm-statsAuto-déclaré
MMStar64,0 %18ᵉ / 22llm-statsAuto-déclaré
MMMU59,2 %46ᵉ / 61llm-statsAuto-déclaré
MuirBench59,2 %11ᵉ / 11llm-statsAuto-déclaré
OCRBench_V257,8 %6ᵉ / 7llm-statsAuto-déclaré
MMLU-Pro47,0 %115ᵉ / 125llm-statsAuto-déclaré
ODinW42,4 %12ᵉ / 16llm-statsAuto-déclaré
MMMU-Pro36,6 %63ᵉ / 64llm-statsAuto-déclaré
GPQA30,8 %206ᵉ / 219llm-statsAuto-déclaré
LiveBench29,6 %38ᵉ / 38llm-statsAuto-déclaré
MathVision25,0 %32ᵉ / 32llm-statsAuto-déclaré
MM-MT-Bench6,0 %17ᵉ / 17llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Qwen2.5-Omni-7B réunit dans un même modèle la reconnaissance vocale, la traduction de la parole vers le texte, la compréhension audio, le raisonnement sur image, la compréhension vidéo, la génération vocale et le suivi d’instructions vocales. Parmi les évaluations MTEB rapportées, son meilleur résultat concerne MVEB Video-Only, qui mesure la qualité des embeddings vidéo en classification et en classification par paires. Sa fenêtre de contexte de 32 768 tokens et son format de 7 milliards de paramètres offrent un positionnement relativement compact. À sa sortie, son classement GPQA le situait dans le top 92% des 84 LLM de sa génération, sans le placer dans le haut du panier.

Limites et points d’attention. Les résultats MVEB sur l’audiovisuel et sur l’association entre texte et vidéo sont nettement inférieurs au score Video-Only. Ce contraste indique une meilleure aptitude à représenter la vidéo seule qu’à relier plusieurs modalités dans ces tests d’embeddings. Après environ un an, ancienneté très longue dans ce secteur, ses performances sont aujourd’hui largement dépassées et ce type de version est souvent retiré du catalogue de son éditeur. Son intérêt tient surtout à son architecture multimodale unifiée, à la génération vocale en streaming et à sa licence ouverte.


Sources des données : LLM-Stats (llm-stats.com) · MTEB — Massive Text Embedding Benchmark.