Canary Qwen 2.5B, NVIDIA

Canary Qwen 2.5B, NVIDIA est un modèle de reconnaissance vocale édité par Replicate. Il transforme la parole en texte afin d’automatiser la production de transcriptions.

Canary Qwen 2.5B, NVIDIA est un modèle de reconnaissance vocale édité par Replicate. Il transforme la parole en texte afin d’automatiser la production de transcriptions.

Son taux d’erreur le place à un bon niveau de qualité, sans atteindre le seuil d’excellence inférieur à 3 %. Cette évaluation de l’intelligibilité repose sur deux sources de données concordantes.

Caractéristiques

CaractéristiqueValeur
TypeReconnaissance vocale (speech-to-text)
ÉditeurReplicate
Poids▫ n.d.
Date de sortie17 juillet 2025
Taux d'erreur de mots (WER)4,27 % (plus bas = meilleur)

Notre analyse

Forces. Canary Qwen 2.5B affiche un WER de 4,3 % selon Artificial Analysis. Comme un WER plus faible correspond à une transcription plus fidèle, ce résultat indique une bonne qualité de reconnaissance vocale. La concordance de deux sources de données renforce la solidité du positionnement présenté.

Limites et points d’attention. Le WER reste supérieur au niveau considéré comme excellent, fixé sous 3 %. Le modèle conserve donc une marge d’erreur dans la conversion de la parole en texte, ce qui justifie une vérification lorsque la fidélité de la transcription est importante. Usages pertinents : sous-titrage, transcription de réunions, dictée et commandes vocales.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).