OpenAI: GPT-4o Transcribe
OpenAI: GPT-4o Transcribe est un modèle de reconnaissance vocale publié par OpenAI le 27 avril 2026. Il convertit la parole en texte et se positionne comme une solution très économique parmi les modèles comparables.
OpenAI: GPT-4o Transcribe est un modèle de reconnaissance vocale publié par OpenAI le 27 avril 2026. Il convertit la parole en texte et se positionne comme une solution très économique parmi les modèles comparables.
Sa tarification distingue le traitement des données d’entrée et la génération du texte en sortie. Elle se situe entièrement sous la moyenne des modèles similaires, ce qui favorise les traitements réguliers ou à grande échelle.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Reconnaissance vocale (speech-to-text) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 27 avril 2026 |
| Taux d'erreur de mots (WER) | 3,96 % (plus bas = meilleur) |
| Modalités (entrée → sortie) | audio → transcription |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 2,5 $ | 10 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des modèles similaires.
Notre analyse
Forces. Son WER de 4,0 %, mesuré par Artificial Analysis, indique une bonne intelligibilité et un faible taux d’erreurs de transcription, même s’il reste au-dessus du seuil d’excellence inférieur à 3 %. Ce résultat est étayé par trois sources de données concordantes. Le positionnement très économique constitue un autre atout pour les volumes importants de parole à convertir en texte.
Limites et points d’attention. Le WER montre que la transcription n’est pas parfaite et peut encore produire environ quatre mots erronés sur cent dans les conditions de mesure. Une relecture reste donc pertinente lorsque l’exactitude du texte est critique. Le tarif sépare l’entrée, facturée 2,5 $ par million de tokens, et la sortie, facturée 10 $ par million. Usages pertinents : sous-titrage, transcription de réunions, dictée et commandes vocales.
Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).