Baidu: ERNIE 4.5 VL 424B A47B
Sorti le 30 juin 2025, Baidu: ERNIE 4.5 VL 424B A47B est déjà ancien à l’échelle de l’IA. Ce modèle multimodal à poids ouverts traite le texte et l’image, avec une architecture MoE de 424 milliards de paramètres au total et 47 milliards activés par token.
Sorti le 30 juin 2025, Baidu: ERNIE 4.5 VL 424B A47B est déjà ancien à l’échelle de l’IA. Ce modèle multimodal à poids ouverts traite le texte et l’image, avec une architecture MoE de 424 milliards de paramètres au total et 47 milliards activés par token.
Son routage sépare les modalités textuelle et visuelle pour la génération de texte, la compréhension d’image et le raisonnement cross-modal. Il propose des modes thinking et non-thinking, une fenêtre de 131 072 tokens et un service avec vLLM. Son tarif, 80% sous la moyenne des LLM similaires, reste son principal argument économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Baidu |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 30 juin 2025 |
| Connaissances jusqu'à | 2025-03-31 |
| Multimodal | oui |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | image,text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 96,0 % | 67ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 89,0 % | 77ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 88,0 % | 82ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 62,0 % | 80ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 52,0 % | 117ᵉ / 155 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : General Knowledge (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NovitaAI | 0,42 $ | 1,25 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 80 % en dessous de la moyenne des LLM similaires, et 13,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 9 min 20 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Les baselines Ethics, General Knowledge et Email Classification atteignent ou frôlent leur plafond. Email Classification se situe près du haut du classement, même si le modèle partage sa place avec 40 autres. Les résultats sur les hallucinations restent élevés en valeur absolue. La fenêtre de 131 072 tokens convient aux entrées volumineuses, tandis que les connaissances s’étendent jusqu’au 31 mars 2025. Les poids ouverts, le service avec vLLM et l’activation de 47 milliards de paramètres par token donnent un cadre concret au déploiement de cette architecture multimodale. Le coût est très économique, environ 13,1 fois inférieur à celui des modèles frontière.
Limites et points d’attention. Les benchmarks utilisés sont plafonnés et départagent mal les modèles. Le score maximal en Ethics est partagé avec 71 autres modèles, tandis que General Knowledge rassemble aussi de nombreux ex æquo. Coding se situe autour du milieu du classement et Mathematics dans sa moitié inférieure. Ces positions limitaient déjà la portée des scores à la sortie. Près d’un an plus tard, ses performances sont largement dépassées par les générations récentes, et les modèles de cette ancienneté sont souvent retirés des catalogues des éditeurs. Ses 424 milliards de paramètres totaux restent toutefois caractéristiques de l’échelle retenue par Baidu pour combiner texte, vision et raisonnement cross-modal.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).