Mistral Large 3 (675B Instruct 2512 NVFP4)
Publié par Mistral AI le 4 décembre 2025, Mistral Large 3 (675B Instruct 2512 NVFP4) est un LLM multimodal open-weights de 675 milliards de paramètres. Son architecture Mixture-of-Experts granulaire associe un modèle de langage MoE à un encodeur visuel de 2,5 milliards de paramètres.
Publié par Mistral AI le 4 décembre 2025, Mistral Large 3 (675B Instruct 2512 NVFP4) est un LLM multimodal open-weights de 675 milliards de paramètres. Son architecture Mixture-of-Experts granulaire associe un modèle de langage MoE à un encodeur visuel de 2,5 milliards de paramètres.
Cette version post-entraînée pour suivre des instructions est quantifiée en NVFP4 avec llm-compressor. Elle traite le texte et les images, accepte une fenêtre de contexte de 256k et prend en charge les prompts système, l’appel natif de fonctions et la sortie JSON. Sa licence Apache 2.0 autorise les usages commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 4 décembre 2025 |
| Multimodal | oui |
| Paramètres | 675 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MMMLU | 85,5 % | 28ᵉ / 49 | llm-stats | Auto-déclaré |
| AMC_2022_23 | 52,0 % | 1ᵉ / 6 | llm-stats | Auto-déclaré |
| GPQA | 43,9 % | 178ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 34,4 % | 53ᵉ / 72 | llm-stats | Auto-déclaré |
| SimpleQA | 23,8 % | 30ᵉ / 45 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Mistral Large 3 réunit dans un même modèle l’analyse d’images, le traitement de longs contextes et des fonctions utiles aux applications structurées, notamment l’appel d’outils et la génération de JSON. Son périmètre multilingue couvre des dizaines de langues, dont le français, l’anglais, le chinois, le japonais, le coréen et l’arabe. Les poids ouverts sous Apache 2.0 facilitent l’exploitation commerciale, tandis que la compatibilité avec vLLM fournit une option de déploiement. La quantification NVFP4 après entraînement caractérise cette variante.
Limites et points d'attention. À sa sortie, le modèle se situait dans le top 78% des 147 LLM de sa génération sur GPQA. Ce classement ne le plaçait donc pas parmi les références les mieux positionnées sur ce benchmark. L’évaluation disponible repose sur une seule source de données concordante, ce qui invite à considérer ce résultat comme un signal limité plutôt que comme une mesure générale de toutes ses capacités. Le modèle vise surtout les usages multimodaux et multilingues nécessitant un long contexte, des sorties structurées, des appels de fonctions et des poids exploitables commercialement.
Sources des données : LLM-Stats (llm-stats.com).