Mistral Large 3 (675B Instruct 2512 NVFP4)

Publié par Mistral AI le 4 décembre 2025, Mistral Large 3 (675B Instruct 2512 NVFP4) est un LLM multimodal open-weights de 675 milliards de paramètres. Son architecture Mixture-of-Experts granulaire associe un modèle de langage MoE à un encodeur visuel de 2,5 milliards de paramètres.

Publié par Mistral AI le 4 décembre 2025, Mistral Large 3 (675B Instruct 2512 NVFP4) est un LLM multimodal open-weights de 675 milliards de paramètres. Son architecture Mixture-of-Experts granulaire associe un modèle de langage MoE à un encodeur visuel de 2,5 milliards de paramètres.

Cette version post-entraînée pour suivre des instructions est quantifiée en NVFP4 avec llm-compressor. Elle traite le texte et les images, accepte une fenêtre de contexte de 256k et prend en charge les prompts système, l’appel natif de fonctions et la sortie JSON. Sa licence Apache 2.0 autorise les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie4 décembre 2025
Multimodaloui
Paramètres675 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MMMLU85,5 %28ᵉ / 49llm-statsAuto-déclaré
AMC_2022_2352,0 %1ᵉ / 6llm-statsAuto-déclaré
GPQA43,9 %178ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench34,4 %53ᵉ / 72llm-statsAuto-déclaré
SimpleQA23,8 %30ᵉ / 45llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Mistral Large 3 réunit dans un même modèle l’analyse d’images, le traitement de longs contextes et des fonctions utiles aux applications structurées, notamment l’appel d’outils et la génération de JSON. Son périmètre multilingue couvre des dizaines de langues, dont le français, l’anglais, le chinois, le japonais, le coréen et l’arabe. Les poids ouverts sous Apache 2.0 facilitent l’exploitation commerciale, tandis que la compatibilité avec vLLM fournit une option de déploiement. La quantification NVFP4 après entraînement caractérise cette variante.

Limites et points d'attention. À sa sortie, le modèle se situait dans le top 78% des 147 LLM de sa génération sur GPQA. Ce classement ne le plaçait donc pas parmi les références les mieux positionnées sur ce benchmark. L’évaluation disponible repose sur une seule source de données concordante, ce qui invite à considérer ce résultat comme un signal limité plutôt que comme une mesure générale de toutes ses capacités. Le modèle vise surtout les usages multimodaux et multilingues nécessitant un long contexte, des sorties structurées, des appels de fonctions et des poids exploitables commercialement.


Sources des données : LLM-Stats (llm-stats.com).