Mistral Large 2
Publié le 24 juillet 2024 par le français Mistral AI, Mistral Large 2 est un LLM de 123 milliards de paramètres doté d’une fenêtre de contexte de 128 000 tokens. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et se trouve probablement…
Publié le 24 juillet 2024 par le français Mistral AI, Mistral Large 2 est un LLM de 123 milliards de paramètres doté d’une fenêtre de contexte de 128 000 tokens. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et se trouve probablement dépassé par les modèles haut de gamme plus récents.
À son lancement, il se classait toutefois dans le top 8 % des LLM de sa génération sur GPQA diamond. Son entraînement représente 2,1 × 10²⁵ FLOP, soit environ 5,9 millions d’heures-GPU H100, l’équivalent de quelque 2 700 GPU H100 mobilisés pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Mistral Research License |
| Date de sortie | 24 juillet 2024 |
| Multimodal | non |
| Paramètres | 123 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GSM8k | 93,0 % | 17ᵉ / 47 | llm-stats | Auto-déclaré |
| HumanEval | 92,0 % | 9ᵉ / 65 | llm-stats | Auto-déclaré |
| MT-Bench | 86,3 % | 6ᵉ / 12 | llm-stats | Auto-déclaré |
| MMLU | 84,0 % | 44ᵉ / 98 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 2,1 × 10²⁵ FLOP |
| Jeu de données | Unspecified unreleased |
| Pays | France |
Notre analyse
Forces. À sa sortie, Mistral Large 2 figurait dans le haut du panier de sa génération pour les questions scientifiques de niveau doctorat évaluées par GPQA diamond. Ce résultat constituait son principal point fort parmi les mesures disponibles. Sur MATH level 5, le modèle atteint plutôt le milieu du classement, signe de capacités mathématiques correctes pour sa période sans appartenir aux meilleurs systèmes. Sa fenêtre de contexte de 128 000 tokens et ses 123 milliards de paramètres caractérisent par ailleurs un modèle de grande taille, issu d’un effort d’entraînement considérable.
Limites et points d’attention. Les évaluations plus exigeantes révèlent des faiblesses nettes. Mistral Large 2 se situe dans le bas du classement sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Il obtient 0 % sur les versions publique et privée de FrontierMath, qui mesure la résolution de problèmes mathématiques de recherche très difficiles. Ses performances sont aujourd’hui largement dépassées, et un modèle de cet âge n’est souvent plus proposé au catalogue de son éditeur. Son accès est en outre encadré par la Mistral Research License, avec des poids non ouverts. L’ampleur de l’entraînement reste marquante : environ 2 700 GPU H100 pendant trois mois.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.