Pixtral-12B

Sorti le 17 septembre 2024, Pixtral-12B est un LLM multimodal de Mistral AI, aujourd’hui ancien à l’échelle de l’IA. Près de deux ans après son lancement, il appartient à une génération probablement dépassée par les modèles récents et susceptible de ne plus figurer dans les catalogues…

Sorti le 17 septembre 2024, Pixtral-12B est un LLM multimodal de Mistral AI, aujourd’hui ancien à l’échelle de l’IA. Près de deux ans après son lancement, il appartient à une génération probablement dépassée par les modèles récents et susceptible de ne plus figurer dans les catalogues actuels.

Son architecture associe un décodeur multimodal de 12 milliards de paramètres à un encodeur vision de 400 millions de paramètres. Entraîné nativement sur des séquences mêlant images et texte, il accepte des images de tailles variables, plusieurs images par message et des conversations multi-tours, avec une fenêtre de contexte de 128 000 tokens.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie17 septembre 2024
Multimodaloui
Paramètres12 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA90,7 %18ᵉ / 26llm-statsAuto-déclaré
ChartQA81,8 %17ᵉ / 24llm-statsAuto-déclaré
VQAv278,6 %2ᵉ / 3llm-statsAuto-déclaré
MT-Bench76,8 %11ᵉ / 12llm-statsAuto-déclaré
HumanEval72,0 %54ᵉ / 65llm-statsAuto-déclaré
MMLU69,2 %84ᵉ / 98llm-statsAuto-déclaré
IFEval61,3 %64ᵉ / 65llm-statsAuto-déclaré
MM-MT-Bench60,5 %4ᵉ / 17llm-statsAuto-déclaré
MathVista58,0 %27ᵉ / 38llm-statsAuto-déclaré
MMMU52,5 %54ᵉ / 61llm-statsAuto-déclaré
MATH48,1 %57ᵉ / 70llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Pixtral-12B réunit traitement du texte et analyse d’images dans un modèle open-weights sous licence Apache 2.0, avec usage commercial autorisé. Sa longue fenêtre de contexte convient aux séquences associant de nombreux contenus textuels et visuels. Le modèle prend en charge les URL d’images, les échanges comportant plusieurs images et les conversations multi-tours. Son déploiement est prévu avec vLLM en serveur et client, ainsi qu’avec mistral-inference depuis une interface en ligne de commande ou Python.

Limites et points d’attention. À sa sortie, Pixtral-12B se situait seulement dans les 72% les mieux classés sur MATH parmi les LLM de sa génération, un résultat qui ne le plaçait pas dans le haut du panier en raisonnement mathématique. Son ancienneté est désormais très importante dans un secteur qui évolue rapidement, et ses performances sont probablement largement dépassées par celles des modèles récents. Ses connaissances s’arrêtent au 30 juin 2024. Il ne comporte par ailleurs aucun mécanisme de modération, un point critique pour toute exposition à des contenus non contrôlés ou tout déploiement public.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).