MiniCPM-SALA
MiniCPM-SALA est un LLM de 9 milliards de paramètres publié par OpenBMB le 11 février 2026. Son architecture hybride répartit ses couches entre InfLLM-V2 pour l’attention sparse, à hauteur de 25 %, et Lightning Attention pour l’attention linéaire, à hauteur de 75 %.
MiniCPM-SALA est un LLM de 9 milliards de paramètres publié par OpenBMB le 11 février 2026. Son architecture hybride répartit ses couches entre InfLLM-V2 pour l’attention sparse, à hauteur de 25 %, et Lightning Attention pour l’attention linéaire, à hauteur de 75 %.
Le modèle vise des contextes de plus d’un million de tokens. Il combine HyPE pour l’encodage positionnel hybride et HALO pour l’adaptation par optimisation de couches. Distribué sous licence Apache 2.0 avec des poids ouverts, il autorise les usages commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenBMB |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 11 février 2026 |
| Multimodal | non |
| Paramètres | 9 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| HumanEval | 95,1 % | 1ᵉ / 65 | llm-stats | Auto-déclaré |
| MBPP | 89,1 % | 4ᵉ / 33 | llm-stats | Auto-déclaré |
| AIME 2024 | 83,8 % | 18ᵉ / 52 | llm-stats | Auto-déclaré |
| BBH | 81,5 % | 8ᵉ / 12 | llm-stats | Auto-déclaré |
| CMMLU | 81,5 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| AIME 2025 | 78,3 % | 68ᵉ / 108 | llm-stats | Auto-déclaré |
| IFEval | 76,3 % | 57ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU-Pro | 67,0 % | 91ᵉ / 125 | llm-stats | Auto-déclaré |
| LiveCodeBench v5 | 60,5 % | 4ᵉ / 9 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 52,0 % | 43ᵉ / 53 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. MiniCPM-SALA se distingue principalement par son traitement des contextes très longs, fondé sur une architecture qui associe attention sparse et attention linéaire plutôt que sur une attention dense uniforme. Cette conception s’accompagne de HyPE pour gérer les positions et de HALO pour adapter les couches. Le modèle s’utilise avec Hugging Face Transformers ou SGLang. Ce dernier prend en charge un backend d’attention MiniCPM FlashInfer ainsi qu’un mode dense-as-sparse. Sa licence Apache 2.0 et ses poids ouverts rendent possible l’intégration dans des produits commerciaux.
Limites et points d'attention. Sur MMLU-Pro, MiniCPM-SALA se situait à sa sortie dans le top 73 % des 98 LLM de sa génération, c’est-à-dire ceux publiés au cours des quelque 18 mois précédents. Ce positionnement reste éloigné du haut du classement et ne présente pas le modèle comme une référence générale de sa période. Cette évaluation repose sur une seule source de données concordante. MiniCPM-SALA cible donc surtout les déploiements qui privilégient les poids ouverts, l’usage commercial et la gestion de contextes particulièrement longs.
Sources des données : LLM-Stats (llm-stats.com).