Granite 3.3 8B Base
Sorti le 16 avril 2025, Granite 3.3 8B Base est déjà ancien à l’échelle de l’IA. Ce LLM dense de 8 milliards de paramètres signé IBM appartient désormais à une génération probablement dépassée, souvent retirée des catalogues au profit de modèles plus récents.
Sorti le 16 avril 2025, Granite 3.3 8B Base est déjà ancien à l’échelle de l’IA. Ce LLM dense de 8 milliards de paramètres signé IBM appartient désormais à une génération probablement dépassée, souvent retirée des catalogues au profit de modèles plus récents.
Son positionnement reste néanmoins distinctif : une fenêtre de contexte de 128K tokens, douze langues prises en charge et un mode Fill-in-the-Middle adapté à la complétion de contenu entre un préfixe et un suffixe, notamment dans le code. Ses poids ouverts sous licence Apache 2.0 autorisent les usages commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 16 avril 2025 |
| Connaissances jusqu'à | 2024-04-01 |
| Multimodal | oui |
| Paramètres | 8 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| HumanEval | 89,7 % | 12ᵉ / 65 | llm-stats | Auto-déclaré |
| AttaQ | 88,5 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| HumanEval+ | 86,1 % | 3ᵉ / 10 | llm-stats | Auto-déclaré |
| AIME 2024 | 81,2 % | 24ᵉ / 52 | llm-stats | Auto-déclaré |
| HellaSwag | 80,1 % | 18ᵉ / 27 | llm-stats | Auto-déclaré |
| TriviaQA | 78,2 % | 7ᵉ / 18 | llm-stats | Auto-déclaré |
| IFEval | 74,8 % | 58ᵉ / 65 | llm-stats | Auto-déclaré |
| Winogrande | 74,4 % | 14ᵉ / 22 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 69,1 % | 12ᵉ / 20 | llm-stats | Auto-déclaré |
| MATH-500 | 69,0 % | 30ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU | 63,9 % | 93ᵉ / 98 | llm-stats | Auto-déclaré |
| AlpacaEval 2.0 | 62,7 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| GSM8k | 59,0 % | 46ᵉ / 47 | llm-stats | Auto-déclaré |
| Arena Hard | 57,6 % | 14ᵉ / 26 | llm-stats | Auto-déclaré |
| TruthfulQA | 52,1 % | 16ᵉ / 18 | llm-stats | Auto-déclaré |
| ARC-C | 50,8 % | 33ᵉ / 34 | llm-stats | Auto-déclaré |
| AGIEval | 49,3 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| DROP | 36,1 % | 28ᵉ / 29 | llm-stats | Auto-déclaré |
| PopQA | 26,2 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, Granite 3.3 8B Base figurait dans le top 95% des 65 LLM de sa génération sur MMLU, qui évalue les connaissances et le raisonnement dans plusieurs domaines. Son architecture transformer decoder-only associe GQA, RoPE, MLP SwiGLU, RMSNorm et des embeddings d’entrée et de sortie partagés. Sa fenêtre de 128K tokens convient aux tâches sur de longs contenus. Le modèle couvre le résumé, la classification, l’extraction, la question-réponse et les traitements text-to-text. Le Fill-in-the-Middle ajoute une capacité de génération conditionnée simultanément par un début et une fin de séquence. La prise en charge inclut notamment le français, l’anglais, l’allemand, l’espagnol, l’arabe, le japonais, le coréen et le chinois.
Limites et points d’attention. Près d’un an après sa sortie, ses performances sont largement dépassées par celles des générations plus récentes, une ancienneté très importante dans ce secteur. Les modèles de cette période sont aussi fréquemment retirés du catalogue de leur éditeur. Sa limite de connaissances fixée au 1er avril 2024 exclut les événements et évolutions ultérieurs. Enfin, son classement MMLU le situe dans sa période de lancement, sans constituer un indicateur de compétitivité face aux modèles actuels.
Sources des données : LLM-Stats (llm-stats.com).