Tulu 3 (Tülu 3) 70B
Sorti le 21 novembre 2024, Tulu 3 (Tülu 3) 70B est un LLM de l’Allen Institute for AI. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les modèles sont généralement dépassés et souvent retirés des catalogues.
Sorti le 21 novembre 2024, Tulu 3 (Tülu 3) 70B est un LLM de l’Allen Institute for AI. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les modèles sont généralement dépassés et souvent retirés des catalogues.
Son principal fait marquant reste son positionnement scientifique à sa sortie : sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat, il se classait dans le top 29 % des LLM parus au cours des quelque 18 mois précédents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Allen Institute for AI |
| Poids | ▫ n.d. |
| Date de sortie | 21 novembre 2024 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 46,3 % | 50ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 42,7 % | 31ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 4,4 % | 50ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Notre analyse
Forces. Tulu 3 (Tülu 3) 70B se distinguait surtout par ses résultats en raisonnement scientifique complexe. À sa sortie, son classement sur GPQA diamond le plaçait dans le haut du panier de sa génération. Ses performances en mathématiques avancées sur MATH level 5 sont plus modérées, mais restent nettement supérieures à celles obtenues sur les problèmes d’olympiades. L’évaluation repose sur deux sources de données concordantes.
Limites et points d’attention. Les classements actuels replacent le modèle loin des premières positions : il figure dans le bas du tableau sur GPQA diamond et sous la moitié du classement sur MATH level 5. Sa faiblesse la plus marquée concerne OTIS Mock AIME 2024-2025, qui mesure des problèmes d’olympiades mathématiques de niveau lycée, avec un résultat très faible et un rang proche du bas du classement. Compte tenu de son ancienneté, ses performances sont désormais largement dépassées par les modèles récents, et cette génération est souvent absente des catalogues actuels des éditeurs.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.