Tulu 3 (Tülu 3) 70B

Sorti le 21 novembre 2024, Tulu 3 (Tülu 3) 70B est un LLM de l’Allen Institute for AI. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les modèles sont généralement dépassés et souvent retirés des catalogues.

Sorti le 21 novembre 2024, Tulu 3 (Tülu 3) 70B est un LLM de l’Allen Institute for AI. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les modèles sont généralement dépassés et souvent retirés des catalogues.

Son principal fait marquant reste son positionnement scientifique à sa sortie : sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat, il se classait dans le top 29 % des LLM parus au cours des quelque 18 mois précédents.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAllen Institute for AI
Poids▫ n.d.
Date de sortie21 novembre 2024

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond46,3 %50ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 542,7 %31ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20254,4 %50ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

▶ Tulu 346 %

Epoch: MATH level 5

GPT-598 %
▶ Tulu 343 %

Notre analyse

Forces. Tulu 3 (Tülu 3) 70B se distinguait surtout par ses résultats en raisonnement scientifique complexe. À sa sortie, son classement sur GPQA diamond le plaçait dans le haut du panier de sa génération. Ses performances en mathématiques avancées sur MATH level 5 sont plus modérées, mais restent nettement supérieures à celles obtenues sur les problèmes d’olympiades. L’évaluation repose sur deux sources de données concordantes.

Limites et points d’attention. Les classements actuels replacent le modèle loin des premières positions : il figure dans le bas du tableau sur GPQA diamond et sous la moitié du classement sur MATH level 5. Sa faiblesse la plus marquée concerne OTIS Mock AIME 2024-2025, qui mesure des problèmes d’olympiades mathématiques de niveau lycée, avec un résultat très faible et un rang proche du bas du classement. Compte tenu de son ancienneté, ses performances sont désormais largement dépassées par les modèles récents, et cette génération est souvent absente des catalogues actuels des éditeurs.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.