Reka Flash 3

Reka Flash 3 est un LLM de raisonnement généraliste de 21 milliards de paramètres, publié par Reka AI le 12 mars 2025 avec des poids ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont probablement dépassées par celles…

Reka Flash 3 est un LLM de raisonnement généraliste de 21 milliards de paramètres, publié par Reka AI le 12 mars 2025 avec des poids ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont probablement dépassées par celles des modèles récents.

Son positionnement repose sur un tarif très économique, une fenêtre de contexte de 65 536 tokens et une compatibilité avec l’écosystème Llama, notamment Hugging Face et vLLM. Principalement conçu pour l’anglais, il produit une phase de raisonnement balisée avant sa réponse.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurReka AI
Poids🟢 Poids ouverts
Date de sortie12 mars 2025
Connaissances jusqu'à2025-01-31
Multimodalnon
Fenêtre de contexte65 536 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Email Classification (Baseline)100,0 %1ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)96,0 %112ᵉ / 161benchable✅ Mesuré
Benchable : Coding (Baseline)89,0 %77ᵉ / 162benchable✅ Mesuré
Benchable : Instruction Following (Baseline)0,0 %145ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ Reka Flash 3100 %

Benchable : General Knowledge (Baseline)

▶ Reka Flash 396 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Reka AI0,1 $0,2 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable20 min 44 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Reka Flash 3 coûte 95% de moins que la moyenne des LLM similaires et environ 55 fois moins que les modèles frontière. Ses poids ouverts et son format compatible Llama facilitent son exécution avec des bibliothèques courantes. L’entraînement combine des données synthétiques et publiques pour le supervised finetuning, puis du RLOO avec des récompenses fondées sur des modèles et des règles. Sur Email Classification, il atteint le plafond du test et partage la première place avec neuf autres modèles. Ce résultat confirme son aptitude sur cette tâche précise, mais ne départage pas les modèles concernés.

Limites et points d’attention. Les autres résultats sont nettement moins favorables. Reka Flash 3 se situe dans la seconde moitié du classement en Coding et plus loin encore en General Knowledge. Son score nul en Instruction Following le place parmi les modèles les plus en retrait, à égalité avec 18 autres. Ces benchmarks plafonnés restent peu discriminants, mais leur ensemble ne montre pas de supériorité générale. Ses performances sont aujourd’hui largement dépassées, et les modèles de cet âge sont souvent retirés des catalogues. Ses connaissances s’arrêtent au 31 janvier 2025. Sa compréhension des langues autres que l’anglais reste limitée, tandis que son format de dialogue impose les rôles human/assistant, le séparateur <sep> et des balises de raisonnement spécifiques.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).