Email Classification (Baseline)

Benchable : Email Classification (Baseline) est un benchmark public créé par Benchable pour évaluer la classification automatique d’emails en anglais. Chaque cas demande d’attribuer un message à une seule catégorie parmi six types courants, couvrant notamment les communications…

Benchable : Email Classification (Baseline) est un benchmark public créé par Benchable pour évaluer la classification automatique d’emails en anglais. Chaque cas demande d’attribuer un message à une seule catégorie parmi six types courants, couvrant notamment les communications personnelles, professionnelles, commerciales et transactionnelles.

Ce test de base mesure la capacité d’un modèle à reconnaître la fonction générale d’un email et à produire le nom de catégorie attendu. La validation repose sur une correspondance textuelle insensible à la casse, ce qui en fait un indicateur direct de réussite sur cette tâche ciblée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesClassification d'emails en six categories (Spam, Business, Personnel, Newsletter, Service client, Transactionnel)
ModalitéTexte
Type de questionsClassification mono-label (email -> 1 des 6 categories)
Métrique d'évaluationTaux de reussite par etape ; correspondance du nom de categorie correct (insensible a la casse)
AccèsPublic
Languesanglais
Taille du jeu100 cas de test
RessourcesSite / dépôt officiel

Classement des modèles (164)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek V4 ProDeepSeek▫ n.d.100,0 %24 avril 2026✅ Mesuré
2MiniMax M1MiniMax🟢 Ouvert100,0 %17 juin 2025✅ Mesuré
3Qwen 3.5 PlusQwen▫ n.d.100,0 %16 février 2026✅ Mesuré
4Reka Flash 3Reka AI🟢 Ouvert100,0 %12 mars 2025✅ Mesuré
5StepFun: Step 3.7 FlashStepFun🟢 Ouvert100,0 %28 mai 2026✅ Mesuré
6hermes-3-llama-3.1-405bnousresearch▫ n.d.100,0 %✅ Mesuré
7inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.100,0 %23 avril 2026✅ Mesuré
8inclusionAI: Ring-2.6-1TInclusionAI▫ n.d.100,0 %8 mai 2026✅ Mesuré
9qwen3-235b-a22b-04-28Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
10qwen3.6-plus-04-02Alibaba Cloud / Qwen Team▫ n.d.100,0 %2 avril 2026✅ Mesuré
11AI21: Jamba Large 1.7AI21 Labs🟢 Ouvert99,0 %8 août 2025✅ Mesuré
12AionLabs: Aion-2.0Aion Labs▫ n.d.99,0 %23 février 2026✅ Mesuré
13Arcee AI: Virtuoso LargeArcee AI▫ n.d.99,0 %5 mai 2025✅ Mesuré
14Baidu: ERNIE 4.5 VL 424B A47B Baidu🟢 Ouvert99,0 %30 juin 2025✅ Mesuré
15ByteDance Seed: Seed-2.0-MiniByteDance Seed▫ n.d.99,0 %26 février 2026✅ Mesuré
16Claude Sonnet 4Anthropic🔒 Propriétaire99,0 %22 mai 2025✅ Mesuré
17Claude Sonnet 4.5Anthropic🔒 Propriétaire99,0 %29 septembre 2025✅ Mesuré
18Command A+Cohere🟢 Ouvert99,0 %20 mai 2026✅ Mesuré
19DeepSeek V4 FlashDeepSeek▫ n.d.99,0 %24 avril 2026✅ Mesuré
20GPT-4.1 miniOpenAI🔒 Propriétaire99,0 %14 avril 2025✅ Mesuré
21GPT-4oOpenAI🔒 Propriétaire99,0 %27 mars 2025✅ Mesuré
22GPT-5 nanoOpenAI🔒 Propriétaire99,0 %7 août 2025✅ Mesuré
23Kimi K2Moonshot AI▫ n.d.99,0 %6 novembre 2025✅ Mesuré
24Kwaipilot: KAT-Coder-Pro V2kwaipilot▫ n.d.99,0 %27 mars 2026✅ Mesuré
25MiniMax: MiniMax-01MiniMax🟢 Ouvert99,0 %15 janvier 2025✅ Mesuré
26Mistral LargeMistral AI▫ n.d.99,0 %26 février 2024✅ Mesuré
27Mistral Large 2407Mistral AI▫ n.d.99,0 %19 novembre 2024✅ Mesuré
28Mistral: Mistral Medium 3Mistral AI▫ n.d.99,0 %7 mai 2025✅ Mesuré
29Nex AGI: Nex-N2-ProNex AGI🟢 Ouvert99,0 %8 juin 2026✅ Mesuré
30Nous: Hermes 4 405BNous Research🟢 Ouvert99,0 %26 août 2025✅ Mesuré
31OpenAI: GPT Chat LatestOpenAI🔒 Propriétaire99,0 %5 mai 2026✅ Mesuré
32OpenAI: GPT-4 Turbo PreviewOpenAI🔒 Propriétaire99,0 %25 janvier 2024✅ Mesuré
33OpenAI: GPT-5.4 Image 2OpenAI🔒 Propriétaire99,0 %21 avril 2026✅ Mesuré
34OpenAI: gpt-oss-safeguard-20bOpenAI🟢 Ouvert99,0 %29 octobre 2025✅ Mesuré
35Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert99,0 %28 août 2025✅ Mesuré
36Qwen: Qwen3 Coder PlusAlibaba Cloud / Qwen Team▫ n.d.99,0 %23 septembre 2025✅ Mesuré
37Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.99,0 %27 avril 2026✅ Mesuré
38Qwen: Qwen3.6 Max PreviewAlibaba Cloud / Qwen Team▫ n.d.99,0 %27 avril 2026✅ Mesuré
39Sakana: Fugu UltraSakana AI▫ n.d.99,0 %24 juin 2026✅ Mesuré
40Sonar ProPerplexity🔒 Propriétaire99,0 %7 mars 2025✅ Mesuré
41Tencent: Hy3 previewTencent🟢 Ouvert99,0 %22 avril 2026✅ Mesuré
42kimi-k2.5-0127Moonshot AI▫ n.d.99,0 %✅ Mesuré
43l3.1-euryale-70bsao10k▫ n.d.99,0 %✅ Mesuré
44laguna-xs-2.1poolside▫ n.d.99,0 %✅ Mesuré
45llama-4-scout-17b-16e-instructMeta▫ n.d.99,0 %✅ Mesuré
46nova-premier-v1Amazon🔒 Propriétaire99,0 %✅ Mesuré
47nova-pro-v1Amazon🔒 Propriétaire99,0 %✅ Mesuré
48qwen3-30b-a3b-04-28Alibaba Cloud / Qwen Team▫ n.d.99,0 %✅ Mesuré
49qwen3-32b-04-28Alibaba Cloud / Qwen Team▫ n.d.99,0 %✅ Mesuré
50qwen3-next-80b-a3b-instruct-2509Alibaba Cloud / Qwen Team▫ n.d.99,0 %✅ Mesuré
51qwen3-next-80b-a3b-thinking-2509Alibaba Cloud / Qwen Team▫ n.d.99,0 %✅ Mesuré
52xAI: Grok Build 0.1xAI▫ n.d.99,0 %20 mai 2026✅ Mesuré
53Thinking Machines: InklingThinking Machines🟢 Ouvert99,0 %17 juillet 2026✅ Mesuré
54uncensoredvenice▫ n.d.99,0 %✅ Mesuré
55Kwaipilot: KAT-Coder-Pro V2.5kwaipilot▫ n.d.98,3 %10 juillet 2026✅ Mesuré
56Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert98,0 %1 avril 2026✅ Mesuré
57Claude 3 HaikuAnthropic🔒 Propriétaire98,0 %13 mars 2024✅ Mesuré
58Claude Opus 4.1Anthropic🔒 Propriétaire98,0 %5 août 2025✅ Mesuré
59Claude Opus 4.5Anthropic🔒 Propriétaire98,0 %24 novembre 2025✅ Mesuré
60Deep Cogito: Cogito v2.1 671BDeep Cogito▫ n.d.98,0 %13 novembre 2025✅ Mesuré
61GPT-4.1OpenAI🔒 Propriétaire98,0 %14 avril 2025✅ Mesuré
62GPT-4o miniOpenAI🔒 Propriétaire98,0 %18 juillet 2024✅ Mesuré
63GPT-5OpenAI🔒 Propriétaire98,0 %7 août 2025✅ Mesuré
64GPT-5.1OpenAI🔒 Propriétaire98,0 %13 novembre 2025✅ Mesuré
65GPT-5.2OpenAI🔒 Propriétaire98,0 %11 décembre 2025✅ Mesuré
66GPT-5.6 LunaOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
67GPT-5.6 SolOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
68GPT-5.6 TerraOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
69Gemini 3.1 Pro PreviewGoogle▫ n.d.98,0 %19 février 2026✅ Mesuré
70Hy3Tencent🟢 Ouvert98,0 %6 juillet 2026✅ Mesuré
71Mistral: Mistral Medium 3.1Mistral AI▫ n.d.98,0 %13 août 2025✅ Mesuré
72Nous: Hermes 4 70BNous Research🟢 Ouvert98,0 %26 août 2025✅ Mesuré
73OpenAI: GPT-5.1 ChatOpenAI🔒 Propriétaire98,0 %13 novembre 2025✅ Mesuré
74OpenAI: GPT-5.2 ChatOpenAI🔒 Propriétaire98,0 %10 décembre 2025✅ Mesuré
75OpenAI: GPT-5.6 Luna ProOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
76OpenAI: GPT-5.6 Sol ProOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
77Seed 1.6ByteDance Seed▫ n.d.98,0 %23 décembre 2025✅ Mesuré
78Z.ai: GLM 5 TurboZhipu AI▫ n.d.98,0 %15 mars 2026✅ Mesuré
79deepseek-chat-v3DeepSeek▫ n.d.98,0 %✅ Mesuré
80deepseek-chat-v3.1DeepSeek▫ n.d.98,0 %✅ Mesuré
81gemini-2.5-pro-preview-03-25Google▫ n.d.98,0 %✅ Mesuré
82gemini-3-pro-imageGoogle▫ n.d.98,0 %✅ Mesuré
83gemini-3.1-flash-imageGoogle▫ n.d.98,0 %✅ Mesuré
84gemini-3.1-flash-image-previewGoogle▫ n.d.98,0 %✅ Mesuré
85gpt-5-chat-2025-08-07OpenAI🔒 Propriétaire98,0 %7 août 2025✅ Mesuré
86hermes-3-llama-3.1-70bnousresearch▫ n.d.98,0 %✅ Mesuré
87l3.3-euryale-70b-v2.3sao10k▫ n.d.98,0 %✅ Mesuré
88laguna-m.1poolside▫ n.d.98,0 %✅ Mesuré
89llama-4-maverick-17b-128e-instructMeta▫ n.d.98,0 %✅ Mesuré
90ministral-14b-2512mistralai▫ n.d.98,0 %✅ Mesuré
91mistral-large-2512mistralai▫ n.d.98,0 %✅ Mesuré
92mistral-saba-2502mistralai▫ n.d.98,0 %✅ Mesuré
93mistral-small-2603mistralai▫ n.d.98,0 %✅ Mesuré
94nemotron-nano-12b-v2-vlNVIDIA🟢 Ouvert98,0 %28 octobre 2025✅ Mesuré
95o1OpenAI🔒 Propriétaire98,0 %17 décembre 2024✅ Mesuré
96qwen3-8b-04-28Alibaba Cloud / Qwen Team▫ n.d.98,0 %✅ Mesuré
97qwen3-coder-480b-a35b-07-25Alibaba Cloud / Qwen Team▫ n.d.98,0 %✅ Mesuré
98skyfall-36b-v2thedrummer▫ n.d.98,0 %✅ Mesuré
99Perceptron: Perceptron Mk1Perceptron▫ n.d.97,8 %12 mai 2026✅ Mesuré
100Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.97,4 %25 février 2026✅ Mesuré
101Claude Haiku 4.5Anthropic🔒 Propriétaire97,0 %15 octobre 2025✅ Mesuré
102Claude Opus 4Anthropic🔒 Propriétaire97,0 %22 mai 2025✅ Mesuré
103DeepSeek V3.1 TerminusDeepSeek🟢 Ouvert97,0 %22 septembre 2025✅ Mesuré
104GPT-5 miniOpenAI🔒 Propriétaire97,0 %7 août 2025✅ Mesuré
105Google: Gemini 3.1 Pro Preview Custom ToolsGoogle▫ n.d.97,0 %25 février 2026✅ Mesuré
106Inflection: Inflection 3 PiInflection🔒 Propriétaire97,0 %11 octobre 2024✅ Mesuré
107Inflection: Inflection 3 ProductivityInflection🔒 Propriétaire97,0 %11 octobre 2024✅ Mesuré
108Magnum v4 72Banthracite-org🟢 Ouvert97,0 %22 octobre 2024✅ Mesuré
109Mistral: Voxtral Small 24B 2507Mistral AI🟢 Ouvert97,0 %30 octobre 2025✅ Mesuré
110Nex AGI: Nex-N2-MiniNex AGI🟢 Ouvert97,0 %24 juin 2026✅ Mesuré
111OpenAI: GPT-5.1-Codex-MaxOpenAI🔒 Propriétaire97,0 %4 décembre 2025✅ Mesuré
112OpenAI: GPT-5.6 Terra ProOpenAI🔒 Propriétaire97,0 %9 juillet 2026✅ Mesuré
113cydonia-24b-v4.1thedrummer▫ n.d.97,0 %✅ Mesuré
114deepseek-chat-v3-0324DeepSeek▫ n.d.97,0 %✅ Mesuré
115gpt-3.5-turbo-0613OpenAI🔒 Propriétaire97,0 %✅ Mesuré
116mistral-small-24b-instruct-2501mistralai▫ n.d.97,0 %✅ Mesuré
117nova-2-lite-v1Amazon🔒 Propriétaire97,0 %2 décembre 2025✅ Mesuré
118olmo-3-32b-thinkallenai▫ n.d.97,0 %✅ Mesuré
119qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.97,0 %8 septembre 2025✅ Mesuré
120qwen3-14b-04-28Alibaba Cloud / Qwen Team▫ n.d.97,0 %✅ Mesuré
121qwen3-coder-next-2025-02-03Alibaba Cloud / Qwen Team🟢 Ouvert97,0 %4 février 2026✅ Mesuré
122rocinante-12bthedrummer▫ n.d.97,0 %✅ Mesuré
123Kwaipilot: KAT-Coder-Air V2.5kwaipilot▫ n.d.97,0 %10 juillet 2026✅ Mesuré
124AionLabs: Aion-3.0Aion Labs▫ n.d.96,0 %7 juillet 2026✅ Mesuré
125AionLabs: Aion-3.0-MiniAion Labs▫ n.d.96,0 %7 juillet 2026✅ Mesuré
126ByteDance Seed: Seed 1.6 FlashByteDance Seed▫ n.d.96,0 %23 décembre 2025✅ Mesuré
127Cohere: Command R (08-2024)Cohere🟢 Ouvert96,0 %30 août 2024✅ Mesuré
128command-r-plus-08-2024Cohere▫ n.d.96,0 %✅ Mesuré
129gpt-4o-mini-search-preview-2025-03-11OpenAI🔒 Propriétaire96,0 %12 mars 2025✅ Mesuré
130gpt-4o-search-preview-2025-03-11OpenAI🔒 Propriétaire96,0 %12 mars 2025✅ Mesuré
131IBM: Granite 4.1 8BIBM🟢 Ouvert95,0 %30 avril 2026✅ Mesuré
132WizardLM-2 8x22BMicrosoft🟢 Ouvert95,0 %16 avril 2024✅ Mesuré
133ministral-3b-2512mistralai▫ n.d.95,0 %✅ Mesuré
134ministral-8b-2512mistralai▫ n.d.95,0 %✅ Mesuré
135unslopnemo-12bthedrummer▫ n.d.95,0 %✅ Mesuré
136Mistral: Codestral 2508Mistral AI▫ n.d.94,0 %1 août 2025✅ Mesuré
137Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert94,0 %29 juillet 2025✅ Mesuré
138qwen3-235b-a22b-07-25Alibaba Cloud / Qwen Team▫ n.d.94,0 %✅ Mesuré
139Writer: Palmyra X5Writer▫ n.d.93,8 %21 janvier 2026✅ Mesuré
140Mistral NeMoMistral AI▫ n.d.93,0 %18 juillet 2024✅ Mesuré
141GPT-4.1 nanoOpenAI🔒 Propriétaire92,0 %14 avril 2025✅ Mesuré
142SonarPerplexity🔒 Propriétaire92,0 %29 janvier 2025✅ Mesuré
143Upstage: Solar Pro 3Upstage▫ n.d.92,0 %27 janvier 2026✅ Mesuré
144Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert91,0 %31 juillet 2025✅ Mesuré
145Qwen: Qwen3 Coder FlashAlibaba Cloud / Qwen Team▫ n.d.91,0 %17 septembre 2025✅ Mesuré
146Relace: Relace Searchrelace▫ n.d.91,0 %8 décembre 2025✅ Mesuré
147Tencent: Hunyuan A13B InstructTencent🟢 Ouvert91,0 %8 juillet 2025✅ Mesuré
148MiniMax: MiniMax M2-herMiniMax▫ n.d.90,0 %23 janvier 2026✅ Mesuré
149nova-micro-v1Amazon🔒 Propriétaire90,0 %✅ Mesuré
150remm-slerp-l2-13bundi95▫ n.d.90,0 %✅ Mesuré
151Cohere: Command R7B (12-2024)Cohere▫ n.d.89,0 %14 décembre 2024✅ Mesuré
152Muse Spark 1.1Meta🔒 Propriétaire89,0 %9 juillet 2026✅ Mesuré
153l3-lunaris-8bsao10k▫ n.d.89,0 %✅ Mesuré
154granite-4.0-h-microIBM🟢 Ouvert88,5 %20 octobre 2025✅ Mesuré
155mythomax-l2-13bgryphe▫ n.d.86,0 %✅ Mesuré
156ui-tars-1.5-7bByteDance▫ n.d.82,0 %✅ Mesuré
157Mistral: Mixtral 8x22B InstructMistral AI🟢 Ouvert80,0 %17 avril 2024✅ Mesuré
158Perplexity: Sonar Pro SearchPerplexity🔒 Propriétaire73,0 %30 octobre 2025✅ Mesuré
159reka-edge-2603Reka AI▫ n.d.59,0 %✅ Mesuré
160weavermancer▫ n.d.48,0 %✅ Mesuré
161inclusionAI: Ling-2.6-flashInclusionAI▫ n.d.46,0 %21 avril 2026✅ Mesuré
162aion-rp-llama-3.1-8bAion Labs▫ n.d.34,0 %✅ Mesuré
163Meta: Llama 3.2 1B InstructMeta🟢 Ouvert32,0 %25 septembre 2024✅ Mesuré
164Meta: Llama Guard 4 12BMeta🟢 Ouvert0,0 %30 avril 2025✅ Mesuré

Classement établi sur 164 modèles évalués, dont 68 de grands éditeurs. Score médian de l'ensemble : 98,0 %.

Notre analyse

Un score élevé indique qu’un modèle associe presque toujours chaque email à la catégorie attendue, selon une validation stricte du nom de catégorie, mais tolérante à la casse. La fiabilité bénéficie du fait que les scores sont au moins partiellement mesurés par un tiers, plutôt que de reposer uniquement sur des résultats auto-déclarés.

Le classement montre toutefois une forte saturation : sur 259 modèles, le score médian atteint 98 %, tandis que DeepSeek V4 Pro atteint le plafond de 100 %. Le benchmark différencie donc peu les modèles les plus performants, et de faibles écarts peuvent correspondre à un nombre limité de cas sur un jeu de 100 tests. Sa portée reste circonscrite à une classification mono-label en anglais et à six catégories prédéfinies. L’accès public crée aussi une possibilité de contamination si les cas de test sont intégrés, directement ou indirectement, aux données ou aux procédures d’optimisation. Le classement révèle ainsi une maîtrise largement répandue de cette tâche de base, davantage qu’une hiérarchie fortement discriminante entre modèles avancés.


Sources des scores : benchable.