Creative Writing v3
Creative Writing v3 est un benchmark d’écriture créative conçu en 2025 par EQ-Bench, à l’initiative de Samuel J. Paech. Il soumet les modèles à des prompts en anglais et fait évaluer leurs productions par un autre LLM.
Creative Writing v3 est un benchmark d’écriture créative conçu en 2025 par EQ-Bench, à l’initiative de Samuel J. Paech. Il soumet les modèles à des prompts en anglais et fait évaluer leurs productions par un autre LLM.
Le benchmark mesure notamment l’humour, la romance, la conscience spatiale et la capacité à proposer des perspectives originales. Son approche vise une discrimination fine entre les modèles les plus performants, en complément des évaluations centrées sur les connaissances, le raisonnement ou l’exactitude factuelle.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | EQ-Bench (Samuel J. Paech) |
| Capacités mesurées | Écriture créative : humour, romance, conscience spatiale, perspectives originales ; discrimination fine au sommet du classement. |
| Modalité | Texte |
| Type de questions | Écriture créative jugée par LLM (réponses à des prompts d'écriture) |
| Métrique d'évaluation | Score hybride : notation par rubrique + Elo (Glicko-2) sur comparaisons pairwise ; juge Claude Sonnet 4.6 |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 32 prompts × 3 itérations = 96 items |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 495 | 22 juillet 2025 | Auto-déclaré |
| 2 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 478 | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 471 | 25 juillet 2025 | Auto-déclaré |
| 4 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 464 | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 463 | 22 septembre 2025 | Auto-déclaré |
| 6 | Grok-4.1 | xAI | 🔒 Propriétaire | 1 460 | 17 novembre 2025 | Auto-déclaré |
| 7 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 457 | 10 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 445 | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 423 | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 410 | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 408 | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 300 | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 12 modèles évalués, dont 1 de grands éditeurs. Ce benchmark n'étant pas exprimé en pourcentage, la barre prend le score du premier comme référence (100 %). « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique une bonne adéquation aux critères d’écriture retenus et une préférence fréquente lors des comparaisons entre réponses. L’évaluation combine une notation par rubrique et un classement Elo fondé sur Glicko-2, avec Claude Sonnet 4.6 comme juge. Ce dispositif croise ainsi des critères explicites et des confrontations pairwise, mais reste dépendant des appréciations d’un LLM. Dans la base, les scores sont en outre majoritairement auto-déclarés par les éditeurs, ce qui appelle davantage de prudence qu’une mesure entièrement reproduite de manière indépendante.
Le score médian de 85 % et le meilleur résultat de 88 %, obtenu par Qwen3-235B-A22B-Instruct-2507, montrent un classement resserré. Cette proximité suggère un risque de saturation et rend les écarts faibles particulièrement sensibles au protocole de jugement. L’accès public peut aussi favoriser une contamination si les prompts sont intégrés à des données d’entraînement ou d’optimisation. Enfin, la portée demeure ciblée sur 32 prompts en anglais et sur certaines dimensions créatives. Le classement compare donc surtout la performance dans ce cadre précis, plutôt qu’une aptitude générale à toute forme d’écriture.
Sources des scores : llm-stats.