Creative Writing v3

Creative Writing v3 est un benchmark d’écriture créative conçu en 2025 par EQ-Bench, à l’initiative de Samuel J. Paech. Il soumet les modèles à des prompts en anglais et fait évaluer leurs productions par un autre LLM.

Creative Writing v3 est un benchmark d’écriture créative conçu en 2025 par EQ-Bench, à l’initiative de Samuel J. Paech. Il soumet les modèles à des prompts en anglais et fait évaluer leurs productions par un autre LLM.

Le benchmark mesure notamment l’humour, la romance, la conscience spatiale et la capacité à proposer des perspectives originales. Son approche vise une discrimination fine entre les modèles les plus performants, en complément des évaluations centrées sur les connaissances, le raisonnement ou l’exactitude factuelle.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEQ-Bench (Samuel J. Paech)
Capacités mesuréesÉcriture créative : humour, romance, conscience spatiale, perspectives originales ; discrimination fine au sommet du classement.
ModalitéTexte
Type de questionsÉcriture créative jugée par LLM (réponses à des prompts d'écriture)
Métrique d'évaluationScore hybride : notation par rubrique + Elo (Glicko-2) sur comparaisons pairwise ; juge Claude Sonnet 4.6
AccèsPublic
Languesanglais
Taille du jeu32 prompts × 3 itérations = 96 items
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (12)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert1 49522 juillet 2025Auto-déclaré
2Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert1 47822 septembre 2025Auto-déclaré
3Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert1 47125 juillet 2025Auto-déclaré
4Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert1 46422 septembre 2025Auto-déclaré
5Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert1 46322 septembre 2025Auto-déclaré
6Grok-4.1xAI🔒 Propriétaire1 46017 novembre 2025Auto-déclaré
7Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert1 45710 septembre 2025Auto-déclaré
8Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert1 44522 septembre 2025Auto-déclaré
9Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert1 42322 septembre 2025Auto-déclaré
10Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert1 41022 septembre 2025Auto-déclaré
11Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert1 40822 septembre 2025Auto-déclaré
12Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert1 30022 septembre 2025Auto-déclaré

Classement établi sur 12 modèles évalués, dont 1 de grands éditeurs. Ce benchmark n'étant pas exprimé en pourcentage, la barre prend le score du premier comme référence (100 %). « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique une bonne adéquation aux critères d’écriture retenus et une préférence fréquente lors des comparaisons entre réponses. L’évaluation combine une notation par rubrique et un classement Elo fondé sur Glicko-2, avec Claude Sonnet 4.6 comme juge. Ce dispositif croise ainsi des critères explicites et des confrontations pairwise, mais reste dépendant des appréciations d’un LLM. Dans la base, les scores sont en outre majoritairement auto-déclarés par les éditeurs, ce qui appelle davantage de prudence qu’une mesure entièrement reproduite de manière indépendante.

Le score médian de 85 % et le meilleur résultat de 88 %, obtenu par Qwen3-235B-A22B-Instruct-2507, montrent un classement resserré. Cette proximité suggère un risque de saturation et rend les écarts faibles particulièrement sensibles au protocole de jugement. L’accès public peut aussi favoriser une contamination si les prompts sont intégrés à des données d’entraînement ou d’optimisation. Enfin, la portée demeure ciblée sur 32 prompts en anglais et sur certaines dimensions créatives. Le classement compare donc surtout la performance dans ce cadre précis, plutôt qu’une aptitude générale à toute forme d’écriture.


Sources des scores : llm-stats.