WritingBench
WritingBench est un benchmark bilingue consacré aux capacités de rédaction générative des grands modèles de langage. Publié en 2025 par Alibaba Group, via Tongyi Lab, avec des collaborateurs de Renmin University et de SJTU, il couvre des productions créatives, persuasives, informatives…
WritingBench est un benchmark bilingue consacré aux capacités de rédaction générative des grands modèles de langage. Publié en 2025 par Alibaba Group, via Tongyi Lab, avec des collaborateurs de Renmin University et de SJTU, il couvre des productions créatives, persuasives, informatives et techniques.
Les tâches ouvertes portent sur six grands domaines et de nombreux sous-domaines. L’évaluation adapte ses critères à chaque requête, puis mobilise un modèle critique affiné pour apprécier notamment le style, le format et la longueur. WritingBench sert ainsi à comparer la qualité rédactionnelle et le respect d’instructions variées.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Alibaba Group (Tongyi Lab) et collaborateurs (Renmin University, SJTU) |
| Capacités mesurées | Rédaction créative, persuasive, informative et technique ; respect des contraintes de style, format et longueur. |
| Modalité | Texte |
| Type de questions | Génération de texte (rédaction) ouverte sur 6 domaines / 100 sous-domaines |
| Métrique d'évaluation | Cadre d'évaluation dépendant de la requête : critères générés dynamiquement par LLM + modèle critique affiné (style, format, longueur) |
| Accès | Public |
| Langues | anglais et chinois (bilingue) |
| Taille du jeu | 1239 requêtes, 6 domaines principaux, 100 sous-domaines |
| Année de publication | 2025 |
| Ressources | Article scientifique |
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,3 % | 25 juillet 2025 | Auto-déclaré |
| 2 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,3 % | 10 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,7 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,2 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,5 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,5 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,2 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,2 % | 22 juillet 2025 | Auto-déclaré |
| 9 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,6 % | 10 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,0 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,1 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,9 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,6 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,5 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 73,8 % | 5 septembre 2025 | Auto-déclaré |
Classement établi sur 15 modèles évalués. Score médian de l'ensemble : 85,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur WritingBench indique qu’un modèle produit des textes répondant efficacement aux critères propres à chaque tâche, notamment en matière de style, de format et de longueur. Le cadre dynamique, qui génère cinq critères spécifiques par requête, apporte davantage de finesse qu’une grille identique pour toutes les productions. Il reste toutefois fondé sur un jugement automatisé par LLM et modèle critique, tandis que les résultats de la base sont majoritairement auto-déclarés par les éditeurs.
La médiane de 85 % et le meilleur score de 88 % montrent un classement resserré, signe d’une différenciation limitée parmi les modèles recensés et d’un possible effet de saturation. L’accès public peut aussi exposer le jeu à un risque de contamination lors de l’entraînement ou de l’optimisation des modèles. Sa portée demeure centrée sur la rédaction en anglais et en chinois, selon les domaines couverts. Enfin, le classement révèle surtout les performances de la gamme Qwen : 14 des 15 modèles classés proviennent de cet éditeur, également co-développeur du benchmark. WritingBench ne constitue donc pas une source indépendante pour comparer Qwen aux autres éditeurs.
Sources des scores : llm-stats.