Z-Image Turbo

Publié par Qwen le 2 décembre 2025, Z-Image Turbo est un modèle de génération d’images à 6 milliards de paramètres. Cette variante distillée de la famille Z-Image transforme des descriptions en visuels, avec un positionnement axé sur le photoréalisme, le suivi d’instructions et le rendu…

Publié par Qwen le 2 décembre 2025, Z-Image Turbo est un modèle de génération d’images à 6 milliards de paramètres. Cette variante distillée de la famille Z-Image transforme des descriptions en visuels, avec un positionnement axé sur le photoréalisme, le suivi d’instructions et le rendu de texte en anglais et en chinois.

Dans Arena text-to-image, il se situe en retrait des modèles les mieux classés, malgré des résultats qui le placent dans la première moitié du tableau selon les évaluations disponibles. Son utilisation passe par Diffusers et ZImagePipeline, avec prise en charge de Flash Attention, de la compilation et de l’offloading CPU.

Caractéristiques

CaractéristiqueValeur
TypeModèle de génération d'images
ÉditeurQwen
Poids🟢 Poids ouverts
Date de sortie2 décembre 2025

Classements Arena (Elo)

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
126ᵉHiDream-I1-Fast1093
127ᵉReve Image (Halfmoon)1092
128ᵉZ-Image Turbo1092
129ᵉFLUX.2 [klein] Base 9B1088
130ᵉImagen 4 Fast Preview 06061087

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
126ᵉHiDream-I1-Fast1093
127ᵉReve Image (Halfmoon)1092
128ᵉZ-Image Turbo1092
129ᵉFLUX.2 [klein] Base 9B1088
130ᵉImagen 4 Fast Preview 06061087

Notre analyse

Forces. Z-Image Turbo repose sur une architecture Scalable Single-Stream DiT, qui réunit dans un même flux les tokens textuels, les représentations visuelles sémantiques et les données issues du VAE d’image. Sa distillation permet une génération en 8 NFEs, sans CFG. Son entraînement combine pré-entraînement, SFT et RL. Le modèle cible particulièrement les images photoréalistes, le respect des consignes et l’intégration de texte bilingue anglais-chinois, des caractéristiques utiles pour l’illustration, les maquettes de design et les créations publicitaires comportant des éléments typographiques.

Limites et points d'attention. Son positionnement Arena reste nettement derrière les meilleurs modèles évalués, notamment GPT Image 2 et MAI-Image-2.5. Il convient donc davantage aux projets privilégiant un pipeline Diffusers et des options d’optimisation comme Flash Attention, la compilation ou l’offloading CPU qu’aux productions recherchant la préférence humaine la plus élevée dans Arena. Usages pertinents : prototypage visuel, illustration photoréaliste, design bilingue et création publicitaire, mais pour un résultat plus abouti, on lui préférera OpenAI GPT Image 2 ou Microsoft MAI-Image-2.5.


Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com).