GLM-Image

GLM-Image est un modèle de génération d’images publié par Zhipu AI le 13 janvier 2026. Il transforme une description en image et accepte aussi une image existante pour l’édition, le transfert de style, la préservation d’identité et la composition cohérente de plusieurs sujets.

GLM-Image est un modèle de génération d’images publié par Zhipu AI le 13 janvier 2026. Il transforme une description en image et accepte aussi une image existante pour l’édition, le transfert de style, la préservation d’identité et la composition cohérente de plusieurs sujets.

Son architecture hybride associe un générateur autorégressif initialisé depuis GLM-4-9B-0414 à un décodeur de diffusion DiT en espace latent. Dans Arena, ses résultats le placent en retrait, aussi bien en text-to-image qu’en image-editing.

Caractéristiques

CaractéristiqueValeur
TypeModèle de génération d'images
ÉditeurZhipu AI
Poids🟢 Poids ouverts
Date de sortie13 janvier 2026

Classements Arena (Elo)

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
132ᵉHiDream-O1-Image-Dev1086
133ᵉPhoenix 1.0 Ultra1085
134ᵉGLM-Image1083
135ᵉHiDream-I1-Dev1082
136ᵉseedream-31082

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
132ᵉHiDream-O1-Image-Dev1086
133ᵉPhoenix 1.0 Ultra1085
134ᵉGLM-Image1083
135ᵉHiDream-I1-Dev1082
136ᵉseedream-31082

Arena Image Editing · 70 modèles classés

RangModèleElo
1ᵉGPT Image 21414
2ᵉRiverflow 2.01395
3ᵉGPT Image 1.5 (high)1381
64ᵉHiDream-E1.11047
65ᵉGemini 2.0 Flash Preview1000
66ᵉGLM-Image999
67ᵉOmniGen V2972
68ᵉBagel950

Notre analyse

Forces. GLM-Image réunit génération et édition dans un même modèle, avec des fonctions adaptées à l’illustration, au design et à la création publicitaire. Son module Glyph Encoder vise le rendu de texte intégré aux images. L’architecture combine des tokens visuels traités par le générateur autorégressif et un décodeur de diffusion chargé de produire l’image. Le post-entraînement emploie un apprentissage par renforcement découplé avec GRPO, avec des signaux de retour distincts pour les deux modules.

Limites et points d’attention. Les deux relevés text-to-image disponibles situent GLM-Image dans la seconde moitié d’Arena, loin des modèles de tête. Son positionnement est encore plus faible en image-editing, où il figure près du bas du classement. Ces résultats limitent son intérêt lorsque la préférence humaine mesurée par Arena constitue le principal indicateur de qualité. Usages pertinents : prototypage d’illustrations, essais de styles, compositions multi-sujets et retouches avec préservation d’identité ; pour un résultat plus abouti, on lui préférera GPT Image 2, MAI-Image-2.5 ou Riverflow 2.0.


Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com).