Bagel

Bagel est un modèle de génération et d’édition d’images publié par ByteDance le 20 mai 2025. Il transforme des descriptions en images et prend également en charge l’édition libre. En Arena, son text-to-image se situe dans la première moitié du classement, tandis que ses résultats en…

Bagel est un modèle de génération et d’édition d’images publié par ByteDance le 20 mai 2025. Il transforme des descriptions en images et prend également en charge l’édition libre. En Arena, son text-to-image se situe dans la première moitié du classement, tandis que ses résultats en édition d’images sont proches du bas de tableau.

Distribué en open source, Bagel compte 7 milliards de paramètres actifs et 14 milliards au total. Son ancienneté d’environ un an le rattache désormais à une génération déjà ancienne à l’échelle de l’IA.

Caractéristiques

CaractéristiqueValeur
TypeModèle de génération d'images
ÉditeurByteDance
Poids🟢 Poids ouverts
Date de sortie20 mai 2025

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Image Edit102651ᵉ / 52GPT Image 2 (1465)
Arena Image Editing95067ᵉ / 70GPT Image 2 (1414)
Arena Text-to-Image89874ᵉ / 225GPT Image 2 (1385)
Arena Text-to-Image855136ᵉ / 225GPT Image 2 (1385)

Notre analyse

Forces. L’intérêt de Bagel réside dans son ouverture et dans une architecture multimodale Mixture-of-Transformer-Experts. Deux encodeurs distincts traitent les caractéristiques visuelles au niveau des pixels et au niveau sémantique. Son entraînement repose sur des données entrelacées de langage, d’images, de vidéos et du web, avec une prédiction du prochain groupe de tokens visuels ou linguistiques. Outre le text-to-image, il couvre l’édition libre, la prédiction de futures frames, la manipulation 3D et la navigation dans le monde.

Limites et points d’attention. Les préférences humaines d’Arena placent Bagel nettement en retrait pour l’édition, presque en dernière position dans les deux classements concernés. Son rang en text-to-image est moins défavorable, mais il reste loin des modèles en tête. Son âge accentue cet écart face aux solutions plus récentes. Usages pertinents : expérimentation open source, prototypage d’illustrations, exploration de concepts de design et premières maquettes publicitaires ; pour un résultat plus abouti, on lui préférera GPT Image 2, muse-image ou MAI-Image-2.5.


Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com).