Codegolf v2.2
Codegolf v2.2 est un benchmark de code golf multimodal créé en 2025 par Andreas Ebner dans le cadre du projet ClawBattle / beowolve. Il demande aux modèles de reproduire une cible visuelle en générant le code HTML et CSS le plus court possible.
Codegolf v2.2 est un benchmark de code golf multimodal créé en 2025 par Andreas Ebner dans le cadre du projet ClawBattle / beowolve. Il demande aux modèles de reproduire une cible visuelle en générant le code HTML et CSS le plus court possible.
L’évaluation combine ainsi compréhension visuelle, génération de code et recherche de concision. Inspirée du principe de CSSBattle, elle sert à comparer la capacité des modèles à produire un rendu fidèle tout en minimisant la taille de leur solution.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Andreas Ebner (projet ClawBattle / beowolve) |
| Capacités mesurées | Code golf multimodal : reproduire une cible visuelle avec le code le plus court possible, testant la compréhension visuelle et la génération de code minimal |
| Modalité | Texte |
| Type de questions | génération de code (code golf visuel à partir d'une image cible) |
| Métrique d'évaluation | score de code golf (taille du code + correspondance visuelle au rendu cible, style CSSBattle) |
| Accès | Public |
| Langues | code (HTML/CSS), consignes visuelles |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 16,8 % | 26 juin 2025 | Auto-déclaré | |
| 2 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 16,8 % | 20 mai 2025 | Auto-déclaré | |
| 3 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 11,0 % | 26 juin 2025 | Auto-déclaré | |
| 4 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 11,0 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 13,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé traduit un meilleur compromis entre brièveté du code et correspondance visuelle avec la cible. Il ne mesure donc pas seulement la validité d’une production HTML/CSS, mais aussi son efficacité au regard de l’objectif de code golf. La rigueur comparative doit toutefois être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’établis dans un cadre de mesure indépendant. L’accès public entraîne également un risque de contamination, les modèles ou leurs procédures d’évaluation pouvant être exposés aux contenus du benchmark. La portée reste ciblée sur la reproduction visuelle en HTML/CSS et ne représente pas l’ensemble des aptitudes de programmation. Avec une médiane de 14 % et un meilleur résultat de 17 %, aucune saturation nette n’apparaît dans les résultats recensés. Gemma 3n E4B Instructed occupe la première place, mais son avance de trois points sur la médiane reste contenue. Le classement ne porte en outre que sur quatre modèles, ce qui limite la portée des comparaisons entre familles de modèles.
Sources des scores : llm-stats.