COLLIE

COLLIE est un cadre fondé sur une grammaire pour construire systématiquement des tâches de génération de texte sous contraintes compositionnelles. Créé par Princeton University et ses collaborateurs, il couvre plusieurs niveaux de production, du mot au passage.

COLLIE est un cadre fondé sur une grammaire pour construire systématiquement des tâches de génération de texte sous contraintes compositionnelles. Créé par Princeton University et ses collaborateurs, il couvre plusieurs niveaux de production, du mot au passage.

Le benchmark évalue la capacité des modèles à respecter des consignes complexes tout en mobilisant compréhension du langage, raisonnement logique, comptage et planification sémantique. Il sert ainsi à mesurer de façon structurée la maîtrise des contraintes, au-delà de la seule fluidité du texte généré.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkPrinceton University (et collaborateurs)
Capacités mesuréesGeneration contrainte, comprehension du langage, raisonnement logique, comptage, planification semantique
ModalitéTexte
Type de questionsGeneration de texte sous contraintes compositionnelles (mot, phrase, paragraphe, passage)
Métrique d'évaluationSatisfaction des contraintes (verification automatique)
AccèsPublic
Languesanglais
Taille du jeuCOLLIE-v1 : 2 080 instances, 13 structures de contraintes
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5OpenAI🔒 Propriétaire99,0 %7 août 2025Auto-déclaré
2o3-miniOpenAI🔒 Propriétaire98,7 %30 janvier 2025Auto-déclaré
3o3OpenAI🔒 Propriétaire98,4 %16 avril 2025Auto-déclaré
4Mistral Medium 3.5Mistral AI🟢 Ouvert95,8 %29 avril 2026Auto-déclaré
5GPT-4.5OpenAI🔒 Propriétaire72,3 %5 mars 2026Auto-déclaré
6GPT-4.1OpenAI🔒 Propriétaire65,8 %14 avril 2025Auto-déclaré
7Mistral Small 4Mistral AI🟢 Ouvert62,9 %16 mars 2026Auto-déclaré
8GPT-4oOpenAI🔒 Propriétaire61,0 %27 mars 2025Auto-déclaré
9GPT-4.1 miniOpenAI🔒 Propriétaire54,6 %14 avril 2025Auto-déclaré
10GPT-4.1 nanoOpenAI🔒 Propriétaire42,5 %14 avril 2025Auto-déclaré

Classement établi sur 10 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 69,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle satisfait fréquemment les contraintes imposées, selon une vérification automatique. Cette méthode apporte un critère mesurable et reproductible, mais les résultats recensés sont majoritairement auto-déclarés par les éditeurs, ce qui invite à considérer avec prudence leur comparabilité. Le classement montre une forte performance d’ensemble, avec un score médian de 69 %, tandis que GPT-5 atteint 99 %. Ce résultat proche du maximum suggère une possible saturation au sommet du benchmark, où les écarts entre les meilleurs modèles peuvent devenir moins discriminants. La portée de COLLIE reste centrée sur la génération contrainte en anglais et sur les 13 structures de COLLIE-v1. Elle renseigne donc précisément sur le respect de contraintes compositionnelles, sans constituer une mesure générale de toutes les capacités d’un modèle. Enfin, son accès public facilite l’évaluation, mais peut aussi accroître le risque d’exposition préalable des modèles aux tâches, un facteur de contamination à garder à l’esprit lors de l’interprétation des scores.


Sources des scores : llm-stats.