COLLIE
COLLIE est un cadre fondé sur une grammaire pour construire systématiquement des tâches de génération de texte sous contraintes compositionnelles. Créé par Princeton University et ses collaborateurs, il couvre plusieurs niveaux de production, du mot au passage.
COLLIE est un cadre fondé sur une grammaire pour construire systématiquement des tâches de génération de texte sous contraintes compositionnelles. Créé par Princeton University et ses collaborateurs, il couvre plusieurs niveaux de production, du mot au passage.
Le benchmark évalue la capacité des modèles à respecter des consignes complexes tout en mobilisant compréhension du langage, raisonnement logique, comptage et planification sémantique. Il sert ainsi à mesurer de façon structurée la maîtrise des contraintes, au-delà de la seule fluidité du texte généré.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Princeton University (et collaborateurs) |
| Capacités mesurées | Generation contrainte, comprehension du langage, raisonnement logique, comptage, planification semantique |
| Modalité | Texte |
| Type de questions | Generation de texte sous contraintes compositionnelles (mot, phrase, paragraphe, passage) |
| Métrique d'évaluation | Satisfaction des contraintes (verification automatique) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | COLLIE-v1 : 2 080 instances, 13 structures de contraintes |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 🔒 Propriétaire | 99,0 % | 7 août 2025 | Auto-déclaré |
| 2 | o3-mini | OpenAI | 🔒 Propriétaire | 98,7 % | 30 janvier 2025 | Auto-déclaré |
| 3 | o3 | OpenAI | 🔒 Propriétaire | 98,4 % | 16 avril 2025 | Auto-déclaré |
| 4 | Mistral Medium 3.5 | Mistral AI | 🟢 Ouvert | 95,8 % | 29 avril 2026 | Auto-déclaré |
| 5 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 72,3 % | 5 mars 2026 | Auto-déclaré |
| 6 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 65,8 % | 14 avril 2025 | Auto-déclaré |
| 7 | Mistral Small 4 | Mistral AI | 🟢 Ouvert | 62,9 % | 16 mars 2026 | Auto-déclaré |
| 8 | GPT-4o | OpenAI | 🔒 Propriétaire | 61,0 % | 27 mars 2025 | Auto-déclaré |
| 9 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 54,6 % | 14 avril 2025 | Auto-déclaré |
| 10 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 42,5 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués, dont 10 de grands éditeurs. Score médian de l'ensemble : 69,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle satisfait fréquemment les contraintes imposées, selon une vérification automatique. Cette méthode apporte un critère mesurable et reproductible, mais les résultats recensés sont majoritairement auto-déclarés par les éditeurs, ce qui invite à considérer avec prudence leur comparabilité. Le classement montre une forte performance d’ensemble, avec un score médian de 69 %, tandis que GPT-5 atteint 99 %. Ce résultat proche du maximum suggère une possible saturation au sommet du benchmark, où les écarts entre les meilleurs modèles peuvent devenir moins discriminants. La portée de COLLIE reste centrée sur la génération contrainte en anglais et sur les 13 structures de COLLIE-v1. Elle renseigne donc précisément sur le respect de contraintes compositionnelles, sans constituer une mesure générale de toutes les capacités d’un modèle. Enfin, son accès public facilite l’évaluation, mais peut aussi accroître le risque d’exposition préalable des modèles aux tâches, un facteur de contamination à garder à l’esprit lors de l’interprétation des scores.
Sources des scores : llm-stats.