SQuALITY
SQuALITY est un benchmark de compréhension de longs documents et de résumé abstrait orienté question. Il s’appuie sur des nouvelles du domaine public, lues puis résumées à partir de zéro par des contributeurs qualifiés, afin de produire des synthèses originales, fidèles et centrées sur…
SQuALITY est un benchmark de compréhension de longs documents et de résumé abstrait orienté question. Il s’appuie sur des nouvelles du domaine public, lues puis résumées à partir de zéro par des contributeurs qualifiés, afin de produire des synthèses originales, fidèles et centrées sur des demandes précises.
Créé en 2022 par l’équipe NYU Machine Learning for Language, notamment Alex Wang, Richard Yuanzhe Pang, Angelica Chen, Jason Phang et Samuel R. Bowman, SQuALITY sert à évaluer la capacité des modèles à extraire et synthétiser les éléments pertinents de textes longs en anglais.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | NYU Machine Learning for Language (Alex Wang, Richard Yuanzhe Pang, Angelica Chen, Jason Phang, Samuel R. Bowman) |
| Capacités mesurées | Comprehension de longs documents et resume abstrait oriente question, redige par des contributeurs qualifies. |
| Modalité | Texte |
| Type de questions | Resume abstrait oriente question (query-focused summarization) sur long document |
| Métrique d'évaluation | ROUGE (et evaluation humaine) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | Nouvelles du domaine public (~3000-6000 mots), 5 questions par texte, 4 resumes de reference par question |
| Année de publication | 2022 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 24,3 % | 23 août 2024 | Auto-déclaré |
| 2 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 24,1 % | 23 août 2024 | Auto-déclaré |
| 3 | Nova Pro | Amazon | 🔒 Propriétaire | 19,8 % | 20 novembre 2024 | Auto-déclaré |
| 4 | Nova Lite | Amazon | 🔒 Propriétaire | 19,2 % | 20 novembre 2024 | Auto-déclaré |
| 5 | Nova Micro | Amazon | 🔒 Propriétaire | 18,8 % | 20 novembre 2024 | Auto-déclaré |
Classement établi sur 5 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 19,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur SQuALITY indique une meilleure aptitude à comprendre une nouvelle longue et à générer un résumé abstrait répondant à une question donnée. L’évaluation repose sur ROUGE, complété par une évaluation humaine, face à plusieurs résumés de référence rédigés par des contributeurs qualifiés. Cette conception renforce la rigueur des références, mais les résultats recensés dans la base sont majoritairement auto-déclarés par les éditeurs, ce qui impose de les interpréter avec prudence.
Parmi les cinq modèles évalués, Phi-3.5-mini-instruct de Microsoft arrive en tête avec 24 %, contre une médiane de 20 %. Cet écart limité distingue le premier modèle sans indiquer une forte séparation du groupe. Le niveau général ne suggère pas une saturation du benchmark. Sa portée reste ciblée sur des nouvelles en anglais et sur le résumé orienté question, plutôt que sur l’ensemble des formes de compréhension longue. Enfin, son accès public peut créer un risque de contamination si les contenus du jeu interviennent dans l’entraînement ou l’ajustement des modèles.
Sources des scores : llm-stats.