SQuALITY

SQuALITY est un benchmark de compréhension de longs documents et de résumé abstrait orienté question. Il s’appuie sur des nouvelles du domaine public, lues puis résumées à partir de zéro par des contributeurs qualifiés, afin de produire des synthèses originales, fidèles et centrées sur…

SQuALITY est un benchmark de compréhension de longs documents et de résumé abstrait orienté question. Il s’appuie sur des nouvelles du domaine public, lues puis résumées à partir de zéro par des contributeurs qualifiés, afin de produire des synthèses originales, fidèles et centrées sur des demandes précises.

Créé en 2022 par l’équipe NYU Machine Learning for Language, notamment Alex Wang, Richard Yuanzhe Pang, Angelica Chen, Jason Phang et Samuel R. Bowman, SQuALITY sert à évaluer la capacité des modèles à extraire et synthétiser les éléments pertinents de textes longs en anglais.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkNYU Machine Learning for Language (Alex Wang, Richard Yuanzhe Pang, Angelica Chen, Jason Phang, Samuel R. Bowman)
Capacités mesuréesComprehension de longs documents et resume abstrait oriente question, redige par des contributeurs qualifies.
ModalitéTexte
Type de questionsResume abstrait oriente question (query-focused summarization) sur long document
Métrique d'évaluationROUGE (et evaluation humaine)
AccèsPublic
LanguesAnglais
Taille du jeuNouvelles du domaine public (~3000-6000 mots), 5 questions par texte, 4 resumes de reference par question
Année de publication2022
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Phi-3.5-mini-instructMicrosoft🟢 Ouvert24,3 %23 août 2024Auto-déclaré
2Phi-3.5-MoE-instructMicrosoft🟢 Ouvert24,1 %23 août 2024Auto-déclaré
3Nova ProAmazon🔒 Propriétaire19,8 %20 novembre 2024Auto-déclaré
4Nova LiteAmazon🔒 Propriétaire19,2 %20 novembre 2024Auto-déclaré
5Nova MicroAmazon🔒 Propriétaire18,8 %20 novembre 2024Auto-déclaré

Classement établi sur 5 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 19,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur SQuALITY indique une meilleure aptitude à comprendre une nouvelle longue et à générer un résumé abstrait répondant à une question donnée. L’évaluation repose sur ROUGE, complété par une évaluation humaine, face à plusieurs résumés de référence rédigés par des contributeurs qualifiés. Cette conception renforce la rigueur des références, mais les résultats recensés dans la base sont majoritairement auto-déclarés par les éditeurs, ce qui impose de les interpréter avec prudence.

Parmi les cinq modèles évalués, Phi-3.5-mini-instruct de Microsoft arrive en tête avec 24 %, contre une médiane de 20 %. Cet écart limité distingue le premier modèle sans indiquer une forte séparation du groupe. Le niveau général ne suggère pas une saturation du benchmark. Sa portée reste ciblée sur des nouvelles en anglais et sur le résumé orienté question, plutôt que sur l’ensemble des formes de compréhension longue. Enfin, son accès public peut créer un risque de contamination si les contenus du jeu interviennent dans l’entraînement ou l’ajustement des modèles.


Sources des scores : llm-stats.