OfficeQA Pro
OfficeQA Pro est un benchmark créé par Databricks pour évaluer le raisonnement ancré dans des workflows d’entreprise. Ses questions reproduisent des tâches professionnelles telles que l’analyse documentaire, le raisonnement sur des tableurs et la synthèse d’informations issues de…
OfficeQA Pro est un benchmark créé par Databricks pour évaluer le raisonnement ancré dans des workflows d’entreprise. Ses questions reproduisent des tâches professionnelles telles que l’analyse documentaire, le raisonnement sur des tableurs et la synthèse d’informations issues de plusieurs documents.
L’évaluation porte sur la capacité des modèles à produire, de bout en bout, des réponses vérifiables à partir d’un vaste corpus de US Treasury Bulletins. Elle sert ainsi à comparer leur aptitude à mobiliser des données d’entreprise complexes dans des scénarios proches du travail de bureau.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Databricks |
| Capacités mesurées | Raisonnement ancré et multi-documents sur des tâches de travail de bureau (analyse documentaire, raisonnement sur tableurs, synthèse d'informations) dans des workflows d'entreprise. |
| Modalité | Texte |
| Type de questions | Raisonnement ancré end-to-end sur documents d'entreprise (QA multi-documents) |
| Métrique d'évaluation | Exactitude sur réponses vérifiables |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 133 questions ; corpus = US Treasury Bulletins (~89 000 pages, >26 millions de valeurs numériques) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 72,2 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 71,1 % | 24 juin 2026 | Auto-déclaré |
| 3 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 66,2 % | 28 mai 2026 | Auto-déclaré |
| 4 | Kimi K3 | Moonshot AI | ▫ n.d. | 63,3 % | 16 juillet 2026 | Auto-déclaré |
| 5 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 59,4 % | 30 juin 2026 | Auto-déclaré |
| 6 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 54,1 % | 23 avril 2026 | Auto-déclaré |
| 7 | MiniMax M3 | MiniMax | 🟢 Ouvert | 45,1 % | 1 juin 2026 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 63,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle répond correctement à une forte proportion de questions vérifiables nécessitant de retrouver, croiser et interpréter des informations réparties dans plusieurs documents. Le classement place Seed 2.1 Pro en tête à 72 %, tandis que la médiane des six modèles évalués atteint 63 %. Cet écart révèle un avantage mesurable du premier modèle, mais aussi une marge d’erreur encore notable, ce qui ne traduit pas une saturation complète du benchmark.
La lecture des résultats demande néanmoins de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique et indépendant. Le caractère public du jeu appelle aussi à considérer le risque d’exposition préalable au corpus lors de l’interprétation des performances. Enfin, la portée reste ciblée sur des questions en anglais fondées sur les US Treasury Bulletins. OfficeQA Pro renseigne donc spécifiquement le raisonnement multi-documents sur des données financières et administratives, dans le contexte de tâches de bureau et de workflows d’entreprise.
Sources des scores : llm-stats.