Bird-SQL (dev)

Bird-SQL (dev) est le split de développement de BIRD, un benchmark public créé par Jinyang Li et al. au sein de la BIRD team. Il évalue la génération de requêtes SQL à partir de questions formulées en anglais, dans des scénarios fondés sur des bases de données réalistes, aux schémas…

Bird-SQL (dev) est le split de développement de BIRD, un benchmark public créé par Jinyang Li et al. au sein de la BIRD team. Il évalue la génération de requêtes SQL à partir de questions formulées en anglais, dans des scénarios fondés sur des bases de données réalistes, aux schémas complexes et aux données imparfaites.

Le test mesure la capacité d’un modèle à comprendre la demande, à raisonner sur le schéma pertinent et à produire une requête SQL exécutable correcte. Il sert ainsi à comparer les performances text-to-SQL dans de nombreux domaines professionnels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkJinyang Li et al. (BIRD team)
Capacités mesuréesraisonnement
ModalitéTexte
Type de questionsgénération de requêtes SQL à partir de questions en langage naturel
Métrique d'évaluationexecution accuracy
AccèsPublic
Languesanglais
Taille du jeu1 534 questions pour le split dev ; 12 751 paires question-SQL au total
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire57,4 %5 février 2025Auto-déclaré
2Gemini 2.0 FlashGoogle🔒 Propriétaire56,9 %21 janvier 2025Auto-déclaré
3Gemma 3 27BGoogle🟢 Ouvert54,4 %12 mars 2025Auto-déclaré
4Gemma 3 12BGoogle🟢 Ouvert47,9 %12 mars 2025Auto-déclaré
5Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert41,8 %11 mars 2026Auto-déclaré
6Gemma 3 4BGoogle🟢 Ouvert36,3 %12 mars 2025Auto-déclaré
7Gemma 3 1BGoogle🟢 Ouvert6,4 %12 mars 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 47,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé en execution accuracy signifie qu’une plus grande proportion des requêtes générées produit le résultat attendu lors de l’exécution. Cette métrique évalue directement le comportement fonctionnel du SQL, plutôt que sa seule ressemblance avec une requête de référence. Elle combine toutefois plusieurs difficultés, notamment l’interprétation du langage naturel, la compréhension de schémas réalistes et la gestion de données imparfaites.

Le classement réunit sept modèles, avec un score médian de 48 % et une meilleure performance de 57 % pour Gemini 2.0 Flash-Lite. Cet écart indique une hiérarchie mesurable, sans saturation apparente du panel évalué. La portée reste circonscrite au text-to-SQL en anglais et au split dev de Bird-SQL, ce qui ne permet pas d’étendre directement les résultats à d’autres langues ou capacités.

La majorité des scores étant auto-déclarée par les éditeurs, leur comparaison est moins rigoureuse qu’une évaluation uniforme et indépendante. Enfin, le caractère public du benchmark appelle à considérer le risque d’exposition préalable aux questions, susceptible de compliquer l’interprétation d’éventuels effets de contamination.


Sources des scores : llm-stats.