Bird-SQL (dev)
Bird-SQL (dev) est le split de développement de BIRD, un benchmark public créé par Jinyang Li et al. au sein de la BIRD team. Il évalue la génération de requêtes SQL à partir de questions formulées en anglais, dans des scénarios fondés sur des bases de données réalistes, aux schémas…
Bird-SQL (dev) est le split de développement de BIRD, un benchmark public créé par Jinyang Li et al. au sein de la BIRD team. Il évalue la génération de requêtes SQL à partir de questions formulées en anglais, dans des scénarios fondés sur des bases de données réalistes, aux schémas complexes et aux données imparfaites.
Le test mesure la capacité d’un modèle à comprendre la demande, à raisonner sur le schéma pertinent et à produire une requête SQL exécutable correcte. Il sert ainsi à comparer les performances text-to-SQL dans de nombreux domaines professionnels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Jinyang Li et al. (BIRD team) |
| Capacités mesurées | raisonnement |
| Modalité | Texte |
| Type de questions | génération de requêtes SQL à partir de questions en langage naturel |
| Métrique d'évaluation | execution accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 1 534 questions pour le split dev ; 12 751 paires question-SQL au total |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 57,4 % | 5 février 2025 | Auto-déclaré | |
| 2 | Gemini 2.0 Flash | 🔒 Propriétaire | 56,9 % | 21 janvier 2025 | Auto-déclaré | |
| 3 | Gemma 3 27B | 🟢 Ouvert | 54,4 % | 12 mars 2025 | Auto-déclaré | |
| 4 | Gemma 3 12B | 🟢 Ouvert | 47,9 % | 12 mars 2025 | Auto-déclaré | |
| 5 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 41,8 % | 11 mars 2026 | Auto-déclaré |
| 6 | Gemma 3 4B | 🟢 Ouvert | 36,3 % | 12 mars 2025 | Auto-déclaré | |
| 7 | Gemma 3 1B | 🟢 Ouvert | 6,4 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 47,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé en execution accuracy signifie qu’une plus grande proportion des requêtes générées produit le résultat attendu lors de l’exécution. Cette métrique évalue directement le comportement fonctionnel du SQL, plutôt que sa seule ressemblance avec une requête de référence. Elle combine toutefois plusieurs difficultés, notamment l’interprétation du langage naturel, la compréhension de schémas réalistes et la gestion de données imparfaites.
Le classement réunit sept modèles, avec un score médian de 48 % et une meilleure performance de 57 % pour Gemini 2.0 Flash-Lite. Cet écart indique une hiérarchie mesurable, sans saturation apparente du panel évalué. La portée reste circonscrite au text-to-SQL en anglais et au split dev de Bird-SQL, ce qui ne permet pas d’étendre directement les résultats à d’autres langues ou capacités.
La majorité des scores étant auto-déclarée par les éditeurs, leur comparaison est moins rigoureuse qu’une évaluation uniforme et indépendante. Enfin, le caractère public du benchmark appelle à considérer le risque d’exposition préalable aux questions, susceptible de compliquer l’interprétation d’éventuels effets de contamination.
Sources des scores : llm-stats.