Multi-IF
Multi-IF est un benchmark créé en 2024 par Meta GenAI pour évaluer la capacité des grands modèles de langage à suivre des instructions dans des dialogues multilingues à plusieurs tours. Il prolonge IFEval en ajoutant des séquences conversationnelles et des traductions de prompts anglais.