RTEB Finance
MTEB: RTEB Finance est un benchmark créé par Hugging Face et le projet MTEB (embeddings-benchmark). Ce sous-ensemble spécialisé de RTEB évalue la qualité de récupération de documents dans le domaine financier, notamment pour les questions-réponses, les documents financiers et la…
MTEB: RTEB Finance est un benchmark créé par Hugging Face et le projet MTEB (embeddings-benchmark). Ce sous-ensemble spécialisé de RTEB évalue la qualité de récupération de documents dans le domaine financier, notamment pour les questions-réponses, les documents financiers et la gouvernance d’entreprise.
Il mesure la capacité des modèles d’embeddings à retrouver des contenus pertinents face à des demandes représentatives d’usages réels en production. Il sert ainsi à comparer les performances de retrieval spécialisé, au-delà d’une évaluation généraliste des représentations textuelles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Hugging Face / MTEB (embeddings-benchmark) |
| Capacités mesurées | Qualite de recuperation (retrieval) de documents dans le domaine financier (Q&A, documents financiers, gouvernance d'entreprise) |
| Modalité | Texte |
| Type de questions | Recuperation d'information (retrieval) dans le domaine financier |
| Métrique d'évaluation | NDCG@10 |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | RTEB couvre ~20 langues ; sous-ensemble finance majoritairement anglais |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (95)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | nvidia/Nemotron-3-Embed-8B-BF16 | NVIDIA | 🟢 Ouvert | 87,9 % | 16 juillet 2026 | ✅ Mesuré |
| 2 | voyageai/voyage-4-large (embed_dim=2048, evolved_prompts=True) | Voyage AI | 🟢 Ouvert | 87,3 % | 15 janvier 2026 | ✅ Mesuré |
| 3 | voyageai/voyage-4-large (embed_dim=2048) | Voyage AI | 🟢 Ouvert | 86,5 % | 15 janvier 2026 | ✅ Mesuré |
| 4 | voyageai/voyage-4-large | Voyage AI | 🟢 Ouvert | 86,1 % | 15 janvier 2026 | ✅ Mesuré |
| 5 | voyageai/voyage-3-large | Voyage AI | 🟢 Ouvert | 84,7 % | 7 janvier 2025 | ✅ Mesuré |
| 6 | voyageai/voyage-4 | Voyage AI | 🟢 Ouvert | 83,7 % | 15 janvier 2026 | ✅ Mesuré |
| 7 | Octen/Octen-Embedding-8B | Octen | 🟢 Ouvert | 83,2 % | 23 décembre 2025 | ✅ Mesuré |
| 8 | voyageai/voyage-3.5 | Voyage AI | 🟢 Ouvert | 82,7 % | 21 janvier 2025 | ✅ Mesuré |
| 9 | voyageai/voyage-3.5 (output_dtype=int8) | Voyage AI | 🟢 Ouvert | 82,7 % | 21 janvier 2025 | ✅ Mesuré |
| 10 | Octen/Octen-Embedding-8B-INT8 | Octen | 🟢 Ouvert | 82,3 % | 10 janvier 2026 | ✅ Mesuré |
| 11 | voyageai/voyage-4-lite | Voyage AI | 🟢 Ouvert | 81,1 % | 15 janvier 2026 | ✅ Mesuré |
| 12 | Octen/octen-vl-embedding-large | Octen | 🟢 Ouvert | 81,0 % | 15 mai 2026 | ✅ Mesuré |
| 13 | Octen/Octen-Embedding-4B | Octen | 🟢 Ouvert | 80,0 % | 30 décembre 2025 | ✅ Mesuré |
| 14 | Octen/Octen-Embedding-4B-INT8 | Octen | 🟢 Ouvert | 79,5 % | 2 avril 2026 | ✅ Mesuré |
| 15 | google/gemini-embedding-2-preview | 🟢 Ouvert | 78,6 % | 25 mars 2025 | ✅ Mesuré | |
| 16 | bflhc/MoD-Embedding | bflhc | 🟢 Ouvert | 78,0 % | 14 décembre 2025 | ✅ Mesuré |
| 17 | google/gemini-embedding-001 | 🟢 Ouvert | 77,9 % | 7 mars 2025 | ✅ Mesuré | |
| 18 | voyageai/voyage-3.5 (output_dtype=binary) | Voyage AI | 🟢 Ouvert | 77,8 % | 21 janvier 2025 | ✅ Mesuré |
| 19 | nvidia/Nemotron-3-Embed-1B-BF16 | NVIDIA | 🟢 Ouvert | 77,4 % | 16 juillet 2026 | ✅ Mesuré |
| 20 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 76,0 % | 9 mars 2026 | ✅ Mesuré |
| 21 | Cohere/Cohere-embed-v4.0 (output_dtype=int8) | Cohere | 🟢 Ouvert | 75,2 % | 1 décembre 2024 | ✅ Mesuré |
| 22 | Cohere/Cohere-embed-v4.0 | Cohere | 🟢 Ouvert | 75,0 % | 1 décembre 2024 | ✅ Mesuré |
| 23 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 74,8 % | 9 mars 2026 | ✅ Mesuré |
| 24 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 73,9 % | 9 mars 2026 | ✅ Mesuré |
| 25 | Octen/Octen-Embedding-0.6B | Octen | 🟢 Ouvert | 73,5 % | 10 janvier 2026 | ✅ Mesuré |
| 26 | google/text-embedding-004 | 🟢 Ouvert | 72,9 % | 14 mai 2024 | ✅ Mesuré | |
| 27 | Qwen: Qwen3 Embedding 8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,7 % | 28 octobre 2025 | ✅ Mesuré |
| 28 | Octen/octen-vl-embedding | Octen | 🟢 Ouvert | 72,2 % | 15 mai 2026 | ✅ Mesuré |
| 29 | Cohere/Cohere-embed-v4.0 (output_dtype=binary) | Cohere | 🟢 Ouvert | 71,9 % | 1 décembre 2024 | ✅ Mesuré |
| 30 | google/text-embedding-005 | 🟢 Ouvert | 71,9 % | 18 novembre 2024 | ✅ Mesuré | |
| 31 | nvidia/NV-Embed-v2 | NVIDIA | 🟢 Ouvert | 71,5 % | 9 septembre 2024 | ✅ Mesuré |
| 32 | GritLM/GritLM-7B | GritLM | 🟢 Ouvert | 71,3 % | 15 février 2024 | ✅ Mesuré |
| 33 | jinaai/jina-embeddings-v4 | Jina AI | 🟢 Ouvert | 70,6 % | 24 juin 2025 | ✅ Mesuré |
| 34 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 68,9 % | 9 mars 2026 | ✅ Mesuré |
| 35 | ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 68,6 % | 2 mai 2026 | ✅ Mesuré |
| 36 | openai/text-embedding-3-large | OpenAI | 🟢 Ouvert | 67,8 % | 25 janvier 2024 | ✅ Mesuré |
| 37 | ICT-TIME-and-Querit/BOOM_4B_v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 67,4 % | 31 janvier 2026 | ✅ Mesuré |
| 38 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 66,1 % | 1 avril 2026 | ✅ Mesuré |
| 39 | jinaai/jina-embeddings-v5-text-small | Jina AI | 🟢 Ouvert | 66,1 % | 17 février 2026 | ✅ Mesuré |
| 40 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 64,8 % | 1 avril 2026 | ✅ Mesuré |
| 41 | jinaai/jina-embeddings-v5-text-nano | Jina AI | 🟢 Ouvert | 64,8 % | 17 février 2026 | ✅ Mesuré |
| 42 | telepix/PIXIE-Rune-v1.0 | telepix | 🟢 Ouvert | 63,9 % | 15 janvier 2026 | ✅ Mesuré |
| 43 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 63,1 % | 9 mars 2026 | ✅ Mesuré |
| 44 | Snowflake/snowflake-arctic-embed-l-v2.0 | Snowflake | 🟢 Ouvert | 62,2 % | 4 décembre 2024 | ✅ Mesuré |
| 45 | openai/text-embedding-3-small | OpenAI | 🟢 Ouvert | 60,8 % | 25 janvier 2024 | ✅ Mesuré |
| 46 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 60,7 % | 9 mars 2026 | ✅ Mesuré |
| 47 | Alibaba-NLP/gte-base-en-v1.5 | Alibaba | 🟢 Ouvert | 58,7 % | 20 juin 2024 | ✅ Mesuré |
| 48 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 58,6 % | 8 février 2024 | ✅ Mesuré |
| 49 | BAAI: bge-large-en-v1.5 | BAAI | 🟢 Ouvert | 58,2 % | 18 novembre 2025 | ✅ Mesuré |
| 50 | ibm-granite/granite-embedding-english-r2 | IBM | 🟢 Ouvert | 58,2 % | 15 août 2025 | ✅ Mesuré |
| 51 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 57,7 % | 18 novembre 2025 | ✅ Mesuré |
| 52 | WhereIsAI/UAE-Large-V1 | WhereIsAI | 🟢 Ouvert | 57,5 % | 4 décembre 2023 | ✅ Mesuré |
| 53 | mixedbread-ai/mxbai-embed-large-v1 | Mixedbread AI | 🟢 Ouvert | 57,4 % | 7 mars 2024 | ✅ Mesuré |
| 54 | BAAI/bge-large-en | BAAI | 🟢 Ouvert | 57,1 % | 5 août 2023 | ✅ Mesuré |
| 55 | BAAI/bge-m3-unsupervised | BAAI | 🟢 Ouvert | 56,3 % | 30 janvier 2024 | ✅ Mesuré |
| 56 | MongoDB/mdbr-leaf-ir | MongoDB | 🟢 Ouvert | 56,0 % | 27 août 2025 | ✅ Mesuré |
| 57 | Sentence Transformers: all-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 55,9 % | 17 novembre 2025 | ✅ Mesuré |
| 58 | Alibaba-NLP/gte-multilingual-base | Alibaba | 🟢 Ouvert | 55,3 % | 20 juillet 2024 | ✅ Mesuré |
| 59 | BAAI: bge-base-en-v1.5 | BAAI | 🟢 Ouvert | 54,7 % | 18 novembre 2025 | ✅ Mesuré |
| 60 | bisectgroup/BiCA-base | bisectgroup | 🟢 Ouvert | 54,3 % | 14 novembre 2025 | ✅ Mesuré |
| 61 | Cohere/Cohere-embed-multilingual-v3.0 | Cohere | 🟢 Ouvert | 54,2 % | 2 novembre 2023 | ✅ Mesuré |
| 62 | BAAI/bge-base-en | BAAI | 🟢 Ouvert | 53,6 % | 5 août 2023 | ✅ Mesuré |
| 63 | MongoDB/mdbr-leaf-mt | MongoDB | 🟢 Ouvert | 53,6 % | 27 août 2025 | ✅ Mesuré |
| 64 | ibm-granite/granite-embedding-311m-multilingual-r2 | IBM | 🟢 Ouvert | 52,9 % | 29 avril 2026 | ✅ Mesuré |
| 65 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 52,9 % | 9 mars 2026 | ✅ Mesuré |
| 66 | jinaai/jina-embeddings-v2-base-en | Jina AI | 🟢 Ouvert | 52,4 % | 27 septembre 2023 | ✅ Mesuré |
| 67 | Cohere/Cohere-embed-english-v3.0 | Cohere | 🟢 Ouvert | 51,4 % | 2 novembre 2023 | ✅ Mesuré |
| 68 | intfloat/e5-mistral-7b-instruct | Intfloat | 🟢 Ouvert | 51,0 % | 8 février 2024 | ✅ Mesuré |
| 69 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 51,0 % | 8 février 2024 | ✅ Mesuré |
| 70 | BAAI/bge-small-en-v1.5 | BAAI | 🟢 Ouvert | 50,9 % | 12 septembre 2023 | ✅ Mesuré |
| 71 | ibm-granite/granite-embedding-small-english-r2 | IBM | 🟢 Ouvert | 50,5 % | 15 août 2025 | ✅ Mesuré |
| 72 | ibm-granite/granite-embedding-97m-multilingual-r2 | IBM | 🟢 Ouvert | 48,1 % | 29 avril 2026 | ✅ Mesuré |
| 73 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 47,6 % | 9 mars 2026 | ✅ Mesuré |
| 74 | sentence-transformers/multi-qa-MiniLM-L6-cos-v1 | Sentence Transformers | 🟢 Ouvert | 46,2 % | 30 août 2021 | ✅ Mesuré |
| 75 | jinaai/jina-embeddings-v2-small-en | Jina AI | 🟢 Ouvert | 45,8 % | 27 septembre 2023 | ✅ Mesuré |
| 76 | Sentence Transformers: all-MiniLM-L6-v2 | Sentence Transformers | 🟢 Ouvert | 43,8 % | 17 novembre 2025 | ✅ Mesuré |
| 77 | Sentence Transformers: all-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 43,3 % | 18 novembre 2025 | ✅ Mesuré |
| 78 | sentence-transformers/static-retrieval-mrl-en-v1 | Sentence Transformers | 🟢 Ouvert | 37,4 % | 24 octobre 2024 | ✅ Mesuré |
| 79 | BAAI/bge-large-zh-v1.5 | BAAI | 🟢 Ouvert | 36,5 % | 12 septembre 2023 | ✅ Mesuré |
| 80 | sentence-transformers/paraphrase-multilingual-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 36,2 % | 1 novembre 2019 | ✅ Mesuré |
| 81 | BAAI/bge-base-zh-v1.5 | BAAI | 🟢 Ouvert | 34,9 % | 11 septembre 2023 | ✅ Mesuré |
| 82 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 29,8 % | 15 janvier 2025 | ✅ Mesuré |
| 83 | sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 29,8 % | 1 novembre 2019 | ✅ Mesuré |
| 84 | minishlab/potion-base-8M | minishlab | 🟢 Ouvert | 29,1 % | 29 octobre 2024 | ✅ Mesuré |
| 85 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 27,3 % | 23 mai 2025 | ✅ Mesuré |
| 86 | sentence-transformers/LaBSE | Sentence Transformers | 🟢 Ouvert | 27,0 % | 1 novembre 2019 | ✅ Mesuré |
| 87 | minishlab/potion-base-4M | minishlab | 🟢 Ouvert | 26,4 % | 29 octobre 2024 | ✅ Mesuré |
| 88 | minishlab/M2V_base_glove | minishlab | 🟢 Ouvert | 25,5 % | 21 septembre 2024 | ✅ Mesuré |
| 89 | BAAI/bge-small-zh-v1.5 | BAAI | 🟢 Ouvert | 24,6 % | 12 septembre 2023 | ✅ Mesuré |
| 90 | minishlab/potion-base-2M | minishlab | 🟢 Ouvert | 23,1 % | 29 octobre 2024 | ✅ Mesuré |
| 91 | minishlab/M2V_base_glove_subword | minishlab | 🟢 Ouvert | 20,8 % | 21 septembre 2024 | ✅ Mesuré |
| 92 | minishlab/M2V_base_output | minishlab | 🟢 Ouvert | 20,7 % | 21 septembre 2024 | ✅ Mesuré |
| 93 | shibing624/text2vec-base-multilingual | shibing624 | 🟢 Ouvert | 16,8 % | 22 juin 2023 | ✅ Mesuré |
| 94 | shibing624/text2vec-base-chinese | shibing624 | 🟢 Ouvert | 15,2 % | 23 janvier 2022 | ✅ Mesuré |
| 95 | minishlab/M2V_multilingual_output | minishlab | 🟢 Ouvert | 14,0 % | 21 septembre 2024 | ✅ Mesuré |
Classement établi sur 95 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 58,6 %.
Notre analyse
Un score NDCG@10 élevé indique que le modèle place plus efficacement les documents pertinents parmi les dix premiers résultats. Le classement fait apparaître un écart marqué entre la médiane de 58 % sur 93 modèles et les 87 % de voyageai/voyage-4-large (embed_dim=2048, evolved_prompts=True), ce qui distingue nettement le meilleur résultat sans suggérer une saturation générale du benchmark.
La rigueur doit toutefois être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs. Le jeu de test privé, dont les réponses ne sont pas divulguées, réduit l’exposition directe des résultats attendus sur les tâches concernées. L’ensemble combine néanmoins des jeux ouverts et fermés, ce qui implique des niveaux d’exposition différents et ne permet pas d’écarter uniformément le risque de contamination. Enfin, la portée reste spécialisée dans la finance et le sous-ensemble est majoritairement anglophone, même si RTEB couvre environ vingt langues. Le classement renseigne donc avant tout sur l’efficacité du retrieval financier dans ce cadre précis, plutôt que sur les capacités générales des modèles d’embeddings.
Sources des scores : mteb.