German

MTEB: German est un benchmark communautaire créé par MTEB / MMTEB pour évaluer la qualité des plongements de texte en allemand. Il couvre plusieurs usages complémentaires, notamment la classification, le clustering, la classification de paires, le reranking, la recherche et la similarité…

MTEB: German est un benchmark communautaire créé par MTEB / MMTEB pour évaluer la qualité des plongements de texte en allemand. Il couvre plusieurs usages complémentaires, notamment la classification, le clustering, la classification de paires, le reranking, la recherche et la similarité sémantique.

Cette diversité permet d’apprécier la capacité d’un modèle à produire des représentations utiles dans différents contextes, plutôt que sur une tâche unique. Le score moyen MTEB sert ainsi de synthèse, tandis que les métriques propres à chaque tâche apportent une lecture plus ciblée des performances.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / MMTEB (communaute embeddings-benchmark)
Capacités mesuréesEvalue la qualite des plongements de texte en allemand sur la classification, le clustering, la classification de paires, le reranking, la recherche et la similarite semantique.
ModalitéTexte
Type de questionsTaches d'embedding de texte (classification, clustering, pair classification, reranking, retrieval, similarite semantique)
Métrique d'évaluationVariable selon la tache (nDCG@10, accuracy, AP, correlation de Spearman) ; score moyen MTEB
AccèsPublic
LicenceApache-2.0 (cadre MTEB) ; licences des jeux de donnees variables
LanguesAllemand
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (96)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert67,0 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert66,8 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert66,1 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert65,1 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert63,1 %9 mars 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert61,6 %9 mars 2026✅ Mesuré
7jinaai/jina-embeddings-v3Jina AI🟢 Ouvert60,0 %18 septembre 2024✅ Mesuré
8intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert58,3 %8 février 2024✅ Mesuré
9codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert57,3 %9 mars 2026✅ Mesuré
10intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert57,1 %8 février 2024✅ Mesuré
11Lajavaness/bilingual-embedding-largeLajavaness🟢 Ouvert56,0 %24 juin 2024✅ Mesuré
12Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert55,7 %4 décembre 2024✅ Mesuré
13codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert55,6 %9 mars 2026✅ Mesuré
14OrdalieTech/Solon-embeddings-large-0.1OrdalieTech🟢 Ouvert55,0 %9 décembre 2023✅ Mesuré
15Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert54,9 %18 novembre 2025✅ Mesuré
16Lajavaness/bilingual-embedding-baseLajavaness🟢 Ouvert54,0 %26 juin 2024✅ Mesuré
17HIT-TMG/KaLM-embedding-multilingual-mini-v1HIT-TMG🟢 Ouvert53,4 %27 août 2024✅ Mesuré
18aari1995/German_Semantic_STS_V2aari1995🟢 Ouvert53,2 %17 novembre 2022✅ Mesuré
19intfloat/multilingual-e5-baseIntfloat🟢 Ouvert53,0 %8 février 2024✅ Mesuré
20Lajavaness/bilingual-embedding-smallLajavaness🟢 Ouvert52,1 %17 juillet 2024✅ Mesuré
21ibm-granite/granite-embedding-278m-multilingualIBM🟢 Ouvert51,8 %18 décembre 2024✅ Mesuré
22intfloat/multilingual-e5-smallIntfloat🟢 Ouvert51,5 %8 février 2024✅ Mesuré
23ibm-granite/granite-embedding-107m-multilingualIBM🟢 Ouvert50,2 %18 décembre 2024✅ Mesuré
24sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert48,6 %1 novembre 2019✅ Mesuré
25Omartificial-Intelligence-Space/Arabic-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert48,3 %14 juin 2024✅ Mesuré
26Omartificial-Intelligence-Space/Arabic-labse-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert47,2 %16 juin 2024✅ Mesuré
27manu/sentence_croissant_alpha_v0.2manu🟢 Ouvert46,8 %15 mars 2024✅ Mesuré
28sentence-transformers/LaBSESentence Transformers🟢 Ouvert46,5 %1 novembre 2019✅ Mesuré
29Gameselo/STS-multilingual-mpnet-base-v2Gameselo🟢 Ouvert45,8 %7 juin 2024✅ Mesuré
30Intfloat: E5-Large-v2Intfloat🟢 Ouvert45,7 %18 novembre 2025✅ Mesuré
31sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert45,5 %1 novembre 2019✅ Mesuré
32Omartificial-Intelligence-Space/Arabic-MiniLM-L12-v2-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert44,8 %25 juin 2024✅ Mesuré
33WhereIsAI/UAE-Large-V1WhereIsAI🟢 Ouvert43,9 %4 décembre 2023✅ Mesuré
34mixedbread-ai/mxbai-embed-large-v1Mixedbread AI🟢 Ouvert43,7 %7 mars 2024✅ Mesuré
35manu/sentence_croissant_alpha_v0.4manu🟢 Ouvert43,6 %27 avril 2024✅ Mesuré
36intfloat/e5-largeIntfloat🟢 Ouvert43,3 %26 décembre 2022✅ Mesuré
37Thenlper: GTE-LargeAlibaba🟢 Ouvert43,1 %18 novembre 2025✅ Mesuré
38BAAI: bge-large-en-v1.5BAAI🟢 Ouvert43,0 %18 novembre 2025✅ Mesuré
39shibing624/text2vec-base-multilingualshibing624🟢 Ouvert42,9 %22 juin 2023✅ Mesuré
40nomic-ai/nomic-embed-text-v1-unsupervisedNomic AI🟢 Ouvert42,9 %15 janvier 2024✅ Mesuré
41sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert42,7 %15 janvier 2025✅ Mesuré
42avsolatorio/GIST-large-Embedding-v0avsolatorio🟢 Ouvert42,6 %14 février 2024✅ Mesuré
43Intfloat: E5-Base-v2Intfloat🟢 Ouvert42,4 %18 novembre 2025✅ Mesuré
44sdadas/mmlw-e5-largesdadas🟢 Ouvert42,4 %17 novembre 2023✅ Mesuré
45Snowflake/snowflake-arctic-embed-lSnowflake🟢 Ouvert41,2 %12 avril 2024✅ Mesuré
46intfloat/e5-baseIntfloat🟢 Ouvert41,0 %26 décembre 2022✅ Mesuré
47Thenlper: GTE-BaseAlibaba🟢 Ouvert40,9 %18 novembre 2025✅ Mesuré
48dwzhu/e5-base-4kdwzhu🟢 Ouvert40,8 %28 mars 2024✅ Mesuré
49sdadas/mmlw-roberta-largesdadas🟢 Ouvert40,5 %17 novembre 2023✅ Mesuré
50BAAI: bge-base-en-v1.5BAAI🟢 Ouvert40,5 %18 novembre 2025✅ Mesuré
51avsolatorio/GIST-Embedding-v0avsolatorio🟢 Ouvert40,4 %31 janvier 2024✅ Mesuré
52intfloat/e5-small-v2Intfloat🟢 Ouvert40,3 %8 février 2024✅ Mesuré
53ibm-granite/granite-embedding-125m-englishIBM🟢 Ouvert40,2 %18 décembre 2024✅ Mesuré
54thenlper/gte-smallAlibaba🟢 Ouvert40,1 %27 juillet 2023✅ Mesuré
55Mihaiii/IvysaurMihaiii🟢 Ouvert40,0 %27 avril 2024✅ Mesuré
56Snowflake/snowflake-arctic-embed-sSnowflake🟢 Ouvert39,7 %12 avril 2024✅ Mesuré
57intfloat/e5-smallIntfloat🟢 Ouvert39,5 %8 février 2024✅ Mesuré
58BAAI/bge-small-en-v1.5BAAI🟢 Ouvert39,4 %12 septembre 2023✅ Mesuré
59abhinand/MedEmbed-small-v0.1abhinand🟢 Ouvert39,0 %20 octobre 2024✅ Mesuré
60Sentence Transformers: all-mpnet-base-v2Sentence Transformers🟢 Ouvert39,0 %17 novembre 2025✅ Mesuré
61avsolatorio/GIST-small-Embedding-v0avsolatorio🟢 Ouvert38,7 %3 février 2024✅ Mesuré
62sdadas/mmlw-e5-basesdadas🟢 Ouvert38,4 %17 novembre 2023✅ Mesuré
63avsolatorio/GIST-all-MiniLM-L6-v2avsolatorio🟢 Ouvert38,4 %3 février 2024✅ Mesuré
64sdadas/mmlw-roberta-basesdadas🟢 Ouvert37,7 %17 novembre 2023✅ Mesuré
65Snowflake/snowflake-arctic-embed-mSnowflake🟢 Ouvert37,3 %12 avril 2024✅ Mesuré
66Sentence Transformers: all-MiniLM-L12-v2Sentence Transformers🟢 Ouvert37,1 %18 novembre 2025✅ Mesuré
67ibm-granite/granite-embedding-30m-englishIBM🟢 Ouvert37,1 %18 décembre 2024✅ Mesuré
68Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert36,7 %17 novembre 2025✅ Mesuré
69Mihaiii/BulbasaurMihaiii🟢 Ouvert36,7 %27 avril 2024✅ Mesuré
70Mihaiii/gte-micro-v4Mihaiii🟢 Ouvert36,4 %22 avril 2024✅ Mesuré
71Mihaiii/VenusaurMihaiii🟢 Ouvert36,4 %29 avril 2024✅ Mesuré
72sergeyzh/LaBSE-ru-turbosergeyzh🟢 Ouvert36,0 %27 juin 2024✅ Mesuré
73sdadas/mmlw-e5-smallsdadas🟢 Ouvert35,6 %17 novembre 2023✅ Mesuré
74Snowflake/snowflake-arctic-embed-xsSnowflake🟢 Ouvert35,5 %8 juillet 2024✅ Mesuré
75Snowflake/snowflake-arctic-embed-m-v1.5Snowflake🟢 Ouvert35,5 %8 juillet 2024✅ Mesuré
76Mihaiii/WartortleMihaiii🟢 Ouvert35,3 %30 avril 2024✅ Mesuré
77cointegrated/LaBSE-en-rucointegrated🟢 Ouvert34,7 %10 juin 2021✅ Mesuré
78Mihaiii/SquirtleMihaiii🟢 Ouvert34,3 %30 avril 2024✅ Mesuré
79ai-forever/ru-en-RoSBERTaai-forever🟢 Ouvert32,0 %29 juillet 2024✅ Mesuré
80deepvk/USER-basedeepvk🟢 Ouvert31,3 %10 juin 2024✅ Mesuré
81Mihaiii/gte-microMihaiii🟢 Ouvert30,9 %21 avril 2024✅ Mesuré
82consciousAI/cai-lunaris-text-embeddingsconsciousAI🟢 Ouvert28,5 %22 juin 2023✅ Mesuré
83cointegrated/rubert-tinycointegrated🟢 Ouvert27,1 %24 mai 2021✅ Mesuré
84DeepPavlov/rubert-base-cased-sentenceDeepPavlov🟢 Ouvert26,3 %4 mars 2020✅ Mesuré
85sergeyzh/rubert-tiny-turbosergeyzh🟢 Ouvert26,2 %21 juin 2024✅ Mesuré
86Omartificial-Intelligence-Space/Arabic-mpnet-base-all-nli-tripletOmartificial-Intelligence-Space🟢 Ouvert26,0 %15 juin 2024✅ Mesuré
87silma-ai/silma-embeddding-matryoshka-v0.1silma-ai🟢 Ouvert25,7 %12 octobre 2024✅ Mesuré
88Omartificial-Intelligence-Space/Arabert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert25,3 %16 juin 2024✅ Mesuré
89DeepPavlov/rubert-base-casedDeepPavlov🟢 Ouvert24,9 %4 mars 2020✅ Mesuré
90DeepPavlov/distilrubert-small-cased-conversationalDeepPavlov🟢 Ouvert24,7 %28 juin 2022✅ Mesuré
91cointegrated/rubert-tiny2cointegrated🟢 Ouvert24,4 %28 octobre 2021✅ Mesuré
92malenia1/ternary-weight-embeddingmalenia1🟢 Ouvert23,7 %23 octobre 2024✅ Mesuré
93Omartificial-Intelligence-Space/Marbert-all-nli-triplet-MatryoshkaOmartificial-Intelligence-Space🟢 Ouvert23,1 %17 juin 2024✅ Mesuré
94deepvk/deberta-v1-basedeepvk🟢 Ouvert22,2 %7 février 2023✅ Mesuré
95ai-forever/sbert_large_mt_nlu_ruai-forever🟢 Ouvert21,8 %18 mai 2021✅ Mesuré
96ai-forever/sbert_large_nlu_ruai-forever🟢 Ouvert20,3 %20 novembre 2020✅ Mesuré

Classement établi sur 96 modèles évalués. Score médian de l'ensemble : 40,7 %.

Notre analyse

Un score élevé indique qu’un modèle obtient de bons résultats agrégés sur plusieurs familles de tâches en allemand. Son interprétation doit toutefois tenir compte de métriques différentes selon les épreuves, parmi lesquelles nDCG@10, accuracy, AP et corrélation de Spearman. Le score moyen facilite le classement global, mais résume donc des capacités distinctes. La fiabilité appelle aussi à la prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que tous mesurés dans un protocole indépendant.

Parmi les 96 modèles évalués dans la base, l’écart entre le score médian de 41 % et les 67 % de codefuse-ai/F2LLM-v2-14B montre une différenciation nette des performances. Le classement ne paraît donc pas uniformément saturé au niveau atteint par son meilleur modèle. Sa portée reste circonscrite à la qualité des embeddings de texte en allemand et aux tâches couvertes. Il ne constitue pas une mesure générale de toutes les capacités d’un modèle. Les résultats auto-déclarés imposent enfin une lecture prudente des comparaisons, notamment lorsque de faibles écarts séparent plusieurs modèles.


Sources des scores : mteb.