codefuse-ai/F2LLM-0.6B
Publié par codefuse-ai le 18 septembre 2025, F2LLM-0.6B est un modèle d’embedding dense de 596 millions de paramètres, distribué sous licence ouverte Apache 2.0. Il transforme les textes en vecteurs de 1 024 dimensions, normalisés en L2 à partir de l’état caché du dernier token.
Publié par codefuse-ai le 18 septembre 2025, F2LLM-0.6B est un modèle d’embedding dense de 596 millions de paramètres, distribué sous licence ouverte Apache 2.0. Il transforme les textes en vecteurs de 1 024 dimensions, normalisés en L2 à partir de l’état caché du dernier token.
Son affinage repose sur 6 millions de paires requête-document provenant exclusivement de jeux de données open source, sans données synthétiques. Il distingue l’encodage des requêtes avec instruction de celui des documents. Ses applications couvrent la recherche sémantique, la récupération de passages pour le RAG, la classification et le clustering, avec des intégrations dans Sentence Transformers et Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 septembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 596 millions |
| Paramètres actifs | 596 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: CoREB | 56,2 % | 13ᵉ / 19 | mteb | ✅ Mesuré |
| MTEB: Thai | 54,3 % | 24ᵉ / 28 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: CoREB
MTEB: Thai
Notre analyse
Forces. F2LLM-0.6B réunit dans un même modèle la recherche d’information, la classification et le clustering, trois familles de tâches présentes dans ses données d’affinage. Parmi les deux évaluations MTEB disponibles, son positionnement relatif est plus favorable sur CoREB que sur le track Thai, ce qui indique une meilleure tenue sur les tâches spécialisées de mise en correspondance entre requêtes et contenus. La normalisation L2 facilite le calcul direct de similarités, tandis que l’encodage distinct des requêtes et des documents convient aux architectures de recherche asymétrique. La licence Apache 2.0 autorise une intégration et un déploiement avec peu de restrictions.
Limites et points d’attention. Le classement obtenu sur le track MTEB Thai se situe dans la partie basse des modèles évalués, ce qui invite à valider soigneusement la qualité des embeddings sur des corpus thaïlandais. Le résultat CoREB reste également en retrait par rapport aux premières places de son classement. Des vecteurs denses de 1 024 dimensions augmentent le stockage de l’index et le coût des recherches par rapport à des représentations moins dimensionnées. Usages pertinents : recherche sémantique, récupération documentaire pour le RAG, classification de textes et clustering, après évaluation sur le corpus cible.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).