codefuse-ai/F2LLM-1.7B
Publié par codefuse-ai le 18 septembre 2025, F2LLM-1.7B est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 2 048 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré avec Sentence…
Publié par codefuse-ai le 18 septembre 2025, F2LLM-1.7B est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 2 048 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré avec Sentence Transformers ou Transformers.
Le modèle sert à indexer et rapprocher sémantiquement des requêtes et des documents, notamment pour la recherche d’information, le RAG, la classification et le clustering. Son affinage repose sur 6 millions de paires requête-document provenant exclusivement de jeux de données open source, sans données synthétiques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | codefuse-ai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 septembre 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: CoREB | 57,5 % | 10ᵉ / 19 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: CoREB
Notre analyse
Forces. F2LLM-1.7B figure dans le top 10 de CoREB sur les tâches spécialisées de recherche et de reranking. L’entraînement couvre également la classification et le clustering, ce qui lui donne un périmètre adapté à plusieurs formes d’organisation et de rapprochement de textes. Les embeddings sont calculés à partir de l’état caché du dernier token, puis normalisés en L2, une propriété utile pour les comparaisons de similarité. L’encodage distinct des requêtes et des documents, associé à une invite dédiée aux requêtes, structure son emploi dans un moteur de recherche. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Sur CoREB, le modèle occupe la dixième place sur dix-neuf, derrière neuf concurrents, ce qui le situe au seuil du top 10 plutôt que parmi les leaders. Chaque vecteur comporte 2 048 composantes, avec un impact direct sur la taille des index, la mémoire mobilisée et le coût des calculs de similarité. Les 2 milliards de paramètres actifs pèsent aussi sur les ressources nécessaires à l’encodage. Enfin, la séparation entre requêtes et documents impose de respecter l’invite et le mode d’encodage associés. Usages pertinents : recherche sémantique, RAG, classification de textes et clustering avec déploiement maîtrisé sous licence ouverte.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).