ai-forever/FRIDA
ai-forever/FRIDA est un modèle d’embedding dense publié par ai-forever le 29 décembre 2024 sous licence ouverte MIT. Ses 823 millions de paramètres, tous actifs, produisent des vecteurs de 1 536 dimensions. Fondé sur l’encodeur de FRED-T5 et une architecture de débruitage inspirée de T5,…
ai-forever/FRIDA est un modèle d’embedding dense publié par ai-forever le 29 décembre 2024 sous licence ouverte MIT. Ses 823 millions de paramètres, tous actifs, produisent des vecteurs de 1 536 dimensions. Fondé sur l’encodeur de FRED-T5 et une architecture de débruitage inspirée de T5, il accepte jusqu’à 512 tokens.
Pré-entraîné sur des données russes et anglaises, FRIDA est principalement conçu pour le russe. Il transforme les textes en vecteurs destinés à la recherche sémantique, au RAG, à la détection de paraphrases, à la catégorisation et au clustering. Des préfixes permettent d’adapter l’encodage à la tâche.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ai-forever |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 29 décembre 2024 |
| Dimension du vecteur | 1 536 |
| Représentation | dense |
| Paramètres | 823 millions |
| Paramètres actifs | 823 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Russian | 71,0 % | 3ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Russian
Notre analyse
Forces. FRIDA figure parmi les meilleurs modèles évalués par MTEB Russian, avec des résultats solides sur un ensemble couvrant classification, clustering, reranking et comparaison de textes. Cette spécialisation en russe constitue son principal intérêt pour indexer des corpus, rapprocher des passages ou organiser des documents dans cette langue. Le pooling CLS est recommandé, tandis que le pooling mean constitue une autre option. La licence MIT autorise l’auto-hébergement et l’intégration dans des services commerciaux.
Limites et points d’attention. La qualité en anglais reste incertaine malgré le pré-entraînement russe-anglais, ce qui limite la portée multilingue réelle. La séquence maximale de 512 tokens impose de découper les documents longs avant leur indexation. Les vecteurs de 1 536 dimensions alourdissent aussi les index et rendent la recherche plus coûteuse que des représentations plus compactes. Sorti fin 2024 et âgé d’environ deux ans, FRIDA appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période, des solutions plus récentes pouvant l’avoir dépassé. Ses usages pertinents sont la recherche sémantique, le RAG et le clustering sur des corpus principalement russophones.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).