Lajavaness

Éditeur français de modèles d'embedding bilingues français-anglais pour la recherche sémantique

3 fiches modèlesorties 24 juin 2024 → 17 juillet 20243 à poids ouvertscontexte jusqu'à 514 tokens

Lajavaness est un acteur français de l'IA qui se présente comme accompagnant la transformation des grandes organisations par un déploiement responsable et efficace de l'intelligence artificielle. Son activité la plus visible pour la communauté est la publication de modèles d'embedding bilingues français-anglais, mis à disposition en open source sur Hugging Face avec la bibliothèque sentence-transformers.

Au catalogue figure un modèle de la famille bilingual-embedding, déclinée en plusieurs tailles (small, base, large) reposant selon les versions sur des architectures comme XLM-RoBERTa ou BGE-M3, et incluant des variantes à contexte étendu et une version orientée documents. L'approche se distingue par un ciblage explicite du couple français-anglais et par une stratégie d'entraînement soignée (Augmented SBERT, échantillonnage de paires) visant à enrichir dynamiquement les données.

Ces modèles s'adressent aux applications francophones de recherche sémantique, de clustering de textes et de RAG où la qualité sur le français importe autant que sur l'anglais.