Qwen1.5-32B Qwen1.5-32B est un LLM publié par Qwen le 3 avril 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, où les performances et les catalogues évoluent rapidement.
Stable Audio 2.0 Stable Audio 2.0 est un modèle de génération musicale à partir de descriptions textuelles, édité par Stability AI. Il vise la composition assistée de morceaux et de contenus sonores, notamment pour préparer des maquettes, des fonds musicaux ou des jingles.
OpenVoice v2 OpenVoice v2 est un modèle de synthèse vocale publié par OpenVoice le 1er avril 2024. Il transforme du texte en parole et peut reproduire la couleur de ton d’une voix de référence, y compris entre différentes langues sans entraînement préalable.
Salesforce/blip2-opt-6.7b-coco Publié par Salesforce le 31 mars 2024, Salesforce/blip2-opt-6.7b-coco est un modèle multimodal de 8 milliards de paramètres, tous actifs. Son Q-Former produit des embeddings de requête de 768 dimensions reliant les représentations visuelles et textuelles. Il associe un encodeur d’images…
Grok-1.5 Grok-1.5 est un LLM propriétaire lancé par xAI le 28 mars 2024. Ses poids ne sont pas ouverts, ce qui le distingue des modèles librement accessibles et modifiables.
Salesforce/blip2-opt-2.7b Salesforce/blip2-opt-2.7b est un modèle multimodal d’embedding publié par Salesforce le 22 mars 2024 sous licence ouverte MIT. Ses 4 milliards de paramètres, tous actifs, associent un encodeur d’image de type CLIP, un Q-Former de type BERT et OPT-2.7b, les deux premiers composants…
manu/sentence_croissant_alpha_v0.2 Publié par manu le 15 mars 2024, manu/sentence_croissant_alpha_v0.2 est un modèle d’embedding multilingue de 1 milliard de paramètres. Fondé sur LlamaModel et intégré à Sentence-Transformers, il produit des vecteurs denses de 2 048 dimensions à partir de séquences comptant jusqu’à 1 024…