Scribe v2 Scribe v2 est un modèle de reconnaissance vocale développé par ElevenLabs. Il convertit la parole en texte pour automatiser la production de transcriptions.
Qwen/Qwen3-VL-Embedding-2B Publié par Qwen le 8 janvier 2026 sous licence ouverte Apache 2.0, Qwen/Qwen3-VL-Embedding-2B est un modèle d’embedding multimodal de 2 milliards de paramètres, tous actifs. Fondé sur Qwen3-VL, il projette textes, images, captures d’écran et vidéos dans un espace vectoriel partagé.
Qwen/Qwen3-VL-Embedding-8B Qwen/Qwen3-VL-Embedding-8B est un modèle d’embedding multimodal de Qwen, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres transforment textes, images, captures d’écran, vidéos et combinaisons multimodales en un vecteur dense unique. Sa dimension de sortie est…
nvidia/nemotron-colembed-vl-4b-v2 Publié par NVIDIA le 7 janvier 2026, nvidia/nemotron-colembed-vl-4b-v2 est un modèle d’embedding multimodal de 5 milliards de paramètres actifs. Fondé sur Qwen3-VL-4B-Instruct et un encodeur visuel SigLIP-2, il associe vision et langage afin de représenter des requêtes textuelles et des…
nvidia/nemotron-colembed-vl-8b-v2 Publié par NVIDIA le 7 janvier 2026, nvidia/nemotron-colembed-vl-8b-v2 est un modèle d’embedding multimodal de 9 milliards de paramètres, tous actifs. Construit à partir de Qwen3-VL-8B-Instruct, il associe un encodeur visuel, un module de fusion vision-langage basé sur un MLP et un…
Haon-Chen/e5-omni-3B Haon-Chen/e5-omni-3B est un modèle d’embedding omnimodal publié par Haon-Chen le 6 janvier 2026 sous licence ouverte MIT. Construit sur Qwen2.5-Omni-3B, il compte 5 milliards de paramètres, tous actifs, et produit un vecteur dense unique de 2 048 dimensions, normalisé L2.
Haon-Chen/e5-omni-7B Publié le 6 janvier 2026 par Haon-Chen sous licence ouverte MIT, e5-omni-7B est un modèle d’embedding omni-modal construit sur Qwen2.5-Omni-7B. Ses 9 milliards de paramètres, tous actifs, produisent des vecteurs denses de 3 584 dimensions dans un espace unifié.