Gemini 1.5 Flash
Gemini 1.5 Flash est un LLM propriétaire de Google, lancé le 1 mai 2024 avec des poids non ouverts. Sa caractéristique la plus marquante reste sa fenêtre de contexte de 1 048 576 tokens, soit environ un million, associée à des connaissances arrêtées au 1er novembre 2023.
Gemini 1.5 Flash est un LLM propriétaire de Google, lancé le 1 mai 2024 avec des poids non ouverts. Sa caractéristique la plus marquante reste sa fenêtre de contexte de 1 048 576 tokens, soit environ un million, associée à des connaissances arrêtées au 1er novembre 2023.
Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA. Son intérêt est donc surtout historique et comparatif : il illustre le niveau atteint par les modèles Google de sa période, avant d’être probablement dépassé par des générations plus récentes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | |
| Poids | 🔒 Propriétaire |
| Date de sortie | 1 mai 2024 |
| Connaissances jusqu'à | 2023-11-01 |
| Multimodal | oui |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| XSTest | 97,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| FLEURS | 90,4 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| HellaSwag | 86,5 % | 9ᵉ / 27 | llm-stats | Auto-déclaré |
| GSM8k | 86,2 % | 33ᵉ / 47 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 85,5 % | 6ᵉ / 20 | llm-stats | Auto-déclaré |
| MGSM | 82,6 % | 17ᵉ / 30 | llm-stats | Auto-déclaré |
| Natural2Code | 79,8 % | 5ᵉ / 8 | llm-stats | Auto-déclaré |
| MMLU | 78,9 % | 66ᵉ / 98 | llm-stats | Auto-déclaré |
| MATH | 77,9 % | 22ᵉ / 70 | llm-stats | Auto-déclaré |
| Video-MME | 76,1 % | 11ᵉ / 17 | llm-stats | Auto-déclaré |
| HumanEval | 74,3 % | 50ᵉ / 65 | llm-stats | Auto-déclaré |
| WMT23 | 74,1 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| MRCR | 71,9 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| MMLU-Pro | 67,3 % | 89ᵉ / 125 | llm-stats | Auto-déclaré |
| MathVista | 65,8 % | 22ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 62,3 % | 40ᵉ / 61 | llm-stats | Auto-déclaré |
| GPQA | 51,0 % | 158ᵉ / 219 | llm-stats | Auto-déclaré |
| Vibe-Eval | 48,9 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| HiddenMath | 47,2 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| AMC_2022_23 | 34,8 % | 6ᵉ / 6 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, Gemini 1.5 Flash figurait dans le top 7 % des 28 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ce positionnement le plaçait alors dans le haut du panier sur ce test exigeant. Son résultat de 62 % sur MATH level 5 montre aussi une capacité notable, pour sa période, à traiter des problèmes mathématiques complexes. Sa fenêtre d’environ un million de tokens constituait par ailleurs un trait distinctif majeur. Ces constats reposent sur trois sources de données concordantes.
Limites et points d’attention. Les évaluations plus difficiles révèlent des faiblesses nettes. Gemini 1.5 Flash n’obtient que 16 % sur OTIS Mock AIME 2024-2025, qui mesure des problèmes d’olympiades de mathématiques de niveau lycée. Il atteint 0 % sur les versions publique et privée de FrontierMath, consacrées aux mathématiques de recherche très difficiles, avec un classement proche du bas du tableau sur la version privée. Son rang actuel sur GPQA diamond est également nettement moins favorable que son positionnement initial. Désormais ancien, le modèle est probablement largement dépassé et peut ne plus figurer parmi les offres maintenues par l’éditeur.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0.