Gemini 2.0 Flash Experimental

Gemini 2.0 Flash Experimental est déjà un modèle ancien à l’échelle de l’IA. Google a lancé ce LLM expérimental le 21 janvier 2025, il y a environ un an. Il appartient à une génération aujourd’hui largement dépassée et souvent retirée du catalogue de l’éditeur.

Gemini 2.0 Flash Experimental est déjà un modèle ancien à l’échelle de l’IA. Google a lancé ce LLM expérimental le 21 janvier 2025, il y a environ un an. Il appartient à une génération aujourd’hui largement dépassée et souvent retirée du catalogue de l’éditeur.

Le modèle se distinguait à sa sortie par son positionnement élevé en raisonnement scientifique et par une fenêtre de contexte de 1 048 576 tokens. Ses connaissances s’arrêtent au 31 août 2024. Cette combinaison en faisait alors un modèle notable pour l’analyse de longs contenus et les questions scientifiques complexes.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurGoogle
Poids▫ n.d.
Date de sortie21 janvier 2025
Connaissances jusqu'à2024-08-31
Multimodaloui
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: OTIS Mock AIME 2024-202557,8 %29ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond57,1 %38ᵉ / 85epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: OTIS Mock AIME 2024-2025

▶ Gemini 2.0 Flash Experi…58 %

Epoch: GPQA diamond

▶ Gemini 2.0 Flash Experi…57 %

Classements Arena (Elo)

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
204ᵉStable Diffusion 3 Medium930
205ᵉStable Diffusion 3.5 Medium928
206ᵉGemini 2.0 Flash Experimental922
207ᵉLuma Photon Flash918
208ᵉAmazon Titan G1 v2 (Standard)908

Notre analyse

Forces. À sa sortie, Gemini 2.0 Flash Experimental figurait dans le top 9 % des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Ce résultat le plaçait dans le haut du panier parmi les 44 modèles contemporains étudiés. Sa fenêtre de contexte d’environ un million de tokens constituait également un trait marquant pour traiter de grandes quantités de contenu au sein d’une même requête.

Limites et points d’attention. Ses performances sont aujourd’hui largement dépassées. Sur GPQA diamond, il se situe désormais en milieu de tableau. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, il partage la 29e place avec un autre modèle, sur un benchmark plafonné et peu discriminant. Il est aussi en retrait dans l’Arena text-to-image, derrière GPT Image 2 aux deux premières places et Microsoft: MAI-Image-2.5. Le premier est nettement devant. Son intérêt est désormais surtout historique, d’autant que cette version expérimentale n’est souvent plus proposée par Google. Pour un résultat text-to-image plus abouti, on lui préférera GPT Image 2 ou Microsoft: MAI-Image-2.5.


Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.