Google a lancé Gemini 3.7 Flash le 13 août, disponible dans plus de 160 pays dès le premier jour. Il prend jusqu'à un million de tokens d'entrée, retourne 64 000, lit des images, des vidéos, de l'audio et des PDF, et peut appeler des outils et contrôler un ordinateur.
Flash n'a jamais été le modèle que l'on choisit lorsque le problème est difficile. C'est celui que vous utilisez pour trier du texte, compacter des sessions d'agent avant qu'elles ne s'effondrent sous leur propre contexte, et résumer des documents que vous ne voulez pas payer un modèle phare pour lire. Myriad : Quand OpenAI sortira-t-il GPT-6 ? Cliquez pour faire votre prédiction.
Jugé par rapport à ces types de tâches, 3.7 Flash est une véritable amélioration. Jugé par rapport à tout le reste, c'est un modèle compétent qui est surpassé par des logiciels que vous pouvez télécharger gratuitement.
La propre feuille de référence de Google place 3.7 Flash devant Claude Sonnet 5 et GPT-5.6 Terra dans 11 des 18 catégories testées. Les chiffres clés sont de 1 588 Elo sur le tableau de développement web de Code Arena et de 30,4 % sur AutomationBench. Les deux proviennent de la méthodologie de Google, donc considérez l'avance comme une affirmation de l'entreprise plutôt qu'un fait établi.
Nous avons testé le modèle pour voir s'il répond aux affirmations de Google. Voici nos résultats.
Ce test mesure la génération de code en zéro-shot---si un modèle transforme une instruction en logiciel fonctionnel sans exemples à copier et sans possibilité de se corriger. Nous remettons un seul prompt pour un jeu de navigateur et expédions tout ce qui revient, bugs inclus. Pas de suivis, pas de rapports d'erreur, pas de deuxième tentative.
Gemini 3.7 Flash a réussi en 2 minutes et 13 secondes. Le jeu était jouable dès le premier essai, la syntaxe était propre, la logique de collision et de score était correcte, et la qualité visuelle était supérieure à ce que la catégorie de prix suggère.
La comparaison qui compte ici n'est pas un modèle phare. C'est Gemini 3.6 Flash, sorti le 21 juillet, qui n'a pas pu produire de fichier fonctionnel du tout. Son HTML était mal formé, les éléments ne s'affichaient pas, et les prompts de suivi lui demandant de réparer sa propre sortie n'ont abouti à rien.
Nous avons fini par remettre cette épave à DeepSeek, qui a trouvé 11 bugs et expédié 8 corrections pour le rendre jouable. Trois semaines plus tard, la même ligne de produits n'a besoin d'aucun secours, et le résultat est proche de ce que GPT-5.6 Sol a produit dans notre revue de juillet.
Gemini 3.7 Flash remporte cette manche haut la main, et c'est la raison la plus forte de changer. La mise en garde est qu'il exécute des spécifications plutôt que de les inventer, donc un prompt vague vous donne un jeu vague.
Vous pouvez essayer le jeu de Gemini 3.7 Flash ici.
Cette section teste deux choses à la fois : la qualité littéraire et si un modèle peut obéir à une règle structurelle à travers des milliers de mots. Le prompt envoie Jose Lanz de 2150 à l'an 1000 et exige une boucle causale fermée---son intervention doit être ce qui crée le futur qu'il est venu empêcher.
La règle qui décide du test est la dernière clause : Il ne peut pas comprendre ce qu'il a fait jusqu'à ce qu'il soit chez lui.
Gemini 3.7 Flash a généré un résultat décent. Jose tire un canon entropique dans une fissure pyrénéenne, forge accidentellement un obélisque qui asservit l'Iberie du 22ème siècle, et comprend toute la boucle tout en étant encore dans la boue mille ans plus tôt : "C'était la base de la Cinder Spire."
La mécanique de l'intrigue est en fait assez solide. L'histoire mentionne une étoile filante que des moines anciens ont vue et précise que c'était l'éclair de l'arrivée de Jose, et l'arme qu'il a apportée pour effacer l'anomalie est ce qui la forge. Sa dernière ligne---"Elle avait simplement attendu qu'il la complète"---pose le déterminisme demandé par le prompt.
Mais pour ceux qui y sont habitués, l'histoire crie "IA". Presque chaque nom arrive avec deux adjectifs accrochés : "tours hyper-luminescentes", "terre humide et envahie de mousse", "cheveux épais et obsidiens". C'est la texture d'un modèle choisissant le mot suivant le plus probable au lieu d'en choisir un, et cela produit des collisions comme un monolithe "vibrant d'un bourdonnement à basse fréquence".
Nous l'avons comparé à Qwopus3.5-27B-v3, un ajustement communautaire de Qwen3.5-27B qui distille le raisonnement à la Claude Opus et fonctionne sur un seul GPU de consommateur pour rien par requête. Il a respecté la règle que Gemini a brisée.
Jose tue un moine à San Millán de la Cogolla, un véritable monastère de La Rioja qui comptait réellement autour de l'an 1000, et ne comprend ce qu'il a fait qu'après être revenu en 2150 et avoir trouvé son propre ADN dans un codex scellé à la cire.
Qwopus n'est pas entièrement propre non plus. Il a déversé tout son brouillon de planification au-dessus de l'histoire, y compris des fautes de frappe, et sa section finale brise la boucle fermée qu'il a passée huit sections à construire en laissant Jose revenir et corriger les choses.
Mais tout bien considéré, Qwopus l'emporte. Gemini a livré un paquet plus soigné et une fin plus disciplinée, mais il a échoué à la seule instruction sur laquelle le prompt était construit, et un modèle gratuit fonctionnant sur un GPU de jeu a écrit la meilleure histoire.
Ce test mesure le raisonnement associatif---si un modèle peut générer des liens entre des concepts non liés sans avoir à s'expliquer. Le prompt demande une description d'une brindille, utilise cette description pour expliquer l'exploitation des travailleurs et le culte des riches, puis exige que l'argument se dissolve dans une description d'une laitue.
Le signalement est le mode d'échec. Nommer la métaphore la tue.
Gemini la nomme dans la première ligne de son deuxième paragraphe : "C'est la mécanique précise du prolétariat moderne." Tout ce qui précède fonctionnait.
Certaines des images méritent leur place. Le travailleur reçoit "juste assez d'écorce pour rester rigide pendant une autre semaine de production", et les brindilles tombées sont conditionnées à croire qu'avec suffisamment de rigidité, l'une d'elles pourrait devenir un tronc. Le paragraphe contenant le premier de ceux-ci contient également un travailleur "lié à une vaste hiérarchie d'entreprise déséquilibrée".
Pas mal en termes de logique et de structure.
La dissolution est l'effondrement réel. Gemini narre la transition plutôt que de la réaliser---les hiérarchies "s'effondrent, se dissolvant dans la réalité calme et humble du monde organique en dessous"---et ensuite une laitue apparaît simplement, sans lien avec quoi que ce soit auparavant.
GPT-5.6 Sol pourrit la brindille en sol et fait pousser la laitue à partir de celle-ci : "La pluie pénètre dans le grain. Les fibres se desserrent, s'assombrissent." L'argument arrive également enfoui dans l'objet, avec la richesse reformulée comme un langage de vertu où "Le manoir signifie intelligence".
GPT-5.6 Sol gagne largement. Gemini a produit une belle ligne individuelle, mais il a expliqué sa propre métaphore et a ensuite sauté la transition que le prompt testait spécifiquement.
Ce test mesure le raisonnement non mathématique, et spécifiquement si un modèle lit la question devant lui ou fait correspondre un modèle à une version qu'il a mémorisée. Notre prompt de pont donne quatre personnes une torche et des temps de traversée de 1, 2, 5 et 10 minutes, puis demande à quelle vitesse ils peuvent tous traverser.
Le truc est ce que le prompt omet. Il ne dit jamais que seules deux personnes peuvent être sur le pont à la fois, donc la réponse est 10 minutes---tout le monde traverse ensemble au rythme de la personne la plus lente.
Gemini a répondu 17 minutes, exécutant le shuffle de cinq étapes mémorisé de la version manuelle du puzzle. Il a énoncé la contrainte comme un fait sans jamais vérifier si nous l'avions écrite.
GPT-5.6 vs Fable 5 Review: Which One You Pick Depends on These Factors
Son raisonnement visible est pire que sa réponse. La trace soutient que faire traverser ensemble les deux plus lents serait inefficace car quelqu'un devrait ramener la torche---et puis la réponse finale les fait traverser ensemble de toute façon. Elle se contredit à l'intérieur d'une seule réponse et rapporte le résultat avec une confiance totale.
Claude Fable 5 a atterri sur le même mauvais chiffre en juillet. Il a commencé par déclarer ce qu'il supposait, "en supposant la contrainte classique que le pont ne supporte que deux personnes à la fois," ce qui est la différence entre une mauvaise réponse que vous pouvez attraper et une que vous ne pouvez pas.
Personne ne gagne. Fable prend le dessus sur la transparence seule, et la fausse confiance à travers les agents Gemini apparaît ici dans une énigme que vous pouvez vérifier à la main.
Ce test mesure les mathématiques symboliques bien au-delà de l'utilisation des consommateurs, plus quelque chose de plus simple---si le modèle fait ce qu'on lui demande. L'invite exige un polynôme monique impair de degré 19 avec des coefficients réels et un coefficient linéaire de -19, dont la courbe se divise en au moins trois composants irréductibles, puis demande p(19).
Les deux modèles ont trouvé la même porte. Gemini et Qwen 3.7 Max Preview ont tous deux identifié le polynôme de Dickson, résolu la contrainte pour fixer son paramètre à 1, et dérivé la forme fermée correctement.
Puis Gemini s'est arrêté. Il a imprimé p(19) comme une expression non évaluée impliquant la 19e puissance d'une racine carrée, n'a jamais produit le nombre, et n'a jamais démontré le nombre de composants que l'invite exigeait également. Il a livré tout cela à l'intérieur d'une page HTML stylée avec CSS et une ombre portée que personne n'a demandée.
Qwen a terminé. Il a donné la factorisation complète en 10 composants---un linéaire, neuf quadratiques---a fait courir la récurrence jusqu'à 1,876,572,071,974,094,803,391,179, et a vérifié le résultat de manière modulaire. Nous avons vérifié ce chiffre indépendamment dans SymPy et il est correct.
Qwen gagne sur le seul critère qui comptait. Gemini a bien commencé et a décidé de sauter l'arithmétique, ce qui est un endroit étrange pour s'arrêter.
Gemini 3.7 Flash vaut le coup si vous êtes déjà dans l'écosystème de Google. Il est dramatiquement meilleur en code que le modèle qu'il remplace, assez rapide pour être pertinent pour le travail d'agent, et suffisamment bon marché pour que son utilisation à grande échelle soit une erreur d'arrondi.
Ses forces sont l'exécution et la structure. Donnez-lui une spécification détaillée et il construira la chose, maintiendra un récit cohérent, et gardera la logique causale cohérente à travers des milliers de mots.
Ses faiblesses sont la créativité et le raisonnement. L'écriture est suffisamment prévisible pour être identifiée comme faite par une machine au premier coup d'œil, et le modèle affirme des réponses incorrectes sans signaler l'hypothèse qui les a rendues incorrectes.
Le prix est l'argument le plus fort en sa faveur. À 75 cents par million de tokens d'entrée et 3,75 $ de sortie, il sous-cote le tarif d'entrée de 5 $ de GPT-5.6 Sol de 85 % et coûte la moitié de ce que 3.6 Flash coûtait au lancement.
L'argument contre lui est un modèle gratuit de 27B sur un GPU de jeu qui a écrit une meilleure histoire et n'a rien facturé pour le faire. Le tarif d'introduction de Google expire le 31 décembre, lorsque l'entrée doublera à 1,50 $ et la sortie à 7,50 $.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























