Gemini 4 Argon élève la limite de sortie de Google à 1 million de jetons, mais seuls les cyberdéfenseurs l’ont

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

Google a annoncé un nouveau modèle frontière, Gemini 4 Argon, le 30 septembre, et les premières personnes à l’obtenir ne sont ni des développeurs ni des abonnés. Google affirme qu’Argon est déployé auprès de « un ensemble de cyber-défenseurs de confiance » via son programme Fairwind existant, et que la limite de jetons de sortie du modèle s’élève à 1 million de jetons, contre 64 000 auparavant.

Le chiffre 1M est un plafond de sortie, pas une fenêtre de contexte d’entrée, et Google ne publie aucune longueur de contexte pour Argon. Il définit la marge supplémentaire comme une marge permettant au modèle de « générer des centaines de milliers de jetons en une seule trajectoire ».

Les prix de 2$ et 10$ sont des prix de lancement

Google indique qu’Argon « sera lancé à un prix de lancement de 2 $ par million de jetons d’entrée et de 10 $ par million de jetons de sortie, avec des jetons d’entrée en cache à 95 % de réduction sur le prix des jetons d’entrée ». Il s’agit de prix de lancement plutôt que de prix permanents : Google fixe le tarif post-introduction à 4 $ pour 1 million de jetons d’entrée et à 20 $ pour 1 million de jetons de sortie, et ne donne aucune date pour la fin de la période d’introduction.

Pour des raisons d’échelle, le GPT-6.1 Sol d’OpenAI fonctionne aux mêmes tarifs de 2 et 10 dollars par million de jetons. Argon commence au niveau de celui-ci, puis double, et personne en dehors des testeurs choisis par Google ne peut encore payer l’un ou l’autre prix Argon.

Quatre scores de référence, tous propres à Google

Google donne quatre chiffres pour Argon. Il « établit un nouvel état de l’art » sur DeepSWE v1.1, qui mesure l’ingénierie logicielle à long terme, avec 77,9 % ; il « se classe n°1 avec un score de 51,3 % » sur AutomationBench, le test de Zapier sur l’exécution de bout en bout des fonctions métier ; et il est « à la pointe de la technologie avec un score de 91,7 % » sur LVBench, qui mesure la compréhension des vidéos longues.

Sur le banc CWE v1, qui évalue un modèle de correction des vulnérabilités de sécurité, Argon est à égalité en première place avec 68 %. Le classement de Google place Grok 4,7 et GPT-6 Astra sur ce même 68 %, avec Claude Opus 5,5 un point derrière.

Google ne mentionne aucune réflexion ou effort pour aucun des quatre scores, et aucun d’entre eux n’a été reproduit en dehors de l’entreprise. Quatre benchmarks sont également quatre benchmarks, et non un verdict sur ce que le modèle peut faire.

Les défenseurs obtiennent Argon sans ses cyber-garde-corps

Google affirme qu’Argon peut trouver, valider et corriger de manière autonome les vulnérabilités logicielles critiques, et que « pour les défenseurs de confiance et nos propres équipes internes chez Google, nous publierons Argon sans cyber-garde-fous ». Le fournisseur de sécurité Wiz l’utilise dans le cadre de son initiative Scan for Good, dans le cadre de laquelle Google affirme que le modèle « a découvert une vulnérabilité critique exposant des informations personnelles sensibles dans les logiciels de santé utilisés par les hôpitaux du monde entier ».

Google ne nomme pas le logiciel concerné et ne lui donne aucun numéro CVE. La société a publié les résultats d’un précédent exercice de sécurité Gemini contre trois sociétés réelles, de sorte que le cadre défensif ici est une continuation plutôt qu’une nouvelle direction.

Tout le monde attend. Google affirme qu’il publiera Argon « aux développeurs, aux entreprises et aux consommateurs, en commençant par les clients API payants et les abonnés Google AI Ultra », ne donne aucune date pour cela et affirme être « activement engagé dans le processus volontaire du gouvernement américain pour l’accès aux modèles en pré-version » tandis que l’accès s’étend.

Entre-temps, Argon fonctionne au sein de Google, où la société affirme qu’une équipe de ses agents a trouvé des optimisations de mémoire qui libéreront plus de 300 TiB dans ses centres de données une fois déployées, et une réécriture Rust du décodeur vidéo libgav1 est sortie 2,7 fois plus rapide que le port existant avec une sortie identique. Pour l’instant, les seules personnes capables de tester tout cela sont les défenseurs choisis par Google.