Dix mois après Gemini 3 et l’abandon en cours de route d’un Gemini 3.5 Pro jugé décevant, Google dévoile Gemini 4 Argon. Un nouveau modèle qui revendique le sommet des classements en codage et en cyberdéfense d’après le géant du Web.
Introduction
Google vient enfin d’officialiser Gemini 4 Argon. Il s’agit du premier modèle phare d’intelligence artificielle de la firme depuis Gemini 3, sorti en novembre dernier, et l’annonce intervient après un épisode douloureux. Rappelons que Google avait présenté dans un premier temps un Gemini 3.5 Pro en mai 2026, avant d’annuler purement et simplement le modèle face à des résultats décevants. Autant vous dire que cette nouvelle génération était attendue au tournant, d’autant que Koray Kavukcuoglu, qui pilote Google DeepMind au quotidien, avait affirmé la semaine précédente vouloir sortir Gemini 4 bien avant la fin de l’année.
Sundar Pichai, le PDG de Google, a lui-même donné le ton. « Beaucoup de discussions circulent sur notre prochain modèle, alors je voulais vous en donner un aperçu au plus tôt. Voici Gemini 4 Argon ! Il affiche des performances de frontière dans les flux de travail complexes, la cyberdéfense et l’ingénierie logicielle. Les équipes l’utilisent massivement chez Google », a-t-il écrit. Kavukcuoglu, de son côté, présente Argon comme la prochaine ère d’intelligence de frontière de l’entreprise. Évidemment, il s’agit là de discours attendus de la part de Google. Mais c’est bien sur ses performances face à une concurrence déchaînée que le nouveau modèle sera attendu.
Des benchmarks flatteurs et une sortie qui passe au million de tokens
Sur le papier, les chiffres avancés par la firme placent Argon devant ladite concurrence. Le modèle obtient ainsi 77,9 % sur DeepSWE v1.1, le benchmark d’ingénierie logicielle, quand GPT-6 Astra plafonne à 74,1 %, Claude Opus 5.5 à 74,2 % et Claude Fable 5.1 à 67,4 %. L’écart se creuse davantage encore sur AutomationBench, où Argon atteint 51,3 % contre 41,4 % pour GPT-6 Astra. En compréhension de vidéos longues, le modèle signe 91,7 % sur LVBench, contre 87,5 % pour son rival d’OpenAI. Sur CWE-bench, dédié à la correction de failles de sécurité, il décroche 68 %, à égalité en tête du classement.

Google revendique au passage la première place du Vals Index, et Vals AI, qui évalue les performances des technologies d’IA, confirme qu’Argon surpasse les modèles d’OpenAI et d’Anthropic en codage, en finance et sur d’autres tâches. Signalons également un bond côté génération. La limite de tokens en sortie passe de 64 000 à un million, là où Claude Opus 5.5 reste cantonné à 128 000 tokens (300 000 via l’API). Google avance aussi des preuves d’usage maison. Des milliers d’employés exploitent déjà Argon en interne, des équipes d’agents ont libéré entre 500 Tio et 1 Pio de mémoire sur les datacenters de l’entreprise, et le modèle aurait optimisé des sous-routines d’informatique quantique en quelques minutes, toujours selon l’éditeur, évidemment.
En interne, l’enthousiasme n’est pas unanime
Mais le tableau n’est pas entièrement idyllique pour autant. The Next Web rapporte en effet que des employés ayant un accès direct au projet, s’exprimant sous couvert d’anonymat, décrivent un modèle brillant sur les tests standardisés, mais moins convaincant en usage réel, avec des difficultés sur certaines tâches de codage. Google conteste cette lecture et juge inexact de dire que Gemini 4 sous-performe dans ce domaine. Un salarié évoque d’ailleurs un large consensus interne sur le fait que le modèle se situe bien à la frontière de l’état de l’art.

Tulsee Doshi, responsable des produits Gemini chez Google DeepMind, décrit pour sa part « un modèle complet, doté de capacités de frontière dans plusieurs domaines ». Sans surprise, la question de la sécurité pèse également sur ce lancement. Cet été, des modèles de Google avaient échappé à un environnement de test et piraté trois entreprises. Argon embarque de fait de nouveaux garde-fous contre les usages malveillants et les comportements non intentionnels, avec des capacités de surveillance et d’arrêt. Google participe par ailleurs au processus volontaire du gouvernement américain de tests des modèles avant leur mise sur le marché.
Les cyberdéfenseurs d’abord, le grand public attendra
Le déploiement se fera par cercles. Argon est d’abord réservé à un groupe restreint de cyberdéfenseurs de confiance via le programme Fairwind. Particularité notable, ces derniers reçoivent une version dépourvue de ses garde-fous cyber, afin d’exploiter les capacités complètes du modèle. La société de sécurité Wiz l’utilise déjà dans le cadre de son initiative Scan for Good, et Argon y a repéré une vulnérabilité critique dans un logiciel de santé déployé dans des hôpitaux du monde entier, une faille que les modèles de pointe précédents avaient manquée. Les clients payants de l’API et les abonnés Google AI Ultra seront les prochains servis, sans calendrier précis à ce stade. Enfin, côté tarifs, l’API est facturée deux dollars par million de tokens en entrée et dix dollars par million de tokens en sortie.