La société vise également à combler l’écart avec Anthropic et OpenAI en matière de cyberdéfense en permettant à Argon de rechercher, valider et corriger de manière autonome les vulnérabilités logicielles critiques. Sur CWE-bench v1, une référence en matière de correction des vulnérabilités, Google rapporte un score de 68 %, à égalité en première position avec Grok 4.7, GPT-6 Astra et Claude Opus 5.5.

Bien que Google ait publié un large éventail de résultats de référence pour étayer ses affirmations, Jain a averti que les scores doivent être traités comme des indices et non comme des preuves. « Argon semble être bon et battre ses rivaux dans l’utilisation d’outils automatisés pour effectuer des tâches en plusieurs étapes sans se tromper, et il s’en tient étroitement aux faits réels. Ses capacités de codage quotidiennes sont fondamentalement moyennes et à égalité avec les autres. Il est toujours à la traîne en matière d’écriture créative, d’explications nuancées et d’exécution de terminaux informatiques en ligne de commande », a-t-il déclaré.

Jain a noté qu’Argon montre que Google a comblé une grande partie de son déficit de capacités, mais qu’il a perdu un peu d’élan et d’esprit de développeur. Elle est désormais compétitive à la frontière, mais pas clairement en avance dans tous les domaines.

A lire également