Gemini 4 Argon se classe cinquième sur 73 sur la référence juridique citée par Google comme leader

L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.

Google affirme que Gemini 4 Argon affiche « des performances similaires » sur le benchmark des agents juridiques de Harvey, l’une des deux évaluations externes citées dans son annonce Gemini 4 Argon du 30 septembre. Le classement public de ce benchmark, géré par Vals, classe Argon cinquième sur 73 modèles à 19,58 %, avec quatre des modèles Muse Spark de Meta au-dessus.

Muse Spark 1.2 est en tête à 25,42 %, suivi de Muse Spark 1.3 Max à 23,75 %, Muse Spark 1.3 à 22,92 % et Muse Spark 1.1 à 20,00 %, selon Vals, dont la page a été mise à jour le 30 septembre, jour de la publication de Google. La propre page du modèle Vals d’Argon donne le même résultat, 19,58 % avec une erreur type de 3,31.

Google a comparé Argon à trois concurrents et les a battus tous les trois

Le document d’évaluation de Google pour Argon indique que les résultats Harvey « proviennent de Vals AI », le même opérateur qui publie le classement, et exécute Argon contre GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5.5. Aucun modèle Meta n’y apparaît.

Contre ces trois-là, Google place Argon à 19,6 % sur l’indice de référence de Harvey, Claude Fable 5,1 à 6,7 %, GPT-6 Astra à 5,4 % et Claude Opus 5,5 à 3,8 %. Vals publie les mêmes trois chiffres rivaux, donc la phrase de Google tient confortablement dans le domaine qu’il a choisi, et les quatre modèles devant Argon au sein du conseil public ne sont pas dans ce domaine.

Argon est en tête de l’autre référence dans la même phrase

L’autre évaluation nommée par Google est Vals Finance Agent v2, et là Argon est premier sur 73 à 65,40 %, devant Gemini 3.8 Flash à 61,44 %.

Le bilan d’Argon sur les autres tableaux de Vals se partage de la même manière. Il est premier sur l’indice Vals à 68,90 % sur 41 modèles et est à égalité au premier rang sur IOI à 100,00 %, deuxième sur Vibe Code Bench à 91,91 % et sur Code Migration à 68,17 %, puis cinquième sur 54 sur ProgramBench à 2,50 % et septième sur huit sur CUA-bench à 4,83 %.

Les courses Harvey n’étaient pas réglées à un niveau d’effort commun

Vals enregistre l’exécution d’Argon’s Harvey avec un effort de raisonnement « élevé », une température de 1,0 et un plafond de sortie de 262 144 jetons. Il enregistre Muse Spark 1.1, 1.2 et 1.3 à « xhigh » et Muse Spark 1.3 Max à « max », de sorte que le classement ne maintient pas ce paramètre constant pour tous les modèles qu’il contient.

Tout sur ce forum obtient un score faible. Vals décrit l’évaluation comme testant « la capacité d’un agent à effectuer un travail juridique à l’aide de documents, de feuilles de calcul, de présentations et d’outils de système de fichiers », et 25,42 % correspond au sommet.

Vals publie également un taux de réussite aux critères, qui compte les exigences individuelles satisfaites plutôt que les tâches terminées, et ceux-ci sont bien plus élevés. Celui d’Argon est de 94,04 %, derrière Muse Spark 1.3 Max à 94,74 % et Muse Spark 1.2 à 94,52 %.

Le travail juridique est un marché que tous les grands laboratoires recherchent. OpenAI a ouvert Astra for Law, qui recherche 230 millions d’URL légales, aux entreprises invitées en septembre.

Argon lui-même n’est destiné qu’à des cyberdéfenseurs de confiance pour l’instant, donc les analyses de Vals et le propre document de Google sont les seuls chiffres dont on dispose.