L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
Eric Provencher, qui travaille sur l’expérience des développeurs pour le Codex d’OpenAI, affirme qu’exécuter plus de deux sous-agents à la fois « brûle presque certainement des jetons pour un gain de qualité nul ». Il a publié cela le 15 septembre, onze jours après que Nous Research a publié le projet de loi pour une campagne qui en a expédié 1 393.
Les deux camps mettent des chiffres sur la table, ce qui est plus rare dans ce débat que les opinions.
La taxe de coordination
L’explication de Provencher est courte : « Les agents ne se font pas suffisamment confiance pour éviter de revérifier les devoirs de chacun. » Pressé le soir même, il a qualifié les frais généraux de taxe de coordination et a déclaré que dans la plupart des cas, il est « très difficile de faire fonctionner autant de voies parallèles, sans tourner en rond et brûler des jetons suite à une vérification excessive ».
Il ne dit pas que le parallélisme ne fonctionne jamais. Il dit que les voies doivent être divisées proprement, et que la plupart des gens ne les divisent pas proprement.
Sa propre solution, publiée le 12 septembre, consiste à demander à un agent de planifier le travail, de le confier à un deuxième thread, puis de terminer son tour, laissant le deuxième thread réveiller le premier lorsqu’il a terminé plutôt que de l’interroger. Il le décrit comme quelque chose qu’il fait selon son plan personnel. Il s’agit du point de vue d’un ingénieur nommé, et non d’une politique OpenAI.
Ce que 1 393 sous-agents ont réellement acheté
Nous Research a mené l’expérience inverse sur sa propre base de code et a publié les chiffres. Dans un article de Teknium, l’équipe indique qu’un nettoyage commencé le 2 septembre a duré environ dix-neuf heures d’activité et « a envoyé 1 393 sous-agents, atteignant 218 exécutés à la fois », avec la fusion des demandes d’extraction le 4 septembre.
La coordination s’est déroulée dans un seul processus Python sur un ordinateur de bureau i7 avec 64 Go de RAM, tandis que Claude Fable 5.1 gérait l’inférence à distance.
Les résultats sont spécifiques. Un fichier, gateway/run.py, est passé de 34 847 lignes à 5 512. Python non testé dans le référentiel a chuté de 34,4 %, passant de 1 063 826 lignes à 698 363. Les fichiers de plus de 5 000 lignes sont passés de 37 à six, et les fonctions de plus de 300 lignes sont passées de 192 à deux.
Nous estime le coût du modèle à environ 19 300 dollars pour l’exécution principale, soit environ 25 000 dollars, sessions de suivi comprises, contre sa propre estimation de 150 000 à 1,8 million de dollars pour une petite équipe effectuant le travail à la main sur deux mois à deux ans. L’article est sous-titré « Comment obtenir 1,8 million de dollars de valeur à partir de 19 000 dollars de jetons ».
Provencher a répondu directement au message
Le 16 septembre, il a répondu publiquement à Teknium : « Vous avez refactorisé un gros fichier Python et dépensé 20 000 $ en jetons dessus. Vous auriez pu le confier à un seul agent Astra et il l’aurait fait pour une fraction du coût. Que faisaient tous ces sous-agents ?
Personne n’a réalisé ce contrefactuel. Il n’existe aucune tentative publiée d’un seul agent sur le même référentiel, aucune mesure indépendante de la qualité de part et d’autre, et une base de code avec un modèle ne constitue pas une référence.
Ce que les deux comptes règlent, c’est la forme de la facture. Nous rapporte ses propres chiffres comme un succès et enregistre toujours six fichiers de plus de 5 000 lignes restés debout, des temps d’importation plus longs pour certains points d’entrée et le couplage du refactor n’a pas été résolu.
La lecture pratique pour quiconque paie par jeton est plus étroite que celle des deux postes. Le parallélisme a un prix qui dépend de la manière dont le travail est divisé, et les seules personnes qui publient ce prix jusqu’à présent sont celles qui l’ont dépensé. L’outillage est en avance sur les preuves, avec Unity qui propose désormais des plugins officiels Codex et Claude Code pour son moteur.