L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
Une équipe de recherche dirigée par le groupe Hunyuan Speech de Tencent a publié Gander, un modèle vocal qui maintient une conversation pendant qu’un agent de codage distinct s’acquitte de la tâche réelle en arrière-plan. Le document, publié sur arXiv le 8 septembre et révisé le 12 septembre, nomme Codex et Claude Code comme agents pouvant occuper cet emplacement en arrière-plan, échangés sans aucune reconversion.
Ce qui compte ici, c’est la conception de l’interaction plutôt que le modèle lui-même. Une paire de lunettes n’a pas d’écran pour remplir un silence, donc un assistant reste silencieux pendant 30 secondes pendant qu’il pense que la forme du matériel n’est pas la bonne, et Gander est une tentative publique et inspectable de la bonne.
Un petit mannequin parle, un grand agent travaille
Gander divise le travail en deux. Le « cervelet » est un modèle 9B construit sur MiniCPM-o 4.5 qui gère la parole, la vision et le texte en direct, coupant le flux entrant en fenêtres fixes d’une seconde. Il prédit un jeton de contrôle par fenêtre, choisissant d’écouter, de parler ou de s’interrompre, c’est ainsi qu’il peut être coupé au milieu d’une phrase, poser une question complémentaire ou déposer un accusé de réception pendant que quelque chose d’autre s’exécute.
Le « cerveau » est un agent ordinaire à usage général qui ne reçoit aucune formation supplémentaire. Dans les versions des auteurs, il s’agit du serveur d’applications Codex piloté par GPT-5.6, et le référentiel de code construit sa couche fournisseur en tant que registre afin qu’un autre agent puisse être branché sans toucher au côté conversationnel. Codex est le seul fournisseur fourni dans le référentiel jusqu’à présent, donc Claude Code est nommé dans le document plutôt que inclus dans le code. Le cervelet décide lui-même à quelles demandes il peut répondre et lesquelles doivent être transmises.
Les numéros à tour de rôle sont la partie la plus forte
Sur Full-Duplex-Bench v3, une suite de 100 scénarios pour assistants vocaux utilisant des outils, Gander prend la parole au moment approprié dans les 100 scénarios, accompagné uniquement d’un Whisper en cascade vers GPT-4o vers un pipeline de synthèse vocale, et commence à parler à l’utilisateur dans 8,0 % des tours. Le journal compare cela à 13,5 % pour GPT-Realtime et à 47,9 % pour le système le plus faible de son tableau, qui gère 96,0 % de tour de rôle en interrompant constamment.
C’est la partie qu’un assistant aux lunettes remarquerait. Couper l’accès à l’utilisateur est l’échec dont les gens se souviennent, et Meta a déclaré que son propre assistant Muse se dirigeait vers ses lunettes, de sorte que la barre des manières de conversation est sur le point d’être placée en public.
La précision est le prix, tout comme la gaufre
Sur le même benchmark, Gander arrive en dernière position pour les quatre mesures de précision des tâches. Son Pass@1 strict, qui nécessite exactement les bons outils avec chaque argument correct, est de 0,400 contre 0,410 pour le pire système suivant et 0,600 pour GPT-Realtime au sommet. La sélection des outils arrive à 0,759 contre 0,794 pour ce même système, la précision des arguments à 0,503 contre 0,513 et la qualité de la réponse à 0,490 contre 0,510 en bas et 0,792 en haut.
Parler a son propre coût. Gander fait précéder 51,6 % de ses tours d’un espace réservé à la conversation, la seule mesure d’interaction à laquelle il ne mène pas, et les auteurs affirment que de brefs remerciements maintiennent la conversation en vie pendant l’exécution d’une tâche déléguée, mais admettent qu’il est possible de supprimer les éléments de remplissage inutiles. Un assistant qui dit « laissez-moi regarder ça » tous les deux tours est un type d’ennui différent de celui qui parle à votre place.
Les auteurs pointent du doigt le chemin de parole et la décision de routage plutôt que l’agent. Lorsqu’ils exécutent le même agent back-end directement à partir d’une transcription textuelle, avec le modèle conversationnel et le canal audio supprimés, Pass@1 s’élève à 0,520 et la qualité de réponse à 0,740, et la sélection d’outils atteint 0,934, soit plus que tout autre système du tableau, y compris le 0,876 de GPT-Realtime. Pass@1 se situe toujours en dessous de GPT-Realtime, et le journal affirme que ses exécutions ne séparent pas les deux effets. Selon les propres chiffres de l’équipe, la conception à deux niveaux coûte actuellement de la précision pour acheter de la réactivité.
Ce qui est réellement publié
Le code est sur GitHub sous Apache 2.0 et les poids des modèles sont sur Hugging Face. Le résumé du document indique que les données sont également publiées, mais le référentiel indique que l’ensemble de données sera bientôt disponible et indique qu’il est toujours en cours de publication open source. Les chiffres de référence sont ceux de l’équipe, exécutés avec les scripts de notation publiés par la suite et le GPT-4o juge les utilisations du protocole de base, et personne en dehors du projet ne les a reproduits.
Gander est aussi un papier, pas un produit. La page du projet et l’article le décrivent comme un projet de recherche universitaire, avec des auteurs de l’équipe Hunyuan Speech de Tencent, de l’Université du Zhejiang, de l’Université Jiao Tong de Shanghai, de l’Université chinoise de Hong Kong et de l’Université technologique de Nanyang. Aucun appareil Tencent n’y est connecté, et rien dans le travail n’indique que tout cela se dirige vers une paire de lunettes. Cela arrive une semaine où Alibaba a réduit ses prix d’entrée audio de 98 %, ce qui est l’autre moitié du même problème : le modèle d’interaction doit être bon et l’audio doit être suffisamment bon marché pour continuer à fonctionner.