L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
Nvidia a publié Nemotron 3 Diarisation, un modèle ouvert de 100 millions de paramètres qui détermine qui parle quand, et qui gère jusqu’à huit haut-parleurs où le point de contrôle Nvidia par rapport auquel il est mesuré s’arrête à quatre. Dans les premiers résultats Diarisation-Bench de VoiceArena, il s’est classé premier parmi 12 systèmes avec un taux d’erreur de diarisation de 14,72 %, contre 19,3 % pour le système suivant, selon l’article de Nvidia publié à côté du modèle.
La carte modèle de Nvidia donne une date de sortie au 23 septembre et autorise les poids sous la version 1.1 du contrat de licence OpenMDW, pour une utilisation commerciale ou non commerciale. La diarisation étiquette l’heure, pas l’identité : les huit canaux de sortie sont classés selon le moment où chaque voix arrive pour la première fois et les étiquettes sont génériques, de sorte que le modèle peut signaler que l’orateur 1 a parlé entre deux horodatages sans établir qui est l’orateur 1.
Le classement est celui de Nvidia et est provisoire
Les résultats de VoiceArena couvrent 12 systèmes et 17 configurations de système sur 139 conversations en anglais totalisant environ 22 heures, notées avec chevauchement de la parole, détection de l’activité vocale générée par le système et absence de collier de délimitation. Nvidia affirme que le modèle s’est également classé premier avec les colliers de 100 ms et 250 ms, ainsi que pour les enregistrements en personne et en ligne.
Nvidia attache une mise en garde à tout cela : « Ces résultats initiaux peuvent changer à mesure que Voice Arena termine son évaluation de la version 1 et son analyse statistique couplée. »
Les taux d’erreur chutent par rapport au modèle à quatre haut-parleurs de Nvidia
Avec le paramètre hors ligne de 30,4 secondes, Nvidia signale un taux d’erreur de diarisation de 12,73 % sur l’évaluation complète DIHARD III, de 9,10 % sur CALLHOME-Part2, de 6,40 % sur AliMeeting Test Near et de 6,77 % sur NOTSOFAR1 MHM. Le précédent point de contrôle Sortformer en streaming à quatre haut-parleurs, exécuté comme référence avec le même paramètre, obtient des scores de 19,09 %, 10,32 %, 11,57 % et 21,77 % sur ces quatre ensembles dans cet ordre.
Le propre résumé de Nvidia sur l’écart est une réduction d’erreur relative moyenne de 41,0 % avec un paramètre de latence de 1,04 seconde, qu’il décrit comme une moyenne non pondérée des huit réductions par ensemble de données plutôt que comme un score groupé calculé pour chaque enregistrement. Ces réductions vont de 9,0% sur CALLHOME-Part2 à 65,2% sur NOTSOFAR1 MHM.
NOTSOFAR1 MHM est une référence en matière de réunions avec trois à sept intervenants sur un mix de micros casque. Au réglage de 30,4 secondes, l’ancien modèle obtenait le bon nombre de haut-parleurs dans un enregistrement dans 35,00 % du temps, contre 93,75 % pour le nouveau.
Un chiffre va dans l’autre sens et Nvidia l’imprime. Sur le sous-ensemble à deux haut-parleurs de CALLHOME-Part2, avec ce même réglage de 30,4 secondes, le nouveau modèle enregistre 5,98 % contre 5,68 % de la ligne de base, même si le résultat complet de CALLHOME-Part2 s’améliore de 10,32 % à 9,10 %.
La latence est un cadran, et 80 millisecondes n’est pas la fin recommandée
Un seul point de contrôle couvre les latences du tampon d’entrée de 30,4 secondes, 1,04 secondes, 0,64 secondes et 0,32 secondes. Nvidia affirme qu’il prend en charge un tampon « aussi bas que 80 ms pour les applications critiques en matière de latence, bien que la configuration la plus basse recommandée soit de 0,32 s », et que le chiffre ne prend en compte que l’audio mis en mémoire tampon avant l’exécution du modèle, pas le temps de calcul.
La précision abandonne moins que ne le suggèrent les chiffres de latence. L’erreur totale du DIHARD III passe de 12,73 % au réglage de 30,4 secondes à 13,55 % à 0,32 seconde, ce qui est toujours en dessous des 19,85 % de la ligne de base au même 0,32 seconde.
En dessous se trouve un encodeur Transformer à 31 couches avec des intégrations de position rotatives, fonctionnant sur des images de 80 millisecondes, avec un cache de haut-parleur d’ordre d’arrivée et une file d’attente FIFO pour transporter les identités de haut-parleur à travers les morceaux. Il fonctionne via le framework NeMo de Nvidia, nativement dans Hugging Face Transformers, et via un runtime C++, NeMo-Speech.cpp, pour la diarisation sur une machine locale.
Nvidia ne lie le modèle à aucun appareil
Rien de ce qui a été publié par Nvidia ne relie cela à un produit. Les sous-titres en direct sur les lunettes intelligentes transcrivent les mots sans dire à qui ils appartiennent, et c’est exactement dans une conversation de groupe que cela s’effondre. Meta a vendu durement ses capacités audio, de la capture vidéo Dolby Atmos sur ses prochaines lunettes AI à l’amélioration de l’audition vendue via Meta One, et rien de tout cela n’attribue de phrase à une personne.
Nvidia a entraîné le modèle sur environ 10 000 heures de conversations réelles et 82 611 heures de mélanges multi-interlocuteurs simulés, sur huit nœuds de huit GPU A100-SXM4-80GB.
Un autre avertissement appartient aux chiffres. Nvidia a évalué ces résultats par rapport aux annotations de référence publiées avec le modèle et affirme que la modification de ces étiquettes modifie le résultat mesuré.