L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
Un modèle à paramètres 4B publié par l’organisation Hugging Face de Google le 4 octobre rapporte une erreur d’étiquetage du locuteur plus faible sur les quatre ensembles de tests de diarisation standard, les améliorations étant marquées comme statistiquement significatives à p < 0,0001. Google est direct sur ce qu'il a publié : "Ce n'est pas un produit Google officiellement pris en charge", indique en gras la carte modèle de DiarizationLM-Gemma-4-E4B-v1, il s'agit donc d'un code et de poids plutôt que d'un lancement de produit.
La diarisation est la partie de la transcription qui décide qui parle. La reconnaissance vocale écrit les mots ; la diarisation attache un locuteur à chacun d’eux, et en cas d’échec, une réunion de quatre personnes revient sous la forme d’un long monologue ou échange deux personnes au milieu d’une phrase.
DiarisationLM ne fait aucun de ces travaux à partir de zéro. Il s’agit d’un cadre qui prend le résultat d’un système de reconnaissance et de diarisation et le corrige ensuite, c’est pourquoi ses résultats sont cités par rapport à une référence plutôt que comme une précision absolue.
Les gains sont importants lors des appels téléphoniques et faibles lors des réunions
La métrique est le taux d’erreur de diarisation des mots, la part des mots transmis au mauvais locuteur. Par rapport à une référence USM et Turn-to-diarize, Google rapporte que le WDER est passé de 5,32 % à 2,99 % sur Fisher English, de 7,74 % à 4,92 % sur Callhome American English, de 14,70 % à 14,10 % sur le corpus des réunions ICSI et de 15,68 % à 14,89 % sur AMI.
Deux d’entre eux valent moins d’un point de pourcentage. Les changements appariés sont de -2,33 et -2,82 points sur les deux corpus téléphoniques et de -0,60 et -0,79 points sur les deux corpus de réunion, et la signification à p < 0,0001 indique que la différence est réelle, et non qu'elle est grande. La répartition du test ICSI est de trois réunions et celle de l'AMI est de 16, ce qui constitue une base mince pour une affirmation sur les réunions en général.
La moitié des paramètres du modèle qu’il améliore
La comparaison sur laquelle Google s’appuie est avec google/DiarisationLM-8b-Fisher-v2, construit sur Llama 3 8B et noté sur la même base de référence. Sur Fisher, le nouveau modèle 4B rapporte 2,99 % de WDER contre 3,28 % du modèle 8B, et sur Callhome 4,92 % contre 6,66 %, « malgré la moitié du nombre de paramètres (4B contre 8B) ». Aucun chiffre 8B n’est publié pour l’ICSI ou l’AMI, la comparaison de taille couvre donc uniquement la parole téléphonique.
Google attribue la recette de formation plutôt que le modèle de base, nommant Locality-Preserving Oracle Supervision, qu’il décrit comme enseignant au modèle à corriger les limites de virage et les canaux de retour courts tout en maintenant l’identité du locuteur stable au cours de longs monologues. La formation s’est déroulée sur 10 000 étapes avec un adaptateur LoRA au rang 256 sur huit puces Google Cloud TPU v5p.
Apache 2.0, et aucun téléchargement n’a encore été enregistré
La licence est Apache 2.0. Les poids fusionnés de 16 bits s’élèvent à environ 16,0 Go, et deux versions GGUF 4 bits d’environ 5,30 Go et 5,15 Go sont publiées pour lama.cpp et Ollama. À 00h00 UTC le 5 octobre, l’API Hugging Face n’a signalé aucun téléchargement et neuf likes pour le référentiel.
Aucun chiffre de latence n’est publié, ni aucune mesure sur l’appareil, donc rien ici ne dit ce qu’il ferait sur un téléphone ou dans une paire de lunettes. À des fins de comparaison sur la même tâche dans une direction différente, Nvidia a publié le 28 septembre un modèle de diarisation de 100 millions de paramètres qui effectue l’étiquetage lui-même au lieu de corriger celui de quelqu’un d’autre. L’article DiarizationLM sous-jacent date d’Interspeech 2024, le cadre est donc plus ancien que les pondérations.