L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
Six chercheurs de l’Université Duke ont confié à onze modèles commerciaux de langage de vision la tâche d’évaluer l’apparence correcte du contenu de réalité augmentée, et les meilleurs d’entre eux ont ordonné les scènes presque comme les gens le faisaient, avec une corrélation de rang de Spearman de 0,8695. La version sur arXiv a été publiée le 30 septembre et est une prépublication, bien que son entrée arXiv indique que le travail doit être publié au VRST 2026, le symposium ACM sur les logiciels et technologies de réalité virtuelle qui se déroule à Sendai du 16 au 18 novembre.
Ce chiffre concerne l’accord sur la commande et non l’exactitude. Une corrélation de classement de Spearman demande si deux évaluateurs trient le même ensemble du pire au meilleur dans la même séquence, et 0,8695 indique que le classement du modèle correspond étroitement à celui des humains. Cela ne dit rien quant à savoir si le modèle a jamais correspondu au score réel de quelqu’un.
Emplacement, échelle et ombres, évalués en priorité par les utilisateurs
L’article, rédigé par Elias Rotondo, Lin Duan, Yanming Xiu, Sangjun Eom, Conrad Li et Maria Gorlatova, présente une référence appelée RateAR : des images et des vidéos AR « collectées dans diverses scènes et conditions environnementales », jugées sur le placement des objets, l’échelle et la cohérence des ombres. L’accord humain sur ces jugements est rapporté à un ICC (2,5) de 0,90 ou mieux, que les auteurs qualifient de fiabilité bonne à excellente.
La raison pour laquelle une machine le fait est le coût. Les visiocasques AR « font face à une géométrie de scène contrainte, à une gigue spatiale et à une instabilité temporelle », indique le résumé, et les études d’utilisateurs, le moyen habituel de savoir si une scène semble fausse, ont un « coût, une évolutivité et une rigidité décroissantes » qui « posent des goulots d’étranglement lors de la conception itérative d’applications ». Un modèle qui classe les scènes comme le ferait un panneau de test pourrait rester dans la boucle pendant qu’un développeur est toujours en train de déplacer des objets.
Selon les auteurs, la RA est mise à profit dans les systèmes éducatifs, la prestation de soins de santé et les protocoles d’atténuation des risques. Ce sont les paramètres dans lesquels un objet mal ancré cesse d’être un problème de démonstration et où personne ne veut payer pour un panneau de test à chaque itération.
Ensuite, 21 personnes ont essayé la solution automatique
La seconde moitié du travail construit un système automatisé d’ajustement du contenu AR en plus des évaluations et le soumet à une étude d’utilisateurs menée auprès de 21 participants. « Plus de 90 % des participants ont constaté que le système améliorait le placement et la cohérence de la taille du contenu virtuel », indique le résumé. Il s’agit d’une préférence déclarée de 21 personnes, ce qui n’est pas la même chose qu’une mesure, et les auteurs la rapportent comme telle.
RateAR est la propre référence des auteurs, conçue pour ce travail, et contient des vidéos ainsi que des images fixes. Les notes humaines derrière cela constituent la référence : chaque note de modèle rapportée ici mesure dans quelle mesure la machine a suivi ce que les gens ont dit, ce qui constitue également le plafond de ce que la référence peut dire à n’importe qui.
Une ablation a révélé que les incitations contextuelles de l’équipe s’alignaient mieux sur les évaluations humaines que les autres stratégies d’incitation essayées, « tout en équilibrant les indices de complexité introduits ». Quels onze modèles ont été testés et lequel a atteint 0,8695, le résumé ne le dit pas. Il ne nomme pas non plus le casque ou les lunettes sur lesquels les scènes AR ont été capturées.
Les modèles de langage de vision sont orientés vers ce qu’une caméra voit pour les gens plutôt que pour les développeurs : Google a lancé Guided Vision dans Gemini Live, affirmant qu’il ne remplace pas une canne blanche. L’évaluation de la scène d’un développeur est un travail à moindre enjeu, et une prépublication avec 21 participants derrière son étude utilisateur est là où elle en est actuellement.