L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
Black Forest Labs, le laboratoire à l’origine des modèles d’image FLUX, a mis au point un modèle de contrôle de robot à poids ouvert 7B qui occupe désormais la première place du classement robotique de Nvidia avec 42,9 %. Cela représente 515 essais sur 1 200 pour FLUX 3 Action, où la meilleure entrée de Nvidia, le 16B Cosmos3-Nano-Policy, est cinquième avec 36,8 %, soit 441 sur 1 200, dans le classement RoboLab-120 de Nvidia, vérifié le 28 septembre.
Le GR00T N1.6 de Nvidia, un modèle vision-langage-action 3B, fait bien pire : 13ème avec 7,2%, soit 87 des 1 200 essais, dans le même classement.
RoboLab-120 est un test de simulation de 120 tâches générées, soumises à une politique qui obtient les images de la caméra, l’état des articulations du robot et une instruction textuelle, chaque instruction étant formulée de trois manières, du vague au spécifique. Le tableau global note 1 200 essais par politique. Selon le rapport technique du laboratoire, Black Forest Labs appelle FLUX 3 Action un modèle d’action mondial, ce qui signifie qu’il prédit les futures images vidéo et les actions du robot ensemble plutôt que les actions seules.
Deux points de contrôle, deux scores différents
Les chiffres doivent être séparés. Le point de contrôle rapide en une seule étape obtient 38,3 % sur RoboLab, que le rapport compare à 36,8 % pour Cosmos 3 Nano, tandis que le point de contrôle plus lent distillé par guidage atteint 42,2 % dans le rapport, et le classement indique sa soumission à 42,9 %.
La vitesse est le terrain pour le rapide. Black Forest Labs rapporte un facteur temps réel 1,34x à 2,28x meilleur dans FP8 que Pi0.5 sur les GPU des stations de travail et des centres de données, et prédit 2,13 secondes de mouvement par passage contre 1,0 seconde pour Pi0.5.
Un cinquième de l’entraînement à l’action provenait du gameplay sur PC
Le mélange de formation est la partie étrange, et c’est là que se manifestent les habitudes d’un laboratoire d’images. Parmi tous les échantillons de la phase d’entraînement intermédiaire axée sur l’action, 19,55 % proviennent d’enregistrements de jeux et 13,54 % de vidéos égocentriques avec annotations de poses manuelles, avec 14,03 % de pinces portables et 15,93 % de téléopération dans 14 modes de réalisation.
Les actions du jeu disposent de leur propre espace d’action à 64 dimensions. Deux dimensions encodent le mouvement de la souris sur les axes x et y, deux encodent les boutons gauche et droit de la souris et les 60 autres encodent les boutons du clavier, indique le rapport.
Une course à l’aveugle sur un vrai bras a complété 28 des 30 tentatives
Le seul résultat matériel est une évaluation tierce que Black Forest Labs rapporte elle-même. Positronic Robotics a appliqué la politique sur un bras Franka dans son propre laboratoire sur dix tâches DROID, trois tentatives chacune, aux côtés de Cosmos3-Nano, DreamZero et Pi0.5, avec la même fenêtre de 240 secondes et le même score pour chaque modèle.
L’opérateur ne savait pas quel modèle conduisait à chaque tentative, et chaque tentative a été filmée. FLUX 3 Action a réalisé 28 de ses 30 tentatives.
La comparaison des coûts dans le rapport est la partie qu’un développeur lira deux fois. GPT-6 Astra, avec un effort de raisonnement maximal, résout chaque tâche dans un benchmark distinct, dit Black Forest Labs, mais chaque succès coûte 13,47 $ et 16 minutes en moyenne, tandis que FLUX 3 Action à lui seul coûte 0,09 $ et moins de deux minutes par succès sur un H200 loué à 3 $ de l’heure. Laisser Astra déléguer à FLUX 3 Action et intervenir uniquement en cas de besoin résout 90 % des épisodes à 8,77 $ par succès.
Rien ici n’est un produit. Les poids sont sur Hugging Face sous la licence FLUX Kommunity, le modèle a été téléchargé le 22 septembre et Black Forest Labs l’a annoncé le 23 septembre en tant que modèle 7B à poids ouverts en première place sur RoboLab. Le laboratoire est direct sur le plafond : à 42,9 %, le modèle échoue dans la plupart des cas de référence, et il écrit qu’« il y a encore des tâches que toutes les politiques, y compris la nôtre, ne parviennent pas à résoudre à elles seules ».
Une place au classement est une place au classement, et celle-ci a été prise par un laboratoire qui fait des photos.