L’article ne peut pas être activé avec JavaScript. Vous pouvez également activer JavaScript dans votre navigateur et sur la nouvelle page.
L’équipe Qwen d’Alibaba a publié Qwen-Image-2.1 le 20 septembre, un générateur d’images avec 7 milliards de paramètres dans son composant de génération visuelle qui écrit des PNG transparents directement à partir du modèle. Il donne à toute personne coupant des panneaux d’interface utilisateur, des autocollants ou des décalcomanies pour un projet VR ou AR un canal alpha utilisable sans passe de suppression d’arrière-plan distincte, et les poids sont téléchargeables gratuitement, mais la licence couvre uniquement la recherche et l’évaluation.
Le projet README l’appelle « un modèle unifié de génération de texte en image et d’édition d’images », de sorte qu’un seul point de contrôle gère les deux tâches. Les poids sont sur Hugging Face et ModelScope, et les diffuseurs, ComfyUI, vLLM-Omni, SGLang et LightX2V ont tous ajouté une prise en charge le jour de la sortie.
Qu’y a-t-il à l’intérieur du modèle
Le générateur est un DiT à flux unique à 32 couches avec attention causale par bloc, associé à Qwen3-VL 8B comme encodeur de texte, qui prend à la fois l’instruction écrite et toutes les images d’entrée. La transparence vient du VAE : un auto-encodeur RGBA à 64 canaux avec une compression spatiale 16x.
La sortie est en 2K natif. Les valeurs par défaut sont 2 048 x 2 048 à 40 étapes de débruitage, avec 2 752 x 1 536 proposées pour le 16:9 et des tailles correspondantes pour les autres ratios.
Qwen ne publie aucun chiffre VRAM pour tout cela. La seule concession du README aux cartes plus petites est une ligne de code qui décharge des parties du modèle dans la mémoire système. Considérez donc toute affirmation selon laquelle elle correspond à un GPU grand public particulier comme non testée jusqu’à ce que quelqu’un la mesure.
L’édition accepte jusqu’à 10 images de référence
Le côté édition prend jusqu’à 10 images de référence pour une composition multi-sujets, et des modifications locales peuvent être ciblées en traçant un cercle sur l’image, en peignant une annotation ou en fournissant un masque. Qwen affirme que le modèle retire également des sujets des photographies et maintient l’identité des personnes et des produits à travers les modifications.
La génération transparente nécessite un format d’invite spécifique indiquant au modèle que l’image a un canal alpha et un arrière-plan transparent. Deux points de contrôle de réécriture d’invite distincts, tous deux affinés à partir de Qwen3.5-VL 9B, développent les invites courtes dans les descriptions longues préférées du modèle, un pour la conversion texte-image et un pour l’édition.
Les poids ouverts signifient ici téléchargeables, mais sans restriction
Le contrat de licence de Qwen Research accorde des droits « À DES FINS NON COMMERCIALES UNIQUEMENT » et définit le terme non commercial comme « à des fins de recherche ou d’évaluation uniquement ». L’utilisation commerciale nécessite une licence distincte de la société, demandée par e-mail, et Hugging Face répertorie le modèle sous la licence qwen-research plutôt que sous Apache ou MIT.
Deux autres conditions sont importantes pour quiconque construit dessus. Un modèle formé ou affiné sur les matériaux Qwen doit porter « Construit avec Qwen » ou « Amélioré à l’aide de Qwen » dans sa documentation, et « Qwen » ne peut pas être le nom principal d’un produit dérivé.
Alibaba propose ici deux pistes. Qwen3.8-Omni-Flash, le modèle audio sorti deux jours plus tôt, garde ses poids fermés et vend l’accès via l’API d’Alibaba. Qwen-Image-2.1 remet les fichiers et met à la place la restriction dans la licence. Pour le travail XR, la comparaison la plus proche est l’outil de texture générative Meta intégré à son Horizon Desktop Editor, qui reste à l’intérieur de la plate-forme Meta. Qwen fonctionne sur le matériel que vous possédez.
Les poids, le code et le texte de la licence sont tous publics. Le téléchargement est gratuit ; l’utiliser pour fabriquer tout ce que vous vendez ne l’est pas.