پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه Qwen-Image-2.0 مراحل استنتاج را از ۴۰ به ۴ گام کاهش داد؟

·۲۶ اردیبهشت ۱۴۰۵۳ دقیقه مطالعه
چگونه Qwen-Image-2.0 مراحل استنتاج را از ۴۰ به ۴ گام کاهش داد؟
اشتراک‌گذاری

تصور کنید کیفیت بصری یک تصویر پیچیده را نه در ۴۰ مرحله، بلکه تنها در ۴ گام استنتاج (Inference) به دست آورید. اگر به دنبال کاهش هزینه‌های محاسباتی بدون افت کیفیت هستید، باید بدانید که علی‌بابا (Alibaba) همین حالا این معادله را حل کرده است.

صنعت تولید تصویر با چالشی همیشگی روبروست: توازن میان فشرده‌سازی داده‌ها و حفظ جزئیات. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های انتشار (Diffusion Models) دیدیم، افزایش سرعت معمولاً به قیمت افت کیفیت تمام می‌شود. این تلاش برای بهینه‌سازی کیفیت در عین کاهش پیچیدگی، یادآور رویکردهای مشابه در بهبود معیارهای بصری است؛ همان‌طور که در بررسی سازوکار DRoRAE و کاهش rFID در ImageNet مشاهده کردیم، تلفیق لایه‌ها می‌تواند تأثیر چشمگیری بر دقت بازسازی تصاویر داشته باشد. اما Qwen-Image-2.0 با یک چرخش فنی، این محدودیت را به چالش کشیده است.

به نقل از گزارش فنی این شرکت، مدل جدید از فشرده‌سازی فضایی ۱۶ برابری استفاده می‌کند؛ در حالی که مدل‌های متن‌بازی مانند FLUX.1-dev از فشرده‌سازی ۸ برابری بهره می‌برند. برای جلوگیری از تخریب جزئیات، تیم توسعه از اتصالات میان‌بر (Skip Connections) در کمپرسور استفاده کرده است تا ساختارهای معنایی تصویر حفظ شوند.

Collage of roughly 20 photorealistic sample images from Qwen-Image-2.0: portraits across ethnicities, animal shots including a tiger, bee, and horse eye, a GTA-VI-style game scene with subtitles, a woman with goldfish in front of her face, and Mediterranean landscapes.

جزئیات فنی معماری این مدل شامل موارد زیر است:

  • بهینه‌سازی VAE: حذف کامل تشخیص‌دهنده (Discriminator) برای افزایش پایداری در مقیاس بالا.
  • پایداری ترنسفورمر: جایگزینی بلوک‌های پیش‌رو با SwiGLU برای جلوگیری از اشباع نورونی و فعال‌سازی‌های عظیم.
  • شرطی‌سازی: ترکیب مدل چندوجهی Qwen3-VL به عنوان رمزگذار شرطی با یک ترنسفورمر انتشار چندوجهی.

Architecture diagram of Qwen-Image-2.0: the frozen Qwen3-VL processes system prompt, input image, and user prompt; a VAE encoder encodes image and target information; both representations feed into a stacked MMDiT with L Qwen-Image-2.0 blocks; the diffusion branch with noise addition and projection layer is shown on the right.

برای پر کردن شکاف میان ورودی‌های مبهم کاربر و خروجی‌های پیچیده، علی‌بابا یک ماژول بالادستی بر پایه Qwen3.5-9B طراحی کرده است. طبق مستندات، این ماژول با روش «مهندسی معکوس» آموزش دیده است؛ به این معنا که توصیفات غنی را گرفته و به‌صورت سیستماتیک جزئیات را حذف کرده تا جفت‌های مصنوعی از پرامپت‌های کوتاه و بلند بسازد. این سازوکار اجازه می‌دهد مدل ورودی‌های تا ۱,۰۰۰ توکن را پردازش کرده و خروجی‌های متنی متراکم مانند اینفوگرافیک‌ها و کمیک‌ها را تولید کند.

Bar chart showing ELO scores across eight categories (Product, 3D Modeling, Cartoon, Photorealism, Art, Portraits, Text Rendering, Overall); Qwen-Image-2.0 (purple) leads Qwen-Image-2512 (green) and Qwen-Image (gray) in all eight, with the largest gap in Portraits (1213 vs. 1155).

از منظر فنی، این عرضه این فرض را می‌شکند که فشرده‌سازی تهاجمی VAE لزوماً کیفیت را نابود می‌کند. استفاده از یک خط لوله داده خود-اصلاح‌گر که خطاها را به‌طور خودکار به دسته‌های RL، دانش یا خطای ماژول پرامپت تقسیم می‌کند، نشان‌دهنده گذار به سمت رژیم‌های آموزشی بسته و خودکار است. در بنچمارک داخلی LMArena، این مدل بیشترین برتری خود را در تولید پرتره‌ها نشان داده است.

Screenshot of the LMArena text-to-image leaderboard from April 22, 2026; gpt-image-2 (medium) leads with 1507 ELO, followed by gemini-3.1-flash-image-preview (1271), gpt-image-1.5-high-fidelity (1242), and gemini-3-pro-image-preview (1232); qwen-image-2.0-pro-2026-04-22 sits at rank 9 with 1168 points and 5,122 votes.

تا ۲۲ آوریل ۲۰۲۶، نسخه Pro این مدل در رتبه نهم جدول LMArena قرار دارد و تنها با سیستم‌های بسته OpenAI و گوگل فاصله دارد. اگرچه هنوز وزن‌های باز (Open Weights) منتشر نشده‌اند، اما جامعه متن‌باز منتظر انتشار احتمالی تحت لایسنس Apache 2.0 است.

گام بعدی شما

  • رصد انتشار وزن‌های مدل برای تست محلی روی سخت‌افزارهای محدود.
  • بررسی قابلیت‌های تولید اینفوگرافیک با استفاده از پرامپت‌های طولانی (تا ۱,۰۰۰ توکن).
  • مقایسه کیفیت پرتره‌های Qwen-Image-2.0 با مدل‌های رقیب در LMArena.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

کاهش ۱۰ برابری گام‌های استنتاج، هزینه عملیاتی تولید تصویر را به‌شدت کاهش می‌دهد و تولید محتوای بصری در لحظه (Real-time) را ممکن می‌سازد. این دستاورد با تکیه بر اعتبار گزارش‌های فنی علی‌بابا، استانداردهای جدیدی برای بهره‌وری در مدل‌های انتشار تعریف می‌کند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.