پرش به محتوای اصلی
پرش به محتوای مقاله

Alibaba: تولید تصاویر 2K با مدل Qwen اکنون ۵ برابر سریع‌تر شد

·۱۸ مهر ۱۴۰۵۴ دقیقه مطالعه
مدل تصویر ۷ میلیارد پارامتری هشت‌مرحله‌ای کیوئن-ایمیج ۲.۱ توربو از علی‌بابا کیوئن منتشر شد
مدل تصویر ۷ میلیارد پارامتری هشت‌مرحله‌ای کیوئن-ایمیج ۲.۱ توربو از علی‌بابا کیوئن منتشر شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش مراحل حذف نویز از ۴۰ به ۸ مرحله بدون افت شدید کیفیت در رزولوشن 2K؛ این اولین بار است که یک مدل با وزن‌های باز در این مقیاس، سرعت استنتاج را ۵ برابر افزایش داده است.

اگر برای تولید تصاویر باکیفیت هوش مصنوعی ثانیه‌ها یا دقایق منتظر می‌مانید، مدل جدید علی‌بابا این انتظار را به کسری از زمان قبلی می‌رساند. Qwen-Image-2.1-Turbo که در ۹ اکتبر ۲۰۲۶ منتشر شد، یک چک‌پوینت شتاب‌یافته‌ی جدید از تیم Qwen است که تعداد مراحل لازم برای رسیدن به یک تصویر نهایی را ۵ برابر کاهش داده است.

این مدل به توسعه‌دهندگان اجازه می‌دهد تصاویر 2K را تنها در ۸ مرحله‌ی حذف نویز (Denoising) — شبیه به تراشیدن سریع یک تیکه سنگ برای رسیدن به مجسمه، به‌جای ضربات ریز و طولانی — تولید کنند؛ در حالی که مدل پایه برای همین کار به ۴۰ مرحله نیاز داشت.

این به‌روزرسانی در حالی رخ می‌دهد که کل صنعت به دنبال استنتاج سریع‌تر است تا ویرایش تصویر در لحظه (Real-time) ممکن شود. همان‌طور که در تحلیل قبلی ما درباره‌ی معماری Linum و تمرکز آن بر سرعت آموزش اشاره کردیم، علی‌بابا اکنون گلوگاه استنتاج را هدف قرار داده است. برای کاربر نهایی، این یعنی تفاوت بین انتظار برای چندین ثانیه جهت رندر شدن تصویر و دیدن آن تقریباً به‌صورت آنی.

جزئیات فنی

به نقل از گزارش Marktechpost، این مدل از یک مولد بصری با ۷ میلیارد پارامتر در کنار رمزگذار متنی Qwen3-VL 8B استفاده می‌کند. معماری آن یک DiT (Transformer انتشار) تک‌جریانی با ۳۲ لایه است که از مکانیزم توجه بلوک-علّی (block-causal attention) بهره می‌برد. این رویکرد در راستای استراتژی کلی علی‌بابا برای بهینه‌سازی هزینه‌هاست، مشابه زمانی که هزینه‌های API مدل‌های چندوجهی خود را به شدت کاهش داد تا دسترسی کاربران گسترده‌تر شود.

برای بهینه‌سازی سرعت، مدل از KV Cache (حافظه موقت کلید-مقدار) پیشوندی — مثل یادداشت‌برداری از بخش‌های تکراری یک دستور برای نخواندن دوباره‌ی آن‌ها — استفاده می‌کند. این سازوکار باعث می‌شود متن و تصاویر مرجع در طول مراحل حذف نویز مجدداً مورد استفاده قرار گیرند. از آنجایی که تصاویر ورودی و متن تنها یک‌بار در مرحله اول محاسبه می‌شوند، این پیشوند ذخیره‌شده، بخش بزرگی از هزینه‌ی شرط‌گذاری (conditioning) را در طول فرآیند ۸ مرحله‌ای پوشش می‌دهد.

مشخصات مدل

ویژگی‌های کلیدی فنی عبارت‌اند از:

  • VAE: یک خودرمزگذار وردشی (VAE) ۶۴ کاناله RGBA با فشرده‌سازی فضایی ۱۶ برابر برای پشتیبانی بومی از شفافیت (Transparency).
  • زمان‌بند: Flow Matching با زمان‌بندی گسسته‌ی اویلر (Euler discrete scheduling) و جابه‌جایی پویا (dynamic shifting).
  • وضوح: خروجی بومی 2K (تا ۲۰۴۸×۲۰۴۸)، با پیش‌تنظیماتی که تا ۲۷۵۲×۱۵۳۶ برای نسبت‌های تصویر ۱۶:۹ گسترش می‌یابند.
  • حافظه: علی‌بابا حداقل حافظه را منتشر نکرده است، اما تخمین‌های Unsloth برای نسخه‌ی GGUF حدود ۱۱ گیگابایت و برای نسخه‌های INT8/FP8 حدود ۲۴ گیگابایت VRAM است.
  • عملکرد: مدل پایه Qwen-Image-2.1 در محک Qwen-Image-Bench امتیاز ۶۰.۲۸ را کسب کرده که بالاترین نمره گزارش شده برای مدل‌های با وزن‌های باز (Open Weights) توسط Qwen است. با این حال، در بررسی‌های عملیاتی، برخی نقاط ضعف در دستورات مکانی در نسخه‌های قبلی مشاهده شده بود که احتمالاً در این به‌روزرسانی مورد توجه قرار گرفته است.

Meet Together Link: ابزار خط فرمان رایگان برای اجرای مدل‌های باز مانند Kimi K3 و GLM 5.3 در Claude Code، Codex و OpenCode

قابلیت‌های تولید و ویرایش

این مدل از ویرایش‌های پیچیده در ۸ دسته‌بندی از جمله پرتره، فیگورهای انسانی، تایپوگرافی، پوسترها و چیدمان UI پشتیبانی می‌کند. همچنین امکان ترکیب چندمرجع با حداکثر ۱۰ تصویر ورودی را فراهم می‌آورد. کاربران می‌توانند با استفاده از دایره‌ها، یادداشت‌های رنگی یا ماسک‌ها، ویرایش‌های موضعی انجام دهند.

مثال‌های کاربردی ویرایش شامل موارد زیر است:

  • تبدیل تک‌تصویر (Single-image transformation)
  • ترکیب چندمرجع (Multi-reference composition)
  • چیدمان داخلی با ۴ تصویر (4-image interior composition)
  • خروجی بومی RGBA برای پس‌زمینه‌های شفاف

معمار پلتفرم استنتاج مایع را راه‌اندازی کرد: حراجی لحظه‌ای برای پردازش مدل‌های زبانی بزرگ

از نظر هزینه، قیمت‌گذاری API در Alibaba Cloud Model Studio شکاف بزرگی ایجاد کرده است. نسخه‌ی Turbo با قیمت ۰.۱ یوآن برای هر تصویر و محدودیت ۱۲۰ درخواست در دقیقه (RPM)، ۲.۵ برابر ارزان‌تر از نسخه‌ی Pro است (۰.۲۵ یوآن و ۲۰ درخواست در دقیقه). در واقع Turbo اجازه می‌دهد نرخ درخواست‌ها ۶ برابر بیشتر از مدل Pro باشد.

این تغییر نشان می‌دهد علی‌بابا دسترسی گسترده و توان عملیاتی بالا را بر کیفیت حداکثری ترجیح داده است. با کاهش مراحل تولید، سرعت ساخت تصویر به سرعت تولید متن نزدیک شده است. این ویژگی مدل را برای نمونه‌سازی سریع رابط کاربری (UI) و طراحی سریع پوستر، جایی که سرعت تکرار (Iteration) مهم‌تر از دقت مطلق است، بسیار جذاب می‌کند.

با این حال، مجوز «فقط برای پژوهش» (research-only license) همچنان یک مانع است. اگرچه وزن‌ها باز هستند، اما هر توسعه‌دهنده‌ای که قصد میزبانی شخصی برای مقاصد تجاری دارد، باید مجوز جداگانه‌ای از علی‌بابا بگیرد.

برای اجرای محلی، توسعه‌دهندگان به Diffusers (از سورس) و نسخه‌ی ۵.۱۷.۰ یا بالاتر transformers نیاز دارند. این خط لوله برای مدیریت سیگماهای نمونه‌برداری پیش‌تنظیم شده که در چک‌پوینت ذخیره شده‌اند، به یک PR خاص (#۱۴۹۵۰) نیاز دارد. مدل از طریق QwenImage21Pipeline روی GPUهای CUDA با دقت BF16 بارگذاری می‌شود. توجه داشته باشید که تنظیم num_inference_steps به تنهایی زمان‌بندی ذخیره شده را تغییر نمی‌دهد؛ تنها یک آرگومان صریح sigmas این کار را می‌کند، هرچند سایر زمان‌بندها هنوز آزمایش نشده‌اند.

باید منتظر ماند و دید جامعه‌ی توسعه‌دهندگان چگونه این زمان‌بندی ۸ مرحله‌ای را با سایر معماری‌های DiT تطبیق می‌دهند، زیرا این افزایش بهره‌وری می‌تواند معیار جدیدی برای مدل‌های تصویر با وزن باز ایجاد کند.

گام بعدی شما

  • اگر طراح UI هستید، از نسخه‌ی Turbo برای تبدیل سریع ایده‌ها به طرح‌های اولیه (Prototyping) استفاده کنید.
  • توسعه‌دهندگان می‌توانند با بررسی PR شماره ۱۴۹۵۰ در Diffusers، مدل را به‌صورت محلی مستقر کنند.
  • بررسی کنید که آیا کاهش مراحل به ۸، در پروژه‌های شما باعث افت کیفیت محسوس می‌شود یا خیر.

اما اثر این بهینه‌سازی بر مدل‌های دیگر DiT حتی جذاب‌تر است — به تحلیل ما درباره‌ی آینده‌ی مدل‌های انتشار سریع مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار تیم Qwen، استانداردی جدید برای مدل‌های بازمتن ایجاد می‌کند که در آن سرعت استنتاج به اندازه کیفیت اهمیت دارد. کاهش هزینه و زمان تولید، ورود هوش مصنوعی زاینده به جریان‌های کاری بلادرنگ (Real-time) را تسریع می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API علی‌بابا، دسترسی مستقیم برای توسعه‌دهندگان ایرانی دشوار است، اما انتشار وزن‌های باز امکان میزبانی شخصی (Self-hosting) را برای تیم‌های داخلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز علی‌بابا بر کاهش مراحل استنتاج به‌جای افزایش پارامترها، نشان‌دهنده‌ی تغییر اولویت از «کیفیت مطلق» به «کاربرد عملی» است. این مدل عملاً فاصله بین تولید متن و تصویر را از نظر زمانی از بین می‌برد و ابزارهای طراحی را به سمت تعاملات لحظه‌ای سوق می‌دهد. احتمالاً شاهد موجی از مدل‌های Turbo در سایر معماری‌های DiT خواهیم بود که سرعت را به معیار اصلی رقابت تبدیل می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.