اگر برای تولید تصاویر باکیفیت هوش مصنوعی ثانیهها یا دقایق منتظر میمانید، مدل جدید علیبابا این انتظار را به کسری از زمان قبلی میرساند. Qwen-Image-2.1-Turbo که در ۹ اکتبر ۲۰۲۶ منتشر شد، یک چکپوینت شتابیافتهی جدید از تیم Qwen است که تعداد مراحل لازم برای رسیدن به یک تصویر نهایی را ۵ برابر کاهش داده است.
این مدل به توسعهدهندگان اجازه میدهد تصاویر 2K را تنها در ۸ مرحلهی حذف نویز (Denoising) — شبیه به تراشیدن سریع یک تیکه سنگ برای رسیدن به مجسمه، بهجای ضربات ریز و طولانی — تولید کنند؛ در حالی که مدل پایه برای همین کار به ۴۰ مرحله نیاز داشت.
این بهروزرسانی در حالی رخ میدهد که کل صنعت به دنبال استنتاج سریعتر است تا ویرایش تصویر در لحظه (Real-time) ممکن شود. همانطور که در تحلیل قبلی ما دربارهی معماری Linum و تمرکز آن بر سرعت آموزش اشاره کردیم، علیبابا اکنون گلوگاه استنتاج را هدف قرار داده است. برای کاربر نهایی، این یعنی تفاوت بین انتظار برای چندین ثانیه جهت رندر شدن تصویر و دیدن آن تقریباً بهصورت آنی.
جزئیات فنی
به نقل از گزارش Marktechpost، این مدل از یک مولد بصری با ۷ میلیارد پارامتر در کنار رمزگذار متنی Qwen3-VL 8B استفاده میکند. معماری آن یک DiT (Transformer انتشار) تکجریانی با ۳۲ لایه است که از مکانیزم توجه بلوک-علّی (block-causal attention) بهره میبرد. این رویکرد در راستای استراتژی کلی علیبابا برای بهینهسازی هزینههاست، مشابه زمانی که هزینههای API مدلهای چندوجهی خود را به شدت کاهش داد تا دسترسی کاربران گستردهتر شود.
برای بهینهسازی سرعت، مدل از KV Cache (حافظه موقت کلید-مقدار) پیشوندی — مثل یادداشتبرداری از بخشهای تکراری یک دستور برای نخواندن دوبارهی آنها — استفاده میکند. این سازوکار باعث میشود متن و تصاویر مرجع در طول مراحل حذف نویز مجدداً مورد استفاده قرار گیرند. از آنجایی که تصاویر ورودی و متن تنها یکبار در مرحله اول محاسبه میشوند، این پیشوند ذخیرهشده، بخش بزرگی از هزینهی شرطگذاری (conditioning) را در طول فرآیند ۸ مرحلهای پوشش میدهد.
مشخصات مدل
ویژگیهای کلیدی فنی عبارتاند از:
- VAE: یک خودرمزگذار وردشی (VAE) ۶۴ کاناله RGBA با فشردهسازی فضایی ۱۶ برابر برای پشتیبانی بومی از شفافیت (Transparency).
- زمانبند: Flow Matching با زمانبندی گسستهی اویلر (Euler discrete scheduling) و جابهجایی پویا (dynamic shifting).
- وضوح: خروجی بومی 2K (تا ۲۰۴۸×۲۰۴۸)، با پیشتنظیماتی که تا ۲۷۵۲×۱۵۳۶ برای نسبتهای تصویر ۱۶:۹ گسترش مییابند.
- حافظه: علیبابا حداقل حافظه را منتشر نکرده است، اما تخمینهای Unsloth برای نسخهی GGUF حدود ۱۱ گیگابایت و برای نسخههای INT8/FP8 حدود ۲۴ گیگابایت VRAM است.
- عملکرد: مدل پایه Qwen-Image-2.1 در محک Qwen-Image-Bench امتیاز ۶۰.۲۸ را کسب کرده که بالاترین نمره گزارش شده برای مدلهای با وزنهای باز (Open Weights) توسط Qwen است. با این حال، در بررسیهای عملیاتی، برخی نقاط ضعف در دستورات مکانی در نسخههای قبلی مشاهده شده بود که احتمالاً در این بهروزرسانی مورد توجه قرار گرفته است.

قابلیتهای تولید و ویرایش
این مدل از ویرایشهای پیچیده در ۸ دستهبندی از جمله پرتره، فیگورهای انسانی، تایپوگرافی، پوسترها و چیدمان UI پشتیبانی میکند. همچنین امکان ترکیب چندمرجع با حداکثر ۱۰ تصویر ورودی را فراهم میآورد. کاربران میتوانند با استفاده از دایرهها، یادداشتهای رنگی یا ماسکها، ویرایشهای موضعی انجام دهند.
مثالهای کاربردی ویرایش شامل موارد زیر است:
- تبدیل تکتصویر (Single-image transformation)
- ترکیب چندمرجع (Multi-reference composition)
- چیدمان داخلی با ۴ تصویر (4-image interior composition)
- خروجی بومی RGBA برای پسزمینههای شفاف

از نظر هزینه، قیمتگذاری API در Alibaba Cloud Model Studio شکاف بزرگی ایجاد کرده است. نسخهی Turbo با قیمت ۰.۱ یوآن برای هر تصویر و محدودیت ۱۲۰ درخواست در دقیقه (RPM)، ۲.۵ برابر ارزانتر از نسخهی Pro است (۰.۲۵ یوآن و ۲۰ درخواست در دقیقه). در واقع Turbo اجازه میدهد نرخ درخواستها ۶ برابر بیشتر از مدل Pro باشد.
این تغییر نشان میدهد علیبابا دسترسی گسترده و توان عملیاتی بالا را بر کیفیت حداکثری ترجیح داده است. با کاهش مراحل تولید، سرعت ساخت تصویر به سرعت تولید متن نزدیک شده است. این ویژگی مدل را برای نمونهسازی سریع رابط کاربری (UI) و طراحی سریع پوستر، جایی که سرعت تکرار (Iteration) مهمتر از دقت مطلق است، بسیار جذاب میکند.
با این حال، مجوز «فقط برای پژوهش» (research-only license) همچنان یک مانع است. اگرچه وزنها باز هستند، اما هر توسعهدهندهای که قصد میزبانی شخصی برای مقاصد تجاری دارد، باید مجوز جداگانهای از علیبابا بگیرد.
برای اجرای محلی، توسعهدهندگان به Diffusers (از سورس) و نسخهی ۵.۱۷.۰ یا بالاتر transformers نیاز دارند. این خط لوله برای مدیریت سیگماهای نمونهبرداری پیشتنظیم شده که در چکپوینت ذخیره شدهاند، به یک PR خاص (#۱۴۹۵۰) نیاز دارد. مدل از طریق QwenImage21Pipeline روی GPUهای CUDA با دقت BF16 بارگذاری میشود. توجه داشته باشید که تنظیم num_inference_steps به تنهایی زمانبندی ذخیره شده را تغییر نمیدهد؛ تنها یک آرگومان صریح sigmas این کار را میکند، هرچند سایر زمانبندها هنوز آزمایش نشدهاند.
باید منتظر ماند و دید جامعهی توسعهدهندگان چگونه این زمانبندی ۸ مرحلهای را با سایر معماریهای DiT تطبیق میدهند، زیرا این افزایش بهرهوری میتواند معیار جدیدی برای مدلهای تصویر با وزن باز ایجاد کند.
گام بعدی شما
- اگر طراح UI هستید، از نسخهی Turbo برای تبدیل سریع ایدهها به طرحهای اولیه (Prototyping) استفاده کنید.
- توسعهدهندگان میتوانند با بررسی PR شماره ۱۴۹۵۰ در Diffusers، مدل را بهصورت محلی مستقر کنند.
- بررسی کنید که آیا کاهش مراحل به ۸، در پروژههای شما باعث افت کیفیت محسوس میشود یا خیر.
اما اثر این بهینهسازی بر مدلهای دیگر DiT حتی جذابتر است — به تحلیل ما دربارهی آیندهی مدلهای انتشار سریع مراجعه کنید.




گفتگو