اگر امروز برای تولید محتوای بصری به ابزارهای ابری متکی هستید، باید بدانید که اجرای محلی مدلهای پیشرفته روی سختافزار شخصی دیگر یک تجمل نیست، بلکه یک ضرورت برای افزایش سرعت گردش کار است. طراحان حرفهای اکنون به دنبال ابزارهایی هستند که فاصله بین تولید، استخراج و بازبینی را کاهش دهند. اما آیا توانایی تولید یک تصویر «زیبا» به معنای توانایی تحویل یک دارایی آماده برای چاپ یا وبسایت است؟
طبق گزارشهای ارزیابی محلی در ۲۲ سپتامبر ۲۰۲۶، مدل Qwen-Image 2.1 در ۲۰ مورد تولید تصویر روی مکبوک پرو، در حالی که انسجام بصری و شفافیت بومی خیرهکنندهای داشت، در بسیاری از دستورات دقیق مکانی و متنی شکست خورد. این مدل که در ۲۰ سپتامبر ۲۰۲۶ توسط Qwen منتشر شد، ادعا میکند مدلی یکپارچه برای تولید و ویرایش است که به طور بالقوه نیاز به ابزارهای جداگانه برای حذف پسزمینه را از بین میبرد.
زمینه و معماری مدل
این مولد بصری بر پایه یک معماری ۷ میلیارد پارامتری ساخته شده است که شامل ۳۲ لایه ترنسفورمر-دیفیوژن تکجریانی (single-stream diffusion-transformer) است. هدف از این رویکرد یکپارچه، ترکیب فرآیندهای تولید، استخراج، بازبینی و جایگذاری در یک مدل واحد است. Qwen با کاهش تعداد ابزارهای مورد نیاز برای یک تصویرسازی قابل استفاده مجدد، قصد دارد اصطکاک ناشی از جابهجایی بین نرمافزارهای مختلف را به حداقل برساند. این رویکرد تکاملی در مدلهای بینایی Qwen است که پیشتر در بررسی مدلهای ۸ میلیاردی برای استخراج سند به توانایی آنها در تحلیل پیچیدگیهای بصری اشاره شده بود.
با این حال، یک تصویر نمایشی (Showcase) هرگز گواهی بر کارآمدی در گردش کار نیست. یک ارزیابی مفید باید به این سوالات پاسخ دهد: آیا میتوان پسزمینه را بدون تغییر در خود محصول عوض کرد؟ آیا لبههای شفاف تولید شده برای استفاده صنعتی قابلقبول هستند؟ و آیا میتوان نسخههای مختلف را بدون شروع مجدد کل فرآیند تکرار کرد؟ اینها سوالات عملی هستند که این جلسه تست به آنها میپردازد.
مجوزها و استفاده تجاری
کاربران باید در مورد توافقنامه مجوز پژوهشی Qwen بسیار محتاط باشند. بخش ۲ این توافقنامه، استفاده از وزنهای منتشر شده را به مقاصد غیرتجاری محدود کرده و استفاده را تنها به «پژوهش یا ارزیابی» تعریف میکند. استقرار تجاری این مدل نیازمند دریافت یک مجوز جداگانه از تامینکننده است.
این تمایز بسیار حیاتی است: استفاده از یک کانسپت محصول یا یک کمپین خدمات خانگی برای اهداف ارزیابی، به این معنا نیست که این وزنها برای تحویل نهایی به مشتریان آزاد هستند. کاربران باید پیش از ساخت یک خط لوله تولید داراییهای تجاری، مجوزهای لازم را با تامینکننده نهایی کنند. دسترسی به دانلود، اجرای محلی و مجوز تجاری، سه تصمیم مجزا هستند. همچنین، یک سرویس میزبانی شده (Hosted Service) ممکن است شرایط متفاوتی داشته باشد که نیازمند بررسی جداگانه است.
سختافزار و پیکربندی
محیط تست شامل یک مکبوک پرو با تراشه M5 Pro، ۱۸ هسته CPU، ۲۰ هسته GPU و ۴۸ گیگابایت حافظه یکپارچه بود که سیستمعامل macOS 27.0 را اجرا میکرد. این تنظیمات از ComfyUI نسخه 0.37.0 و PyTorch 2.12.1 از طریق بکاِند MPS (Metal Performance Shaders) استفاده میکرد.
از آنجایی که ادعاهای مربوط به عملکرد CUDA را نمیتوان به بکاِند GPU اپل منتقل کرد، این نتایج مختص معماری M5 Pro است. سیستم پیش از اولین اجرا، حدود ۳,۷۸۸ مگابایت Swap فعال داشت که نشان میدهد این یک محیط کاری واقعی بوده و نه یک بنچمارک ایزوله؛ به طوری که سایر برنامههای دسکتاپ در طول جلسه باز بودند.
برای جای دادن مدل در حافظه، از نسخههای کوانتیده (Quantized) زیر استفاده شد:
- qwen_image_2.1_int8_convrot.safetensors (مولد)
- qwen3vl_8b_int8_convrot.safetensors (رمزگذار متن)
- qwen_image_2.1_vae_bf16.safetensors (VAE)
این فایلهای خاص در زمانبندی تاثیرگذارند. یک مدل ۷ میلیارد پارامتری با دو بایت برای هر مقدار، پیش از تخصیصهای زمان اجرا به ۱۴ گیگابایت فضای ذخیرهسازی نیاز دارد. کوانتیزاسیون این ردپای حافظه را کاهش میدهد، اما اندازه فایل لزوماً تعیینکننده حافظه استنتاج واقعی یا سرعت اجرا نیست. در این مک، CPU، GPU، سیستمعامل و سایر برنامهها بودجه حافظه فیزیکی را به صورت مشترک تقسیم میکنند.
بنچمارکهای عملکرد
تستها با ۲۵ گام (Steps)، نمونهبردار Euler، زمانبند ساده، CFG 1 و اندازه دسته (Batch size) یک انجام شد. از هیچ LoRA، آپاسکیلر یا بهبوددهنده پرامپتی استفاده نشد. اجراهای «اولین» (First) پس از ریاستارت بکاِند و اجراهای «گرم» (Warm) با استفاده مجدد از نود رمزگذاری متن بدون تغییر انجام شد. برای هر شرط زمانی، ابتدا بذر ۱۰۰ و سپس بذرهای ۱۰۱، ۱۰۲ و ۱۰۳ بدون ریاستارت اجرا شدند.
زمانهای اجرا بر اساس رزولوشن به شدت متغیر بود:
- طبیعت بیجان (۱۰۲۴²): اجرای اول ۱۵۶.۰ ثانیه | میانگین گرم ۱۴۳.۵ ثانیه (بازه: ۱۴۲.۵–۱۴۵.۰ ثانیه)
- شاخه شفاف (۱۰۲۴²): اجرای اول ۱۵۶.۰ ثانیه | میانگین گرم ۱۴۰.۸ ثانیه (بازه: ۱۴۰.۷–۱۴۲.۱ ثانیه)
- ویرایش مرجع (۱۰۲۴²): اجرای اول ۲۲۱.۲ ثانیه | میانگین گرم ۱۷۲.۵ ثانیه (بازه: ۱۷۲.۴–۱۷۲.۷ ثانیه)
- طبیعت بیجان (۱۵۳۶²): اجرای اول ۳۵۸.۳ ثانیه | میانگین گرم ۳۴۳.۵ ثانیه (بازه: ۳۱۲.۲–۳۴۶.۱ ثانیه)
وقتی رزولوشن به ۱۵۳۶ در ۱۵۳۶ افزایش یافت، زمان به ۳۴۳.۵ ثانیه رسید که تقریباً ۲.۴ برابر کندتر از خط پایه بود. ویرایشهای مرجع کندتر از تولیدات پایه بودند و میانگین گرم ۱۷۲.۵ ثانیه را ثبت کردند. این اندازهگیریها شامل کارهای گراف و ذخیرهسازی تصویر است. زمان ارسال API محلی تا تکمیل نیز از طریق نظرسنجی هر دو ثانیه در یک فایل CSV جداگانه ثبت شد. این نوسانات در سرعت استنتاج محلی یادآور بهینهسازیهای اخیر در خانواده Qwen است، مشابه آنچه در مدل Qwen3.8 27B برای کاهش زمان پاسخدهی مشاهده شد.
«شکاف دستورالعمل» در تولید
جذابیت بصری اغلب شکست در پیروی از دستورات را میپوشاند. در یک تست پایه که درخواست یک ماگ کرمرنگ «در کنار» یک دفترچه سبز-جنگلی، همراه با یک شاخه همیشه سبز و نور پنجره از سمت چپ بود، تنها یک مورد از چهار بذر (بذر ۱۰۰) جایگذاری مکانی را رعایت کرد. سه مورد دیگر (بذرهای ۱۰۱، ۱۰۲ و ۱۰۳) ماگ را «روی» دفترچه قرار دادند.

این موضوع نشان میدهد که اگرچه مدل صحنههای منسجمی میسازد، اما برای برآورده کردن الزامات چیدمان خاص در کارهای مشتری، ممکن است به تلاشهای متعددی نیاز باشد. این یک مشاهده تکموردی است و نه یک امتیاز دقت کلی برای مدل، اما تفاوت بین یک تصویر «جذاب» و یک دارایی «مطابق با دستور» را برجسته میکند.
شفافیت بومی و کانالهای آلفا
یکی از قویترین ویژگیهای این مدل، خروجی بومی RGBA است. برخلاف مدلهایی که یک پسزمینه شطرنجی را در پیکسلها رنگ میکنند، Qwen-Image 2.1 یک کانال آلفای واقعی تولید میکند.
برای تست این قابلیت، یک شاخه همیشه سبز تصویر شده با سوزنهای ریز و گپهای باز تولید شد. این تست سختگیرانهتر از یک آیکون توپر است زیرا کیفیت لبهها را به چالش میکشد. پرامپت، پسزمینه شفاف و یک کانال آلفای واقعی بدون هیچگونه نوشته، قاب یا سایه انداخته شده را مشخص کرد.


تستها نشان داد که در خروجی موفق (بذر ۱۰۰)، ۳۴.۶٪ از پیکسلها کاملاً شفاف بودند. لبهها حتی زمانی که روی پسزمینههای متضاد کرم و سبز تیره قرار گرفتند، قابل استفاده باقی ماندند. با این حال، کانال آلفا از نظر ریاضی کامل نیست. برخی نمونههای گوشهای ۱۰۰ پیکسلی حاوی باقیماندههای کمرنگی (مقادیر آلفا بین ۰ و ۳) بودند که ممکن است در خط لولههای تولید سطح بالا نیاز به پاکسازی دستی داشته باشد. سه مورد از چهار خروجی شاخه در اندازه صفحه وب با دستور بصری مطابقت داشتند؛ بذر ۱۰۳ با اضافه کردن یک مخروط کاج سوم (در حالی که تنها دو عدد درخواست شده بود) شکست خورد.
حفظ محصول در ویرایش
ویرایش یک محصول مستلزم آن است که سوژه بدون تغییر باقی بماند در حالی که پسزمینه تغییر میکند. در یک تست کنترل شده با استفاده از یک مرجع مصنوعی ماگ، از مدل خواسته شد پسزمینه را با یک پسزمینه استودیویی کرم گرم جایگزین کند، در حالی که سیلوئت، بازشوی دسته، لبه، علامتهای سطحی و زاویه دوربین حفظ شود.


علیرغم موفقیت بصری، ویرایش در دستور سختگیرانه حفظ محصول شکست خورد. مدل رنگ بدنه ماگ را گرمتر کرد و موقعیت لبه را کمی تغییر داد. مقایسه برشهای پیکسلهای منبع ۵۶۰ در ۴۲۰ نشان داد که لبه در فریم ویرایش شده پایینتر قرار گرفته است. برای هنر مفهومی (Concept Art)، این موضوع پذیرفتنی است؛ اما برای یک کاتالوگ محصول که دقت رنگی در آن اجباری است، این یک شکست محسوب میشود. هر چهار بذر تست شده، سوژه را همراه با پسزمینه به طور محسوسی گرم کردند، هرچند هر چهار مورد سه ویژگی شناسایی اصلی را حفظ کردند.
تایپوگرافی و دقت متنی
تولید متن با استفاده از یک پوستر خیالی با سه خط مشخص تست شد: "COOL AIR"، "CLEAR PLAN" و "SEPTEMBER 2026". دستورالعمل دقیقاً همین سه خط را بدون هیچ کلمه اضافی میخواست.

از سه بذر، تنها یکی (بذر ۱۰۳) دستور متن دقیق را پاس کرد. دو بذر دیگر (۱۰۱ و ۱۰۲) کلمات را درست هجی کردند اما عبارات "COOL AIR" و "CLEAR PLAN" را تکرار کردند.

این ثابت میکند که متن خوانا همیشه به معنای متن دقیق نیست. برای کمپینهای واقعی، تولید تصویر بدون کلمات و اضافه کردن متن در یک ابزار صفحهآرایی همچنان امنترین راه برای تضمین متن قابل ویرایش و اطلاعات تماس صحیح است. خوشخطی زیبا، کندتر شدن بازبینی یا داشتن فایلهای منبع با قابلیت ویرایش کمتر را توجیه نمیکند.
رزولوشن در مقابل ترکیببندی
افزایش رزولوشن باعث تثبیت ترکیببندی نمیشود. وقتی همان بذر (۱۰۰) به جای ۱۰۲۴ در ۱۰۲۴، در رزولوشن ۱۵۳۶ در ۱۵۳۶ اجرا شد، ماگ از حالت «کنار» دفترچه به حالت «روی» دفترچه تغییر مکان داد.
این ثابت میکند که اندازه بوم به طور بنیادی منطق مکانی مدل را تغییر میدهد. در حالی که نسخه بزرگتر جزئیات متقاعدکنندهتری از سرامیک و کاغذ ارائه داد، اما دستور جایگذاری را که نسخه کوچکتر رعایت کرده بود، نادیده گرفت. یک فایل بزرگتر به طور خودکار پذیرفته نمیشود و یک بذر مشابه، ترکیببندی را در اندازههای مختلف بوم قفل نمیکند.
تحلیل تحریری و ادغام در گردش کار
برای کاربر عملی، این تست فاش میکند که Qwen-Image 2.1 ابزاری قدرتمند برای نمونهسازی سریع و ایدهپردازی است، اما هنوز جایگزین «تککلیکی» برای یک خط لوله تولید نیست. شکاف بین یک بذر موفق و یک بذر شکستخورده بسیار زیاد است تا بتوان برای داراییهای دقیق به تولید خام تکیه کرد.
برای تبدیل یک پرامپت به یک محصول تحویلی، کاربران باید یک گردش کار «ترکیبی» را اتخاذ کنند:
- تولید: استفاده از Qwen برای بصریهای اصلی و داراییهای شفاف.
- بهبود: مدیریت تایپوگرافی نهایی و جایگذاری دقیق محصول در ابزارهایی مانند Figma یا Photoshop.
- تأیید: اجرای یک «تعریف از اتمام» (مثلاً آلفای تمیز، خوانایی در اندازه موبایل، ثبات پالت رنگی).
چارچوب ارزیابی دقیق
برای ارزیابی درست یک گردش کار تصویری، سرعت و کاربردی بودن باید به طور جداگانه اندازهگیری شوند. یک خروجی سریع با یک تیتر غلط باز هم نیاز به تلاش مجدد دارد. معیارهای زیر توصیه میشوند:
- بازده اولین تلاش (First-pass yield): نسبت خروجیهای خام پذیرفته شده به کل خروجیهای خام تکمیل شده.
- دقایق گردش کار به ازای هر دارایی نهایی: (زمان انتظار تولید + بازبینی + بازبینیها + پاکسازی دستی + زمان خروجی) تقسیم بر تعداد داراییهای نهایی پذیرفته شده.
- چکهای قبول/رد: تعریف معیارهای سختگیرانه برای متن دقیق، جزئیات حفظ شده سوژه، آلفای قابل استفاده و ترکیببندی درخواستی.
در این جلسه، خط پایه در چهار تلاش، یک تصویر مطابق با جایگذاری تولید کرد و پوستر در سه تلاش، یک مورد متن دقیق داشت. این شمارشها تلاش تولید را به گونهای توضیح میدهند که ارقام «ثانیه بر تصویر» نمیتوانند.
ملاحظات آینده و ظرافتهای فنی
- بهبود پرامپت: Qwen مدلهای اختیاری بهبود پرامپت را برای گسترش توصیفات ورودی ارائه میدهد. اینها مدلهای جداگانهای هستند و باید به عنوان متغیرهای مستقل تست شوند تا اطمینان حاصل شود که اشیاء درخواست نشده را وارد نمیکنند یا قصد کاربر را تغییر نمیدهند.
- کشینگ (Caching): Qwen استفاده مجدد از شرطیسازی متن و تصویر مرجع را توصیف میکند. کاربران محلی باید بین حضور مدل در حافظه، استفاده مجدد از رمزگذاری پرامپت در یک نود و شرطیسازی در یک اجرای نمونهبرداری تفاوت قائل شوند تا از بنچمارکهای گمراهکننده اجتناب کنند.
- نقشهای چند-مرجعی: تستهای آینده باید نقشهای خاصی را به ۱۰ اسلات مرجع موجود اختصاص دهند (مثلاً تصویر ۱ برای سوژه، تصویر ۲ برای پالت) تا مشخص شود آیا مدل میتواند ویژگیها را بدون وارد کردن محتوای نامرتبط ایزوله کند یا خیر.
- انحراف تجمعی (Cumulative Drift): لازم است مسیرهای بازبینی (اصلی $ \rightarrow $ ویرایش A $ \rightarrow $ ویرایش B در مقابل اصلی $ \rightarrow $ ویرایش B) مقایسه شوند تا مشخص شود آیا ویرایشهای مکرر، محصول را از منبع اصلی دورتر میکند یا خیر. بازگشت به مرجع اصلی ممکن است قابل اعتمادتر از ویرایش مکرر آخرین خروجی باشد.
دستورالعملهای کاربرد عملی
پس از دریافت مجوز مناسب، قابلیتهای مدل چندین مسیر ارزیابی خاص را پیشنهاد میکند:
- کاتالوگهای کوچک محصول: تست توانایی حفظ هویت واقعی محصول در حالی که درمانهای پسزمینه یکسانی اعمال میشود.
- کمپینهای خدمات محلی: ایجاد بصریهای فصلی تصویر شده، و سپس قرار دادن پیشنهادهای تأیید شده و اطلاعات تماس در یک ابزار صفحهآرایی جداگانه برای جلوگیری از ارائه صحنههای تولید شده به عنوان کارهای واقعی مشتری.
- خانواده داراییهای وبسایت: تولید یک تصویر اصلی (Hero) و عناصر شفاف کوچکتر که یک پالت رنگی واحد را به اشتراک میگذارند و ارزیابی آنها در اندازههای واقعی موبایل.
- بازبینیهای مفهومی داخلی: بررسی بصریهای اتاق یا بستهبندی قبل از تعهد به تولید، تا اطمینان حاصل شود جزئیات تخیلی به عنوان مشخصات ساخت ارائه نمیشوند.
ارزش واقعی در شفافیت بومی و معماری ویرایش یکپارچه نهفته است. اگر یک طراح بتواند بازده ۲۵ درصدی در اولین تلاش برای دقت مکانی را بپذیرد، سرعت تکرار محلی روی مک یک مزیت عظیم نسبت به ابزارهای مبتنی بر ابر است.
گام بعدی شما
- برای خروجیهای نهایی، از مدل برای تولید عناصر بصری و پسزمینههای شفاف استفاده کنید، اما تایپوگرافی و جایگذاری دقیق را به Figma یا Photoshop بسپارید.
- در صورت استفاده از رزولوشنهای مختلف، حتماً ترکیببندی (Composition) را دوباره چک کنید، چون تغییر سایه بوم، منطق مکانی مدل را به هم میریزد.
- پیش از هرگونه استفاده تجاری، مجوزهای بخش ۲ توافقنامه پژوهشی Qwen را بررسی کنید تا با محدودیتهای حقوقی مواجه نشوید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو