پرش به محتوای اصلی
پرش به محتوای مقاله

علی‌بابا: مدل Qwen-Image-2.1 با ۷ میلیارد پارامتر مدل‌های بسته را شکست

·۲۹ شهریور ۱۴۰۵۱ دقیقه مطالعه۱ بازدید
علی‌بابا مدل متن‌باز کیوئن ۳.۸ را معرفی کرد؛ ادعا می‌کند پس از فیبل ۵ در رتبه دوم قرار دارد
علی‌بابا مدل متن‌باز کیوئن ۳.۸ را معرفی کرد؛ ادعا می‌کند پس از فیبل ۵ در رتبه دوم قرار دارد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی پشتیبانی بومی از تصاویر شفاف (RGBA) و توانایی پردازش ۱۰ تصویر مرجع هم‌زمان در یک مدل ۷ میلیاردی که روی GPUهای مصرف‌کننده اجرا می‌شود.

اگر امروز برای تولید تصاویر باکیفیت به اشتراک‌های گران‌قیمت ابری متکی هستید، مدل جدید علی‌بابا بازی را تغییر می‌دهد. ۷ میلیارد پارامتر؛ این تمام چیزی است که مدل جدید این شرکت برای ادعای برتری بر غول‌های بستهٔ صنعت تصویرسازی نیاز دارد.

این مدل که در ۲۰ سپتامبر ۲۰۲۶ منتشر شد، یک مدل وزن‌های باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر شده و نه فقط غذای آماده — است که توسط تیم Qwen AI برای ویرایش دقیق و تولید تصاویر با وفاداری بالا طراحی شده است. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی گذار صنعت به سمت مدل‌های کوچک‌تر اشاره کردیم، بازار اکنون به دنبال ابزارهایی است که روی سخت‌افزار محلی اجرا شوند. علی‌بابا با هدف قرار دادن بازار «مصرف‌کنندگان حرفه‌ای»، این مدل را به‌گونه‌ای بهینه کرده است که روی کارت‌های گرافیکی معمولی مثل NVIDIA RTX 3090 اجرا شود. این رویکرد در راستای استراتژی کلی علی‌بابا برای توسعه مدل‌های بهینه است، مشابه آنچه در معرفی مدل Qwen3.8-Flash-Next برای بهبود عملکرد کدنویسی شاهد بودیم.

به گزارش وب‌سایت the-decoder.com، این مدل چندین پیشرفت فنی کلیدی را معرفی کرده است:

  • پشتیبانی از RGBA: تولید و ویرایش بومی تصاویر شفاف که اجازه می‌دهد اشیا را جدا کرده یا متن‌ها را روی لایه‌های شفاف تغییر دهید.
  • ورودی چند-مرجعی: توانایی پردازش هم‌زمان ۱۰ تصویر مرجع برای کارهای پیچیده مثل پروژه‌های طراحی داخلی یا پروکسی مجازی.
  • بهینه‌سازی استنتاج: به‌روزرسانی‌های معماری و بازاستفاده از KV Cache (حافظه‌ای که برای سرعت بخشیدن به تولید توکن‌ها استفاده می‌شود) سرعت استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره‌ی آموزش آشپز — را به‌شدت افزایش داده است. این تمرکز بر سرعت پاسخ‌دهی، یادآور تلاشات علی‌بابا در بهینه‌سازی شدید استنتاج در نسخه‌های پیشین خانواده Qwen است.

مدل متن‌باز تصویرساز کیوئن ۲.۱ علی‌بابا با ۷ میلیارد پارامتر از مدل‌های بسته پیشی گرفت

طبق اعلام تیم Qwen، این مدل در محک‌های داخلی از اکثر مدل‌های بسته پیشی گرفته است، هرچند تأکید کرده‌اند که نتایج محک‌های مستقل هنوز در دست بررسی است. در حال حاضر این مدل از طریق Hugging Face، GitHub و Model Scope در دسترس است. همچنین علی‌بابا در حوزه‌های تخصصی‌تر نیز فعال است و پیش از این مدل Damo Radar را برای تشخیص بیماری‌های شکمی از روی سی‌تی‌اسکن معرفی کرده بود.

برای صاحبان کسب‌وکار، این اتفاق یعنی تغییر در نسبت هزینه به کیفیت محتوای بصری. دیگر برای رسیدن به نتایج سطح بالا نیازی به اشتراک‌های سازمانی نیست، به شرطی که سخت‌افزار لازم برای میزبانی وزن‌ها را داشته باشید. با این حال، مجوز فعلی پژوهشی است و استفاده تجاری مستلزم دریافت مجوز جداگانه از علی‌بابا است.

گام بعدی شما

  • اگر کارت گرافیک سری ۳۰ یا ۴۰ انویدیا دارید، مدل را از Hugging Face دانلود و روی سیستم خود تست کنید.
  • قابلیت RGBA را برای حذف پس‌زمینه و ایجاد لایه‌های شفاف در طراحی‌های گرافیکی به کار بگیرید.
  • منتظر انتشار نتایج بنچمارک‌های مستقل بمانید تا میزان دقت واقعی مدل در برابر مدل‌های بسته مشخص شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار تیم Qwen، دسترسی به ابزارهای تولید تصویر سطح بالا را از ابر به سیستم‌های محلی منتقل می‌کند. این تغییر، وابستگی کسب‌وکارهای کوچک به اشتراک‌های ماهانه شرکت‌های آمریکایی را کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل وزن‌باز بودن مدل و در دسترس بودن در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون محدودیت‌های API و تحریم‌های سرویس‌های ابری، آن را روی سرورهای داخلی مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز علی‌بابا بر مدل‌های ۷ میلیاردی نشان می‌دهد که رقابت از «بزرگ‌ترین مدل» به «بهینه‌ترین مدل برای سخت‌افزار خانگی» تغییر مسیر داده است. پشتیبانی بومی از RGBA یک حرکت هوشمندانه برای جذب طراحان گرافیک است، چرا که مدل‌های فعلی معمولاً در مدیریت لایه‌های شفاف ضعیف هستند و نیاز به ابزارهای جانبی دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.