تصور کنید بخواهید یک جدول ۳ در ۳ از اینفوگرافیکهای متنی مجزا را بدون هیچ ویرایش دستی و تنها با یک دستور بسازید. مدل Qwen-Image-3.0 از شرکت علیبابا این کار را ممکن کرده و نیاز به سرهم کردن طرحهای پیچیده از چندین تصویر مختلف را از بین برده است.
این مدل اکنون میتواند متونی به کوچکی ۱۰ پیکسل و فرمولهای پیچیده لاتک (LaTeX) را با دقت رندر کند. این یعنی عبور از دوران تولید تصاویر «قشنگ» و ورود به عصر خلق اسناد کاربردی. همانطور که در تحلیلهای قبلی ما دربارهی تکامل مدلهای بینایی-زبانی اشاره کردیم، صنعت در حال حرکت به سمتی است که در آن دقت ساختاری بر زیبایی بصری اولویت مییابد.
به گزارش منتشر شده در ۲۱ ژوئیه ۲۰۲۶، این مدل از پرامپتهایی تا سقف ۴۵۰۰ توکن — یعنی تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — پشتیبانی میکند. این پنجره متنی گسترده به کاربران اجازه میدهد جزئیات دقیق چیدمانها را توصیف کنند. در یکی از دموها، یک تصویر واحد شامل ۹ پنل مجزا است که موضوعاتی از اخلاق کنفوسیوس و کنترلهای داخلی بانکی تا چرخه حیات کرمهای کبد را پوشش میدهد.
![]()
علاوه بر شبکهبندی، Qwen-Image-3.0 در مدیریت لایههای تو در توی رابطهای کاربری (UI) درخشیده است. طبق مستندات، این مدل میتواند پنجرهای از VSCode را رندر کند که درون آن یک صفحه چت Qwen، یک رشته گفتگو در WeChat و یک پوستر دم کردن قهوه دیده میشود. این سطح از انسجام ساختاری نشاندهنده جهشی بزرگ در درک سلسلهمراتب فضایی مدل است.
![]()
دقت فنی در محتوای آکادمیک نیز ارتقا یافته است. مدل میتواند یک صفحه کامل از یک مقاله خیالی در زمینه هندسه جبری را تولید کند که شامل معادلات چندخطی با زیرنویسها و توانهاست. حتی یادداشتهای دستنویس معلم با رنگ قرمز را نیز شبیهسازی میکند.
![]()
واقعگرایی عکاسی نیز بهبود یافته است. مدل پرترههایی با منافذ پوستی قابل مشاهده و تارهای موی نورپردازی شده تولید میکند. در کارهای ویرایشی، این مدل میتواند نقاشیهای سنتی جوهری آسیبدیده را با تطبیق دقیق ضربات قلممو و سایهزنیها ترمیم کند.
![]()
سایر قابلیتهای کلیدی عبارتند از:
- پشتیبانی بومی از ۱۲ زبان از جمله اسپانیایی، کرهای و ژاپنی.
- ادغام دادههای زنده اینترنتی برای تولید محتوای لحظهای، مانند پیشبینی هوای هانگژو.
- خلق پلاکهای شناسایی علمی شامل تاکسونومی، مقیاسهای اندازهگیری و نماهای ذرهبین.
این عرضه پس از معرفی Qwen-Image-2.0 در ماه مه صورت گرفت که تمرکزش بر بهرهوری استنتاج — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی نه دورهی آموزش آشپز — بود. در حالی که نسخه قبلی با GPT-Image-2 گوگل و OpenAI رقابت میکرد، نسخه ۳.۰ مسیر خود را به سمت «دانش عمیق» و دقت در چیدمان تغییر داده است.
برای یک کاربر تجاری، این یعنی هوش مصنوعی به جایگزینی ابزارهای دستی ساخت ماکت (Mockup) نزدیکتر شده است. شما اکنون میتوانید پیشنویس باکیفیت یک بروشور فنی یا یک رابط کاربری را در چند ثانیه بسازید. با این حال، خروجی همچنان یک تصویر ایستا است و قابلیت جستوجو یا ویرایش فایلهای PDF و LaTeX را ندارد.
در نهایت، تضادی میان کمال بصری و کاربرد عملی وجود دارد. پژوهشگران همچنان برای انتشار مقالات از LaTeX استفاده میکنند، اما ارزش واقعی این مدل در نمونهسازی سریع (Prototyping) و روایتهای بصری است؛ جایی که «حس و حال» تصویر مهمتر از قابلیت ویرایش متن است.
در حال حاضر، Qwen-Image-3.0 تنها از طریق API با دعوتنامه در دسترس است. انتظار میرود علیبابا بهزودی آن را در اپلیکیشنهایی مثل Qwen Chat ادغام کند، هرچند احتمالاً برخلاف نسخههای اولیه، با لایسنس باز منتشر نخواهد شد.
گام بعدی شما
- اگر طراح UI هستید، از این مدل برای تولید سریع Moodboard و ایدههای اولیه چیدمان استفاده کنید.
- برای تولید محتوای آموزشی، قابلیت رندر فرمولهای ریاضی را با ابزارهای تبدیل تصویر به متن بسنجید.
- منتظر ادغام این قابلیتها در Qwen Chat باشید تا سرعت تبدیل ایدههای متنی به اینفوگرافیک را تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو