۲.۴ تریلیون پارامتر؛ این رقم مقیاس خیرهکننده مدل جدید علیبابا است که حالا برای مدیریت پیچیدهترین وظایف چندوجهی در دسترس قرار گرفته است. اگر به دنبال ابزاری هستید که تپههای عظیم داده را تحلیل کند، این مدل با پذیرش متن، تصویر و ویدیو به عنوان ورودی و تولید متن به عنوان خروجی، استانداردهای پردازش را جابهجا کرده است. این پیشرفت در راستای استراتژی توسعه مدلهای عظیم علیبابا است که پیشتر نیز با رونمایی از مدل Qwen3.8-Max در نسخههای پیشنمایش، توجهات جهانی را جلب کرده بود.
مدل Qwen3.8-Max بر پایه معماری ترکیب خبرهها (Mixture of Experts) طراحی شده است. طبق اعلام شرکت علیبابا، استقرار این پرچمدار نیازمند سختافزارهای مقیاس مرکز داده و چند گرهای (Multi-node) است، اما توسعهدهندگان میتوانند همین امروز از طریق APIهای سازگار با OpenAI و یکپارچگی با DashScope، تنها با تغییر base-url و model-ID به آن دسترسی پیدا کنند.
این عرضه در حالی رخ میدهد که صنعت به سمت قابلیتهای عاملمحور (Agentic) حرکت میکند؛ مدلهایی که فراتر از یک چتبات ساده، گردشکارهای پیچیده در مهندسی نرمافزار و بررسیهای مالی را اجرا میکنند. همانطور که در تحلیل قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، تعادل بین قدرت پردازش و دسترسی محلی همواره یک چالش بوده است. به همین دلیل، برای کسانی که به کلاسترهای پردازشی عظیم دسترسی ندارند، علیبابا هفته آینده نسخه کوچکتر Qwen3.8-27B را منتشر میکند که روی سختافزارهای GPU استاندارد درونسازمانی جای میگیرد. بر اساس مستندات منتشر شده، وزنهای باز هر دو نسخه Max و 27B در هفته آینده در دسترس خواهند بود.
کاربردهای صنعتی
مجموعه قابلیتهای منتشر شده، چهار صنعت کلیدی را هدف قرار داده است: مهندسی نرمافزار، بررسی اسناد حقوقی و مالی، عملیات رسانهای و تجارت الکترونیک، و طراحی. کاربردهای عملی و خاص عبارتند از:
- عاملهای کدنویسی در مقیاس مخزن (Repository-scale)
- پایگاههای دانش برای اسناد بسیار طولانی
- نمایهسازی ویدیوهای بلند
- استخراج دادههای ساختاریافته
- دستیارهای پژوهشی چندمرحلهای
به گزارش marktechpost.com، این مدل پرچمدار از پنجره زمینه (Context Window) یک میلیون توکنی پشتیبانی میکند. حداکثر ورودی ۹۹۱ هزار توکن است که در صورت فعالسازی قابلیت تفکر (Thinking)، این مقدار اندکی کاهش یافته و به ۹۸۳ هزار توکن میرسد. ظرفیت خروجی روی ۱۳۱ هزار توکن محدود شده، در حالی که یک بودجه اختصاصی برای استدلال و زنجیره تفکر به میزان ۲۶۲ هزار توکن در نظر گرفته شده است. محدودیت نرخ درخواستها نیز روی ۲ میلیون توکن در دقیقه و ۱۵ هزار درخواست در دقیقه تنظیم شده است.

مشخصات فنی و قیمتگذاری
- قیمت: ۲ دلار برای هر ۱ میلیون توکن ورودی / ۶ دلار برای هر ۱ میلیون توکن خروجی.
- کشینگ (Caching): خواندن حافظه پنهان ضمنی (Implicit) مبلغ ۰.۲۵ دلار برای هر ۱ میلیون توکن هزینه دارد. ایجاد کش صریح (Explicit) ۲.۵۰ دلار و خواندن کش صریح ۰.۱۷ دلار برای هر ۱ میلیون توکن است. ورودیهای کششده ۸ برابر ارزانتر از ورودیهای تازه هستند؛ این یعنی پایداری پیشوندها (Prefix stability) بیش از طول پرامپت در کاهش هزینهها اثر دارد.
- ابزارهای یکپارچه: API پاسخها شامل ۵ ابزار داخلی است:
code_interpreter(مفسر کد)،web_search(جستجوی وب)،web_extractor(استخراج وب)،t2i_search(جستجوی متن به تصویر) وi2i_search(جستجوی تصویر به تصویر). - قابلیتها: پشتیبانی از فراخوانی تابع (Function Calling)، خروجیهای ساختاریافته، پردازش دستهای (Batches)، تکمیل پیشوند (Prefix completion) و تنظیم دقیق (Fine-tuning).
تحلیل بنچمارکها
در آزمونهای رودررو، Qwen3.8-Max در Terminal-Bench 2.1 امتیاز ۸۶.۶ را کسب کرد و از Claude Opus 4.8 و Claude Fable 5 (هر دو ۸۴.۶) پیشی گرفت، هرچند در برابر GPT-5.6 Sol (max) با امتیاز ۸۸.۸ بازماند. در آزمون SWE-bench Pro امتیاز ۶۷.۷ را ثبت کرد (در مقابل ۸۰.۰ برای Fable 5) و در FrontierSWE امتیاز ۷۳.۵ را به دست آورد (در مقابل ۸۸.۸ برای Fable 5). با این حال، این مدل در PaperBench با امتیاز ۹۳.۰ و IFBench با ۸۲.۸ پیشتازی میکند. در آزمون GPQA Diamond نیز امتیاز ۹۲.۶ ثبت شد که رشد اندکی نسبت به نسخه ۳.۷-Max (۹۲.۴) دارد.
بیشترین رشد این مدل در وظایف چندوجهی و عاملمحور دیده میشود تا استدلال محض. برای مثال، امتیاز DeepSWE از ۲۱.۶ در نسل قبل به ۵۶.۶ جهش کرد. همچنین در بنچمارکهای بینایی-محور تسلط کامل داشت و امتیاز ۸۶.۱ در OSWorld-Verified، ۹۱.۵ در Parametric CAD Bench و ۹۲.۱ در OmniDocBench 1.5 را ثبت کرد. این توانمندیهای بصری تکاملیافتهای از مدلهای پیشین است؛ به گونهای که مثلاً مدل Qwen Image 3.0 Pro در رندر متون چینی درخشیده بود اما در برخی موارد شمارشی با چالش روبرو بود.
سایر جهشهای داخلی شامل FrontierSWE از ۴۰.۷ به ۷۳.۵ و JobBench از ۳۱.۳ به ۵۳.۴ است.
با این حال، دو نکته در دادهها وجود دارد. نخست اینکه بنچمارکهای چندوجهی با Qwen3.7-Plus مقایسه شدهاند نه Qwen3.7-Max، که باعث بزرگنمایی شکاف نسلی میشود. دوم اینکه منحنی مقیاسپذیری RL علیبابا پس از رسیدن به نقطه اوج ۰.۷۲۵ در نزدیکی ۴,۰۰۰ محیط آموزشی، روند نزولی داشت و به ۰.۷۱۹ و سپس ۰.۶۸۹ رسید.
از منظر فنی، تفاوت اصلی نسخه ۳.۸ با ۳.۷ در بهرهوری ترکیب خبرهها و نمایهسازی اسناد طولانی است. پنجره متنی یک میلیون توکنی اجازه میدهد مدل بهعنوان یک عامل کدنویس در مقیاس کل مخزن عمل کند و اساساً شیوه برخورد توسعهدهندگان با کدهای قدیمی (Legacy) را تغییر دهد.
به باور ما، عرضه وزنهای باز هفته آینده باعث میشود مدل 27B انتخاب اول توسعهدهندگان محلی باشد، زیرا پرچمدار ۲.۴ تریلیونی بهدلیل ابعاد عظیم، تنها یک ابزار ابری باقی میماند. نبود دادههای مربوط به تعداد پارامترهای فعال (Activated Parameters) باعث شده هزینه استقرار محلی نسخه Max غیرقابل محاسبه باشد.
توسعهدهندگان باید هفته آینده صفحات رسمی گیتهاب و Hugging Face را برای دریافت وزنهای باز رصد کنند تا بتوانند تنازلات (Trade-offs) مدل 27B را در برابر نسخه API-only Max ارزیابی کنند.
گام بعدی شما
- هفته آینده صفحات گیتهاب و Hugging Face علیبابا را برای دریافت وزنهای باز مدل 27B چک کنید.
- اگر از پروژههای کدنویسی حجیم استفاده میکنید، مدل Max را از طریق API برای تحلیل کل مخزن کد آزمایش کنید.
- هزینه استنتاج خود را با استفاده از قابلیت کشینگ (Caching) بهینه کنید تا هزینه ورودیهای تکراری را ۸ برابر کاهش دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ برای درک چگونگی اجرای چنین مدل عظیمی، به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو