پرش به محتوای اصلی
پرش به محتوای مقاله

«بهینه‌سازی شدید استنتاج»؛ هدف علی‌بابا از معرفی Qwen3.8-Flash-Next

·۴ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
پیش‌نمایش معماری Qwen4 با ۶ میلیارد پارامتر فعال در Qwen3.8-Flash-Next
پیش‌نمایش معماری Qwen4 با ۶ میلیارد پارامتر فعال در Qwen3.8-Flash-Next
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی Qwen Sparse Attention (QSA) که برخلاف توجه پراکنده سنتی، در سطح میکرو-بلاک عمل می‌کند تا تأخیر در پنجره‌های متنی میلیونی را کاهش دهد.

تصور کنید مدلی با دانش یک غول ۱۲۵ میلیارد پارامتری داشته باشید که با سرعت و هزینه یک مدل کوچک ۶ میلیاردی اجرا شود. این همان وعده‌ای است که علی‌بابا با معرفی مدل آزمایشی Qwen3.8-Flash-Next در ۲۶ اوت ۲۰۲۶ به جامعه هوش مصنوعی داد. مقیاس این مدل توسط ۱۲۵ میلیارد پارامتر تعریف شده است، اما از یک استراتژی فعال‌سازی بسیار پراکنده (Highly Sparse Activation) استفاده می‌کند تا برای هر توکن، تنها ۶ میلیارد پارامتر فعال را به کار بگیرد.

طبق اعلام تیم Qwen، این مدل با وزن‌های باز (Open Weights) منتشر شده و در واقع یک پیش‌نمایش عمومی از زیربنای معماری است که برای سری آینده یعنی Qwen4 در نظر گرفته شده است. این مدل تحت برند «Flash» عرضه شده، اما هدف اصلی آن نمایش مبانی ساختاری است. استراتژی علی‌بابا در اینجا تغییر مسیر به سمت «بهینگی مطلق هزینه» است؛ یعنی اولویت دادن به کاهش هزینه‌های استنتاج (Inference) بدون از دست دادن ظرفیتی که یک استخر بزرگ از پارامترها فراهم می‌کند. این رویکرد در تضاد با مدل‌های عظیم‌الجثه است، مانند مدل Qwen3.8-Max با ۲.۴ تریلیون پارامتر که پیش‌تر برای دستیابی به حداکثر توان پردازشی معرفی شده بود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های MoE اشاره کردیم، صنعت اکنون از مرحله‌ی «بزرگ‌تر، بهتر است» به مرحله‌ی «کارآمدتر، مقیاس‌پذیرتر است» رسیده است. این مدل یک مدل زبانی خودبازگشتی (Causal Language Model) است که با یک رمزگذار بینایی (Vision Encoder) ادغام شده و مراحل پیش‌آموزش و پس‌آموزش گسترده‌ای را پشت سر گذاشته است.

یکی از خیره‌کننده‌ترین مشخصات این مدل، پنجرهٔ زمینه (Context Window) بومی ۲۶۲,۱۴۴ توکنی است که به گفته سازندگان، تا ۱ میلیون توکن نیز قابل گسترش است. بر اساس مستندات فنی، تمرکز علی‌بابا بر روی کارایی به جای رکوردشکنی در بنچمارک‌های خام است؛ چرا که علی‌بابا سیگنال می‌دهد مرز بعدی توسعه LLMها تنها افزایش هوش نیست، بلکه پایدار کردن این هوش برای بارهای کاری عامل‌محور (Agentic) است. در حالی که عامل‌های هوش مصنوعی به‌طور فزاینده‌ای وظایف با زمینه طولانی — مانند تحلیل کدهای حجیم یا اسناد طولانی — را بر عهده می‌گیرند، هزینه استنتاج به گلوگاه اصلی برای استقرار در مقیاس بزرگ تبدیل می‌شود. این تمرکز بر قابلیت‌های عامل‌محور، در ادامه مسیر مدل Qwen3.8-27B است که پیش‌تر در وظایف چندوجهی عملکردی خیره‌کننده از خود نشان داد.

به نقل از کارت مدل، چهار نوآوری معماری کلیدی در این نسخه به چشم می‌خورد:

  • توجه پراکنده Qwen (QSA): این برجسته‌ترین نوآوری است. در حالی که مدل‌های ترکیبی قبلی Qwen، مدل Gated DeltaNet را با Gated Attention ترکیب می‌کردند، Qwen3.8-Flash-Next سیستم QSA را معرفی می‌کند. برخلاف روش‌های سنتی توجه پراکنده که توکن‌های تک‌به‌تک را انتخاب می‌کنند، QSA در سطح «میکرو-بلاک» عمل می‌کند. این تغییر ساختاری برای کاهش شدید تأخیر (Latency) در هنگام پردازش زمینه‌های طولانی طراحی شده است.
  • ساختار لایه‌ای ترکیبی: ۴۸ لایه مدل در یک الگوی تکرارشونده سازمان یافته‌اند؛ سه بلوک Gated DeltaNet که به یک لایه ترکیب خبره‌ها (MoE) متصل می‌شوند و سپس یک بلوک QSA که به MoE دیگری می‌رود. این چرخه دوازده بار در سراسر شبکه تکرار می‌شود.
  • مکانیزم باقی‌مانده گیت‌دار: این سیستم جریان اطلاعات را از طریق جریان‌های باقی‌مانده عریض (Widened Residual Streams) تنظیم می‌کند. این کار با استفاده از ترکیبی از یک گیت خواندن (Read Gate) داده‌محور و المان‌به-المان، و یک گیت نوشتن (Write Gate) اسکالر برای هر شاخه انجام می‌شود. طبق کارت مدل، این سیستم به شبکه اجازه می‌دهد تا به بیانگری (Expressiveness) دقیق‌تری در لایه‌های خود دست یابد، در حالی که پایداری آموزش حفظ شده و سربار محاسباتی استنتاج در کمترین حالت باقی می‌ماند. این امر نشان‌دهنده حرکت به سمت مسیریابی پویا (Dynamic Routing) در بلوک‌های ترنسفورمر است تا مدل «تصمیم بگیرد» کدام اطلاعات برای حفظ شدن در لایه‌ها حیاتی هستند.
  • بردار‌های معنایی n-gram: مدل از جاسازی‌های n-gram برای بهبود نمایش توالی‌های رایج توکن‌ها استفاده می‌کند تا مراحل اولیه خط لوله پردازش را بیش از پیش بهینه کند.

علی‌بابا با ترکیب این چهار ستون — QSA، باقی‌مانده‌های گیت‌دار، جاسازی‌های n-gram و ساختار MoE بسیار پراکنده — تلاش می‌کند تا مشکل «دیوار حافظه» (Memory Wall) و هزینه‌های محاسباتی مدل‌های عظیم را حل کند. نتیجه، مدلی است که دانش نهفته یک سیستم ۱۲۵ میلیارد پارامتری را دارد اما پروفایل هزینه و سرعت آن شبیه به یک مدل ۶ میلیارد پارامتری است. در حالی که صنعت به سمت عامل‌های خودمختاری می‌رود که نیاز به پردازش مداوم حجم عظیمی از زمینه دارند، معماری Qwen4 نشان می‌دهد که پراکندگی و توجه ترکیبی، ابزارهای غالب برای دستیابی به هوش مقیاس‌پذیر خواهند بود. این استراتژی تکامل‌یافته‌ای از رویکرد علی‌بابا در استفاده از ۲.۴ تریلیون پارامتر برای اجرای وظایف پیچیده عامل‌محور است که اکنون به سمت بهینگی عملیاتی سوق یافته است.

گام بعدی شما

  • اگر روی توسعه عامل‌های AI با متون طولانی کار می‌کنید، مدل Flash-Next را برای تست تأخیر (Latency) در مقایسه با مدل‌های متراکم امتحان کنید.
  • مستندات QSA را بررسی کنید تا متوجه شوید چگونه پردازش در سطح میکرو-بلاک می‌تواند هزینه KV Cache شما را کاهش دهد.
  • منتظر انتشار نسخه نهایی Qwen4 باشید تا ببینید آیا این بهینگی‌ها در مدل‌های بزرگ‌تر نیز تکرار می‌شوند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و پشتیبانی از مدل‌های MoE مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با کاهش چشمگیر هزینه استنتاج در متون طولانی، استقرار عامل‌های هوش مصنوعی در مقیاس صنعتی را ممکن می‌کند. اعتبار این ادعا از طریق انتشار وزن‌های باز مدل برای جامعه پژوهشی قابل تأیید است.

تأثیر برای ایران

به‌دلیل وزن‌های باز بودن مدل، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای محدود، این معماری بهینه را روی سخت‌افزارهای محلی برای پردازش اسناد حجیم فارسی پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

تغییر استراتژی علی‌بابا از رقابت در بنچمارک‌های هوش به رقابت در «اقتصاد استنتاج» نشان می‌دهد که مدل‌های زبانی به مرحله بلوغ عملیاتی رسیده‌اند. استفاده از QSA در سطح میکرو-بلاک، احتمالا پاسخی به محدودیت‌های حافظه در پردازش‌های میلیونی است که مدل‌های فعلی را در محیط‌های تولیدی (Production) ناکارآمد می‌کند. این رویکرد، تعریف «مدل بزرگ» را از تعداد پارامترهای کل به تعداد پارامترهای فعال تغییر می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.