۲.۴ تریلیون پارامتر؛ این مقیاس خیرکنندهی مدل Qwen3.8-2.4T-A95B است که در ۱۲ اوت ۲۰۲۶ منتشر شد تا چشمانداز مدلهای وزنهای باز را به سمت استدلال در مقیاس عظیم تغییر دهد. طبق اعلام تیم توسعه، این نخستین بار است که معماری کلاس Qwen-Max برای دانلود عمومی در دسترس قرار میگیرد تا بهطور خاص برای وظایف عاملمحور (Agentic) با افق زمانی بلند و نیاز به برنامهریزی خودکار بهینه شود. این عرضه در واقع تکملهی مسیر توسعهای است که با معرفی مدل Qwen3.8-Max با ۲.۴ تریلیون پارامتر آغاز شد تا استانداردهای جدیدی در مدلهای MoE تعریف کند.
این عرضه در حالی رخ میدهد که صنعت از رابطهای سادهی چت به سمت عاملهای خودکاری حرکت میکند که قادر به دریافت بازخورد از محیط هستند. همانطور که در تحلیل قبلی ما دربارهی اتوماسیون توزیع مهارتها در Hugging Face Hub 1.27 اشاره کردیم، ظهور مدلی با ۲.۴ تریلیون پارامتر، قدرت شناختی خام لازم برای اجرای واقعی این مهارتهای توزیعشده در مقیاس وسیع را فراهم میکند.
برای یک متخصص فنی، این خبر فراتر از داشتن یک «چتبات 똑똑تر» است؛ ما با یک موتور قابلاعتماد برای مهندسی نرمافزار و پژوهش روبهرو هستیم. تصور کنید سیستمی که تنها یک تکه کد پیشنهاد نمیدهد، بلکه بازسازی یک مخزن کد (Repository) چندمرحلهای را با کمترین دخالت انسانی مدیریت میکند.
جایگاه مدل و زمینهی عرضه
مدل Qwen3.8 توانمندترین نسل از خانوادهی مدلهای باز Qwen تا به امروز است. این مدل بر پایه زیربنای معماری Qwen3.5 و پس از پذیرش گستردهی سریهای Qwen3.5 و Qwen3.6 توسط جامعهی توسعهدهندگان ساخته شده است. در حالی که نسخهی وزنهای باز بسیار قدرتمند است، سرویس رسمی API از طریق Qwen Cloud نسخهی Qwen3.8-Max را ارائه میدهد. این نسخهی مدیریتشده بر اساس همان معماری ۲.۴ تریلیونی است اما قابلیتهای حیاتی مانند ورودیهای بینایی، پشتیبانی از حالت غیر-تفکری و پنجرهی زمینه پیشفرض ۱ میلیون توکنی را اضافه میکند.
هدف اصلی این مدل، فراتر رفتن از پاسخ به سؤالات دشوار است. هدف مرکزی، به سرانجام رساندن وظایف پیچیده و چندمرحلهای با قابلیت اطمینان بالاتر است. بر اساس مستندات فنی، این امر از طریق بهبودهای جامع در کدنویسی، کارهای حرفهای، پژوهش و وظایف عاملمحور بلندمدت، با پشتیبانی از برنامهریزی خودکار قویتر و مدیریت بهتر بازخوردهای محیطی محقق شده است.
سازگاری و یکپارچهسازی
برای تسریع در پذیرش، Qwen3.8 پشتیبانی گستردهتری از ابزارهای توسعه و هارنسهای محبوب ارائه میدهد تا یکپارچهسازی با پشتههای نرمافزاری موجود با کمترین اصطکاک صورت گیرد. وزنهای مدل و فایلهای پیکربندی در قالب Transformers شرکت Hugging Face ارائه شدهاند.
این خروجیها با چندین چارچوب استنتاج با کارایی بالا کاملاً سازگار هستند، از جمله:
- vLLM
- SGLang
- TokenSpeed
مشخصات معماری
به نقل از مستندات فنی در Hugging Face، مدل Qwen3.8 از یک طراحی پیچیدهی ترکیب خبرهها (Mixture of Experts - MoE) استفاده میکند. این مدل در مجموع دارای ۲.۴ تریلیون پارامتر است، اما برای حفظ کارایی در استنتاج (Inference)، در هر توکن تنها ۹۵ میلیارد پارامتر فعال میشوند.
جزئیات کلیدی معماری عبارتند از:
- نوع: مدل زبانی خودبازگشتی (Causal Language Model)
- مرحله آموزش: مدل زبانی پیشآموزشدیده و پسآموزشدیده
- ساختار لایهها: ۹۲ لایه با ساختار ترکیبی: ۲۳ × (۳ × (Gated DeltaNet ← MoE) ← ۱ × (Gated Attention ← MoE))
- پیکربندی MoE: ۵۱۲ خبرهی کل، با ۱۰ خبرهی مسیریابیشده و ۱ خبرهی مشترک که در هر توکن فعال میشوند. بُعد میانی ۲۰۴۸ است.
- پنجرهی زمینه (Context Window): طول بومی ۲۶۲,۱۴۴ توکن که تا ۱,۰۱۰,۰۰۰ توکن قابل گسترش است.
- پیشبینی چند-توکنی (MTP): مدل برای بهبود انسجام و سرعت، با گامهای پیشبینی متعدد آموزش دیده است.
- بُعد پنهان: ۸۱۹۲ با جاسازی توکنهای پد شده ۲۴۸,۳۲۰.
- خروجی LM: ۲۴۸,۳۲۰ (Padded).
تحلیل اجزای تخصصی
برای درک کارایی مقیاس ۲.۴ تریلیونی، باید به مکانیزمهای توجه (Attention) نگاه کرد:
- Gated DeltaNet:
- ۱۲۸ سر توجه خطی برای V
- ۱۶ سر توجه خطی برای QK
- بُعد سر: ۱۲۸
- Gated Attention:
- ۶۴ سر توجه برای Q
- ۴ سر توجه برای KV
- بُعد سر: ۲۵۶
- بُعد رمزگذاری موقعیت دورانی (RoPE): ۶۴
عملکرد در کدنویسی و محیطهای عاملمحور
ارزش اصلی این مدل در عملکرد آن در محیطهای «عاملمحور» نهفته است. در محک Coding Agent Terminal Bench 2.1، مدل Qwen3.8-Max امتیاز ۸۶.۶ را کسب کرد که بهطور قابلتوجهی از نسل قبلی (Qwen3.7-Max با ۷۴.۵) بالاتر است و با مدلهای تجاری مانند GPT-5.6 Sol (۸۸.۸) رقابت میکند. این ارزیابی با استفاده از Claude Code (avg@10) و با مهلت زمانی ۵ ساعت و حداکثر توکن ۱۳۱,۰۷۲ انجام شده است.
سایر نتایج بنچمارکها عبارتند از:
- FrontierSWE: امتیاز ۷۳.۵ (جهشی عظیم نسبت به ۴۰.۷ در Qwen3.7-Max) بر اساس دادههای MEAN@5 تا تاریخ ۳ اوت ۲۰۲۶.
- PaperBench: کسب امتیاز ۹۳.۰ که بالاترین نمره در میان مدلهای مقایسهای، از جمله Claude Opus 4.8 (۸۰.۳) است. این ارزیابی در تنظیمات BasicAgent و حالت Code-Dev انجام شده است.
- GPQA Diamond: حفظ امتیاز سطح بالای ۹۲.۶ که نشاندهنده استدلال علمی قوی در سطح تحصیلات تکمیلی است.
- MRCR v2 (256K): امتیاز ۹۲.۹ در آزمون ۸-سوزنی، که توانایی بازیابی اطلاعات در زمینههای متنی عظیم را اثبات میکند.
- NL2Repo-Bench: امتیاز ۵۵.۹ با استفاده از هارنس Claude Code و محدودیت دستورات Bash برای جلوگیری از سوءاستفاده از پاداش (Reward Hacking).
بررسی عمیق بنچمارکهای تخصصی
مدل Qwen3.8 در چندین محک داخلی و عمومی تسلط خود را نشان داده است:
- مهندسی نرمافزار:
- SWE-bench Pro: امتیاز ۶۷.۷ (برتر از ۶۰.۶ در Qwen3.7-Max) با پنجره زمینه ۲۵۶ هزار توکنی.
- DeepSWE 1.1: امتیاز ۵۶.۶، جایی که بهترین عملکرد را با استفاده از هارنس Claude Code داشت.
- کدنویسی داخلی:
- QwenSWEBench: امتیاز ۸۰.۷ (میانگین در ۳ تلاش، مهلت ۸ ساعت، زمینه ۲۵۶ هزار توکنی).
- QwenQoderBench: امتیاز ۵۸.۴ (میانگین در ۵ تلاش، مهلت ۶ ساعت، زمینه ۲۵۶ هزار توکنی).
- QwenReactBench: رتبه Elo ۱۷۲۴ (دوزبانه انگلیسی/چینی).
- QwenSVGBench: رتبه Elo ۱۷۱۳ (دوزبانه انگلیسی/چینی).
- عاملهای عمومی:
- CoWorkBench: امتیاز ۷۴.۸ در ارزیابی وظایف بلندمدت در حوزههای علوم کامپیوتر، مالی، حقوق و پزشکی.
- WorkSpaceBench: امتیاز ۶۷.۷
- JobBench: امتیاز ۵۳.۴
- SkillsBench: امتیاز ۷۰.۲ (ارزیابی شده در نسخه v1.1 در ۸۷ وظیفه مختلف).
- Automation-Bench (Pass@1): امتیاز ۲۷.۳
- Toolathlon Verified (Pass@1): امتیاز ۷۲.۵
- حوزههای حرفهای:
- PLawBench: امتیاز ۷۳.۲ (ارزیابی شده توسط gemini-3.1-pro-preview).
- PRBench-Finance: امتیاز ۵۸.۳
- HealthBench: امتیاز ۶۰.۲
- IFBench: امتیاز ۸۲.۸
- $OneMillion-Bench: امتیاز ۵۲.۵ (نمره خبره).
کنترل تفکر و استنتاج
برخلاف مدلهای زبانی استاندارد، Qwen3.8-2.4T-A95B یک مدل صرفاً متنی است که برای تمام تعاملات، «حالت تفکر» را اجباری میکند. هر پاسخ با استدلال داخلی محصور در تگهای <think> آغاز میشود که غیرقابل غیرفعال کردن است. ورودیهای چندوجهی در این نسخه پشتیبانی نمیشوند.
توسعهدهندگان میتوانند عمق این استدلال را با پارامتر reasoning_effort تنظیم کنند:
xhigh(پیشفرض): برای وظایف پیچیده که نیاز به تحلیل جامع دارند.medium: تعادل بین دقت و سرعت.low: استدلال بهینه برای سرعت و هزینه.
برای جلوگیری از گم شدن رشته افکار مدل در گفتگوهای طولانی، قابلیت preserve_thinking بهطور پیشفرض فعال است تا زمینه استدلال از پیامهای پیشین در طول جلسه حفظ شود.
استقرار و یکپارچهسازی
تیم Qwen برای بارهای کاری تولیدی، استفاده از موتورهای سرویسدهی اختصاصی را توصیه میکند. این مدل با vLLM، SGLang و TokenSpeed سازگار است.
برای دستیابی به بهینه ترین عملکرد، پارامترهای نمونهگیری زیر پیشنهاد میشود:
- Temperature: 1.0
- Top_p: 0.95
- Top_k: 20
- Min_p: 0.0
- Presence_penalty: 0.0 (قابل تنظیم بین ۰ تا ۲ برای کاهش تکرار، هرچند مقادیر بالا ممکن است باعث اختلاط زبانی شود)
- Repetition_penalty: 1.0
برای بهینهسازی عملکرد عاملمحور، تخصیص توکنهای زیر در پنجره زمینه ۱ میلیون توکنی پیشنهاد میشود:
- محتوای استدلال: حداکثر طول خروجی ۲۶۲,۱۴۴ توکن.
- پاسخ نهایی: حداکثر طول خروجی ۱۳۱,۰۷۲ توکن.
این تنظیمات مانع از آن میشود که مدل پیش از رسیدن به نتیجه، فرآیند استدلال خود را قطع کند.
تحلیل: تغییر قدرت در مدلهای وزنهای باز
این عرضه بهطور بنیادی این فرض را تغییر میدهد که استدلال در «کلاس Max» تنها در انحصار APIهای بسته است. علیبابا با انتشار یک مدل MoE با ۲.۴ تریلیون پارامتر، نقشهای را برای جامعه توسعهدهندگان فراهم کرده است تا بفهمند چگونه میتوان استدلال را بدون غیرممکن کردن استنتاج برای کلاسترهای محلی پیشرفته، مقیاس کرد.
برای توسعهدهنده، تغییر از «پرامپتنویسی» به «ارکستراسیون» است. گنجاندن کنترلهای reasoning_effort به این معناست که اکنون میتوانیم با استدلال LLM به عنوان یک منبع محاسباتی قابل تنظیم برخورد کنیم؛ یعنی زمان «تفکر» بیشتری را صرف یک رفع باگ حیاتی و زمان کمتری را صرف خلاصهسازی یک ایمیل روتین کنیم.
این حرکت فشار شدیدی بر سایر ارائهدهندگان مدلهای وزنهای باز وارد میکند تا اگر میخواهند در فضای عاملهای خودکار رقابت کنند، از محدوده ۷۰ تا ۴۰۰ میلیارد پارامتر فراتر روند. گلوگاه دیگر تنها دادهها نیستند، بلکه ظرفیت معماری برای مدیریت برنامهریزیهای چندمرحلهای است.
برای مشاهده این قابلیتها در عمل، میتوانید وزنها را از طریق vLLM مستقر کنید یا نسخه مدیریتشده را از طریق Qwen Cloud تست کنید تا سطوح reasoning_effort را در وظایف پیچیده کدنویسی خود مقایسه نمایید.
گام بعدی شما
- اگر از مدلهای باز برای کدنویسی استفاده میکنید، وزنهای Qwen3.8 را از طریق vLLM مستقر کنید تا تفاوت استدلال در مقیاس ۲.۴ تریلیونی را تجربه کنید.
- پارامتر
reasoning_effortرا در وظایف مختلف تست کنید تا نقطه بهینه بین هزینه محاسباتی و دقت استدلال را برای پروژه خود بیابید. - عملکرد مدل را در محیطهای عاملمحور با استفاده از هارنس Claude Code بسنجید تا میزان استقلال مدل در مدیریت مخازن کد را ارزیابی کنید.
اما داستان سختافزاری لازم برای اجرای چنین غولی حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell و بهینهسازیهای حافظه HBM مراجعه کنید.




گفتگو