پرش به محتوای اصلی
پرش به محتوای مقاله

علی‌بابا: ۲.۴ تریلیون پارامتر برای اجرای وظایف عامل‌محور در Qwen3.8

·۲۱ مرداد ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
صفحه مدل زبانی کیوئن ۳.۸-۲.۴T-A95B در پلتفرم هاگینگ‌فیس
صفحه مدل زبانی کیوئن ۳.۸-۲.۴T-A95B در پلتفرم هاگینگ‌فیس
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین عرضه عمومی مدل کلاس Max با ۲.۴ تریلیون پارامتر در قالب وزن‌های باز — انتقال قابلیت‌های استدلال سطح سازمانی از APIهای بسته به زیرساخت‌های محلی.

۲.۴ تریلیون پارامتر؛ این مقیاس خیرکننده‌ی مدل Qwen3.8-2.4T-A95B است که در ۱۲ اوت ۲۰۲۶ منتشر شد تا چشم‌انداز مدل‌های وزن‌های باز را به سمت استدلال در مقیاس عظیم تغییر دهد. طبق اعلام تیم توسعه، این نخستین بار است که معماری کلاس Qwen-Max برای دانلود عمومی در دسترس قرار می‌گیرد تا به‌طور خاص برای وظایف عامل‌محور (Agentic) با افق زمانی بلند و نیاز به برنامه‌ریزی خودکار بهینه شود. این عرضه در واقع تکمله‌ی مسیر توسعه‌ای است که با معرفی مدل Qwen3.8-Max با ۲.۴ تریلیون پارامتر آغاز شد تا استانداردهای جدیدی در مدل‌های MoE تعریف کند.

این عرضه در حالی رخ می‌دهد که صنعت از رابط‌های ساده‌ی چت به سمت عامل‌های خودکاری حرکت می‌کند که قادر به دریافت بازخورد از محیط هستند. همان‌طور که در تحلیل قبلی ما درباره‌ی اتوماسیون توزیع مهارت‌ها در Hugging Face Hub 1.27 اشاره کردیم، ظهور مدلی با ۲.۴ تریلیون پارامتر، قدرت شناختی خام لازم برای اجرای واقعی این مهارت‌های توزیع‌شده در مقیاس وسیع را فراهم می‌کند.

برای یک متخصص فنی، این خبر فراتر از داشتن یک «چت‌بات 똑똑‌تر» است؛ ما با یک موتور قابل‌اعتماد برای مهندسی نرم‌افزار و پژوهش رو‌به‌رو هستیم. تصور کنید سیستمی که تنها یک تکه کد پیشنهاد نمی‌دهد، بلکه بازسازی یک مخزن کد (Repository) چندمرحله‌ای را با کمترین دخالت انسانی مدیریت می‌کند.

جایگاه مدل و زمینه‌ی عرضه

مدل Qwen3.8 توانمندترین نسل از خانواده‌ی مدل‌های باز Qwen تا به امروز است. این مدل بر پایه زیربنای معماری Qwen3.5 و پس از پذیرش گسترده‌ی سری‌های Qwen3.5 و Qwen3.6 توسط جامعه‌ی توسعه‌دهندگان ساخته شده است. در حالی که نسخه‌ی وزن‌های باز بسیار قدرتمند است، سرویس رسمی API از طریق Qwen Cloud نسخه‌ی Qwen3.8-Max را ارائه می‌دهد. این نسخه‌ی مدیریت‌شده بر اساس همان معماری ۲.۴ تریلیونی است اما قابلیت‌های حیاتی مانند ورودی‌های بینایی، پشتیبانی از حالت غیر-تفکری و پنجره‌ی زمینه پیش‌فرض ۱ میلیون توکنی را اضافه می‌کند.

هدف اصلی این مدل، فراتر رفتن از پاسخ به سؤالات دشوار است. هدف مرکزی، به سرانجام رساندن وظایف پیچیده و چندمرحله‌ای با قابلیت اطمینان بالاتر است. بر اساس مستندات فنی، این امر از طریق بهبودهای جامع در کدنویسی، کارهای حرفه‌ای، پژوهش و وظایف عامل‌محور بلندمدت، با پشتیبانی از برنامه‌ریزی خودکار قوی‌تر و مدیریت بهتر بازخوردهای محیطی محقق شده است.

سازگاری و یکپارچه‌سازی

برای تسریع در پذیرش، Qwen3.8 پشتیبانی گسترده‌تری از ابزارهای توسعه و هارنس‌های محبوب ارائه می‌دهد تا یکپارچه‌سازی با پشته‌های نرم‌افزاری موجود با کمترین اصطکاک صورت گیرد. وزن‌های مدل و فایل‌های پیکربندی در قالب Transformers شرکت Hugging Face ارائه شده‌اند.

این خروجی‌ها با چندین چارچوب استنتاج با کارایی بالا کاملاً سازگار هستند، از جمله:

  • vLLM
  • SGLang
  • TokenSpeed

مشخصات معماری

به نقل از مستندات فنی در Hugging Face، مدل Qwen3.8 از یک طراحی پیچیده‌ی ترکیب خبره‌ها (Mixture of Experts - MoE) استفاده می‌کند. این مدل در مجموع دارای ۲.۴ تریلیون پارامتر است، اما برای حفظ کارایی در استنتاج (Inference)، در هر توکن تنها ۹۵ میلیارد پارامتر فعال می‌شوند.

جزئیات کلیدی معماری عبارتند از:

  • نوع: مدل زبانی خودبازگشتی (Causal Language Model)
  • مرحله آموزش: مدل زبانی پیش‌آموزش‌دیده و پس‌آموزش‌دیده
  • ساختار لایه‌ها: ۹۲ لایه با ساختار ترکیبی: ۲۳ × (۳ × (Gated DeltaNet ← MoE) ← ۱ × (Gated Attention ← MoE))
  • پیکربندی MoE: ۵۱۲ خبره‌ی کل، با ۱۰ خبره‌ی مسیریابی‌شده و ۱ خبره‌ی مشترک که در هر توکن فعال می‌شوند. بُعد میانی ۲۰۴۸ است.
  • پنجره‌ی زمینه (Context Window): طول بومی ۲۶۲,۱۴۴ توکن که تا ۱,۰۱۰,۰۰۰ توکن قابل گسترش است.
  • پیش‌بینی چند-توکنی (MTP): مدل برای بهبود انسجام و سرعت، با گام‌های پیش‌بینی متعدد آموزش دیده است.
  • بُعد پنهان: ۸۱۹۲ با جاسازی توکن‌های پد شده ۲۴۸,۳۲۰.
  • خروجی LM: ۲۴۸,۳۲۰ (Padded).

تحلیل اجزای تخصصی

برای درک کارایی مقیاس ۲.۴ تریلیونی، باید به مکانیزم‌های توجه (Attention) نگاه کرد:

  • Gated DeltaNet:
    • ۱۲۸ سر توجه خطی برای V
    • ۱۶ سر توجه خطی برای QK
    • بُعد سر: ۱۲۸
  • Gated Attention:
    • ۶۴ سر توجه برای Q
    • ۴ سر توجه برای KV
    • بُعد سر: ۲۵۶
    • بُعد رمزگذاری موقعیت دورانی (RoPE): ۶۴

عملکرد در کدنویسی و محیط‌های عامل‌محور

ارزش اصلی این مدل در عملکرد آن در محیط‌های «عامل‌محور» نهفته است. در محک Coding Agent Terminal Bench 2.1، مدل Qwen3.8-Max امتیاز ۸۶.۶ را کسب کرد که به‌طور قابل‌توجهی از نسل قبلی (Qwen3.7-Max با ۷۴.۵) بالاتر است و با مدل‌های تجاری مانند GPT-5.6 Sol (۸۸.۸) رقابت می‌کند. این ارزیابی با استفاده از Claude Code (avg@10) و با مهلت زمانی ۵ ساعت و حداکثر توکن ۱۳۱,۰۷۲ انجام شده است.

سایر نتایج بنچمارک‌ها عبارتند از:

  • FrontierSWE: امتیاز ۷۳.۵ (جهشی عظیم نسبت به ۴۰.۷ در Qwen3.7-Max) بر اساس داده‌های MEAN@5 تا تاریخ ۳ اوت ۲۰۲۶.
  • PaperBench: کسب امتیاز ۹۳.۰ که بالاترین نمره در میان مدل‌های مقایسه‌ای، از جمله Claude Opus 4.8 (۸۰.۳) است. این ارزیابی در تنظیمات BasicAgent و حالت Code-Dev انجام شده است.
  • GPQA Diamond: حفظ امتیاز سطح بالای ۹۲.۶ که نشان‌دهنده استدلال علمی قوی در سطح تحصیلات تکمیلی است.
  • MRCR v2 (256K): امتیاز ۹۲.۹ در آزمون ۸-سوزنی، که توانایی بازیابی اطلاعات در زمینه‌های متنی عظیم را اثبات می‌کند.
  • NL2Repo-Bench: امتیاز ۵۵.۹ با استفاده از هارنس Claude Code و محدودیت دستورات Bash برای جلوگیری از سوءاستفاده از پاداش (Reward Hacking).

بررسی عمیق بنچمارک‌های تخصصی

مدل Qwen3.8 در چندین محک داخلی و عمومی تسلط خود را نشان داده است:

  • مهندسی نرم‌افزار:
    • SWE-bench Pro: امتیاز ۶۷.۷ (برتر از ۶۰.۶ در Qwen3.7-Max) با پنجره زمینه ۲۵۶ هزار توکنی.
    • DeepSWE 1.1: امتیاز ۵۶.۶، جایی که بهترین عملکرد را با استفاده از هارنس Claude Code داشت.
  • کدنویسی داخلی:
    • QwenSWEBench: امتیاز ۸۰.۷ (میانگین در ۳ تلاش، مهلت ۸ ساعت، زمینه ۲۵۶ هزار توکنی).
    • QwenQoderBench: امتیاز ۵۸.۴ (میانگین در ۵ تلاش، مهلت ۶ ساعت، زمینه ۲۵۶ هزار توکنی).
    • QwenReactBench: رتبه Elo ۱۷۲۴ (دوزبانه انگلیسی/چینی).
    • QwenSVGBench: رتبه Elo ۱۷۱۳ (دوزبانه انگلیسی/چینی).
  • عامل‌های عمومی:
    • CoWorkBench: امتیاز ۷۴.۸ در ارزیابی وظایف بلندمدت در حوزه‌های علوم کامپیوتر، مالی، حقوق و پزشکی.
    • WorkSpaceBench: امتیاز ۶۷.۷
    • JobBench: امتیاز ۵۳.۴
    • SkillsBench: امتیاز ۷۰.۲ (ارزیابی شده در نسخه v1.1 در ۸۷ وظیفه مختلف).
    • Automation-Bench (Pass@1): امتیاز ۲۷.۳
    • Toolathlon Verified (Pass@1): امتیاز ۷۲.۵
  • حوزه‌های حرفه‌ای:
    • PLawBench: امتیاز ۷۳.۲ (ارزیابی شده توسط gemini-3.1-pro-preview).
    • PRBench-Finance: امتیاز ۵۸.۳
    • HealthBench: امتیاز ۶۰.۲
    • IFBench: امتیاز ۸۲.۸
    • $OneMillion-Bench: امتیاز ۵۲.۵ (نمره خبره).

کنترل تفکر و استنتاج

برخلاف مدل‌های زبانی استاندارد، Qwen3.8-2.4T-A95B یک مدل صرفاً متنی است که برای تمام تعاملات، «حالت تفکر» را اجباری می‌کند. هر پاسخ با استدلال داخلی محصور در تگ‌های <think> آغاز می‌شود که غیرقابل غیرفعال کردن است. ورودی‌های چندوجهی در این نسخه پشتیبانی نمی‌شوند.

توسعه‌دهندگان می‌توانند عمق این استدلال را با پارامتر reasoning_effort تنظیم کنند:

  • xhigh (پیش‌فرض): برای وظایف پیچیده که نیاز به تحلیل جامع دارند.
  • medium: تعادل بین دقت و سرعت.
  • low: استدلال بهینه برای سرعت و هزینه.

برای جلوگیری از گم شدن رشته افکار مدل در گفتگوهای طولانی، قابلیت preserve_thinking به‌طور پیش‌فرض فعال است تا زمینه استدلال از پیام‌های پیشین در طول جلسه حفظ شود.

استقرار و یکپارچه‌سازی

تیم Qwen برای بارهای کاری تولیدی، استفاده از موتورهای سرویس‌دهی اختصاصی را توصیه می‌کند. این مدل با vLLM، SGLang و TokenSpeed سازگار است.

برای دستیابی به بهینه ترین عملکرد، پارامترهای نمونه‌گیری زیر پیشنهاد می‌شود:

  • Temperature: 1.0
  • Top_p: 0.95
  • Top_k: 20
  • Min_p: 0.0
  • Presence_penalty: 0.0 (قابل تنظیم بین ۰ تا ۲ برای کاهش تکرار، هرچند مقادیر بالا ممکن است باعث اختلاط زبانی شود)
  • Repetition_penalty: 1.0

برای بهینه‌سازی عملکرد عامل‌محور، تخصیص توکن‌های زیر در پنجره زمینه ۱ میلیون توکنی پیشنهاد می‌شود:

  • محتوای استدلال: حداکثر طول خروجی ۲۶۲,۱۴۴ توکن.
  • پاسخ نهایی: حداکثر طول خروجی ۱۳۱,۰۷۲ توکن.

این تنظیمات مانع از آن می‌شود که مدل پیش از رسیدن به نتیجه، فرآیند استدلال خود را قطع کند.

تحلیل: تغییر قدرت در مدل‌های وزن‌های باز

این عرضه به‌طور بنیادی این فرض را تغییر می‌دهد که استدلال در «کلاس Max» تنها در انحصار APIهای بسته است. علی‌بابا با انتشار یک مدل MoE با ۲.۴ تریلیون پارامتر، نقشه‌ای را برای جامعه توسعه‌دهندگان فراهم کرده است تا بفهمند چگونه می‌توان استدلال را بدون غیرممکن کردن استنتاج برای کلاسترهای محلی پیشرفته، مقیاس کرد.

برای توسعه‌دهنده، تغییر از «پرامپت‌نویسی» به «ارکستراسیون» است. گنجاندن کنترل‌های reasoning_effort به این معناست که اکنون می‌توانیم با استدلال LLM به عنوان یک منبع محاسباتی قابل تنظیم برخورد کنیم؛ یعنی زمان «تفکر» بیشتری را صرف یک رفع باگ حیاتی و زمان کمتری را صرف خلاصه‌سازی یک ایمیل روتین کنیم.

این حرکت فشار شدیدی بر سایر ارائه‌دهندگان مدل‌های وزن‌های باز وارد می‌کند تا اگر می‌خواهند در فضای عامل‌های خودکار رقابت کنند، از محدوده ۷۰ تا ۴۰۰ میلیارد پارامتر فراتر روند. گلوگاه دیگر تنها داده‌ها نیستند، بلکه ظرفیت معماری برای مدیریت برنامه‌ریزی‌های چندمرحله‌ای است.

برای مشاهده این قابلیت‌ها در عمل، می‌توانید وزن‌ها را از طریق vLLM مستقر کنید یا نسخه مدیریت‌شده را از طریق Qwen Cloud تست کنید تا سطوح reasoning_effort را در وظایف پیچیده کدنویسی خود مقایسه نمایید.

گام بعدی شما

  • اگر از مدل‌های باز برای کدنویسی استفاده می‌کنید، وزن‌های Qwen3.8 را از طریق vLLM مستقر کنید تا تفاوت استدلال در مقیاس ۲.۴ تریلیونی را تجربه کنید.
  • پارامتر reasoning_effort را در وظایف مختلف تست کنید تا نقطه بهینه بین هزینه محاسباتی و دقت استدلال را برای پروژه خود بیابید.
  • عملکرد مدل را در محیط‌های عامل‌محور با استفاده از هارنس Claude Code بسنجید تا میزان استقلال مدل در مدیریت مخازن کد را ارزیابی کنید.

اما داستان سخت‌افزاری لازم برای اجرای چنین غولی حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و بهینه‌سازی‌های حافظه HBM مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار معماری MoE، ثابت می‌کند که می‌توان استدلال پیچیده را بدون غیرممکن کردن استنتاج برای خوشه‌های محلی مقیاس کرد. این یک نقطه عطف برای توسعه عامل‌های خودکاری است که نیاز به ظرفیت معماری بالا برای برنامه‌ریزی چندمرحله‌ای دارند.

تأثیر برای ایران

به‌دلیل نیاز به سخت‌افزار بسیار قدرتمند (GPUهای متعدد با VRAM بالا) برای اجرای مدل ۲.۴ تریلیونی، دسترسی توسعه‌دهندگان ایرانی به نسخه محلی دشوار است و استفاده از Qwen Cloud تنها مسیر عملی است.

·نگاه ما
تحریریه دات‌هوش

توزیع مدل‌های با مقیاس تریلیونی در قالب وزن‌های باز، این فرض را که استدلال سطح Max انحصار APIهای بسته است، به‌کلی می‌شکند. حالا استدلال به یک «منبع محاسباتی قابل تنظیم» تبدیل شده است که می‌توانیم بسته به اهمیت باگ یا سادگی ایمیل، زمان تفکر مدل را مدیریت کنیم. این حرکت فشار شدیدی بر سایر ارائه‌دهندگان مدل‌های باز می‌آورد تا برای رقابت در فضای عامل‌های خودکار، از محدوده ۴۰۰ میلیارد پارامتر فراتر بروند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.