پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Qwen3.8-27B علی‌بابا در شاخص هوش با GPT-5.6 Luna برابر شد

·۶ مهر ۱۴۰۵۲۶ دقیقه مطالعه
معماری و بررسی عملی مدل فشرده و متراکم علی‌بابا: Qwen3.8-27B
معماری و بررسی عملی مدل فشرده و متراکم علی‌بابا: Qwen3.8-27B
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی متد Cold Start با معیار HES برای حذف نویز احساسی در زنجیره تفکر و معرفی معماری «فشرده‌سازی و تجمیع» که برای نخستین بار در یک مدل بازمتن این سطح دیده می‌شود.

اگر به دنبال مدل استدلالی هستید که روی سخت‌افزار شخصی اجرا شود اما قدرت مدل‌های ابری را داشته باشد، بازی تغییر کرده است. در ۱۵ اوت ۲۰۲۶، در نیمه‌شب به وقت ژاپن (JST)، گروه علی‌بابا (Alibaba Group) مدل Qwen3.8-27B را معرفی کرد؛ یک مدل متراکم و فشرده که توانایی‌های استدلالی را که پیش‌تر فقط در مدل‌های غول‌پیکر با تریلیون‌ها پارامتر دیده می‌شد، به ابعاد کوچک آورده است. این رویکرد در راستای استراتژی جدید علی‌بابا برای توسعه مدل‌ها با هدف رسیدن به هوش مصنوعی فوق‌بشر (ASI) قرار دارد که بر افزایش مقیاس و توانمندی‌های استدلالی تأکید می‌کند.

این عرضه درست پس از معرفی مدل عظیم Qwen3.8-2.4T-A95B در ۱۲ اوت رخ داد. آن مدل پرچم‌دار که در Hugging Face منتشر شده، دارای تعداد خیره‌کننده‌ای یعنی ۲.۴ تریلیون پارامتر است. در حالی که مدل ۲.۴ تریلیونی به عنوان یک معیار پیشرو عمل می‌کند — و بنچمارک‌های استدلالی آن به مدل Kimi-K3 از شرکت Moonshot AI نزدیک شده است — نسخه ۲۷ میلیارد پارامتری دقیقاً برای جامعه مدل‌های محلی (Local-LLM) طراحی شده است. این مدل تحت لایسنس Apache-2.0 منتشر شده که استفاده تجاری از آن را به صورت رایگان و بدون محدودیت‌های سخت‌گیرانه لایسنس Qwen3.8-Max (که معمولاً برای خدمات تجاری در مقیاس بزرگ نیازمند قراردادهای جداگانه است) فراهم می‌کند.

برخلاف بسیاری از مدل‌های مدرن که از ساختار «ترکیب خبره‌ها» (Mixture-of-Experts یا MoE) و لایه‌های پراکنده استفاده می‌کنند، Qwen3.8-27B یک مدل متراکم (Dense) است. این یعنی در هر لحظه از پردازش هر توکن (Token) — مثل برش‌های کوچکی از یک کیک طولانی که مدل تکه‌تکه می‌خورد — تمام پارامترها فعال می‌شوند. این طراحی معمولاً منجر به بهره‌وری و قابلیت بالاتر در هر پارامتر می‌شود که نتایج آن در بنچمارک‌های اخیر کاملاً مشهود است.

معماری توجه منحصر‌به‌فرد

این مدل از الگوهای رایج «توجه محلی و جهانی» (local + global) فاصله گرفته و در عوض، ترکیبی از شبکه دلتا گیت‌دار (Gated Delta Network یا GDN) و توجه گیت‌دار (Gated Attention یا GA) را به کار می‌گیرد.

معماری و بررسی عملی مدل فشرده ۲۷ میلیارد پارامتری کیوون ۳.۸ علی‌بابا

بر اساس مستندات فنی، GDN مسئول به‌روزرسانی وضعیت و فشرده‌سازی اطلاعات است و ۷۵٪ لایه‌های توجه را تشکیل می‌دهد. ۲۵٪ باقی‌مانده لایه‌های توجه گیت‌دار هستند که در ساختار توجه پرس‌وجوی گروهی (Group Query Attention یا GQA) سازماندهی شده‌اند و مدیریت تجمیع جهانی و بازیابی دقیق اطلاعات را بر عهده دارند. این چیدمان ابتدا در مدل Qwen3-Next-80B اتخاذ شد و سپس در نسخه‌های Qwen3.5 و Qwen3.6 نیز تداوم یافت.

به جای عبارت «محلی و جهانی»، توصیف دقیق‌تر برای این سازوکار «فشرده‌سازی و تجمیع» (compression + aggregation) است. تا جایی که ما می‌دانیم، خانواده Qwen در حال حاضر تنها خانواده مدل‌های بزرگی است که از این رویکرد خاص استفاده می‌کند.

مشخصات فنی و محدودیت‌های سخت‌افزاری

بررسی فایل config.json در Hugging Face نشان می‌دهد این مدل از معماری Qwen3_5ForConditionalGeneration استفاده می‌کند. مشخصات کلیدی عبارتند از:

  • حداکثر پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — ۲۵۶ هزار توکن است (اگرچه در برخی محیط‌های تست به ۶۴ هزار توکن محدود شده است).
  • تعداد بلوک‌ها: ۶۴ بلوک (با نسبت GDN به GA برابر با ۳ به ۱، متشکل از ۴ لایه در ۱۶ گروه).
  • اندازه پنهان (Hidden Size): ۵,۱۲۰
  • نوع FFN: متراکم (Dense)
  • تابع فعال‌ساز: SiLU
  • بعد فعال‌ساز (Activation Dimension): ۱۷,۴۰۸

این رویکرد «فشرده‌سازی و تجمیع» در حال حاضر منحصر به خانواده Qwen است. این ساختار به مدل اجازه می‌دهد عمق استدلال بالایی را حفظ کند، هرچند هزینه حافظه قابل‌توجهی دارد. ردپای حافظه KV cache در این مدل به طور محسوسی بزرگتر از رقبایی مانند Muse Glimmer 30B یا Gemma-4-31B است.

اجرای محلی این مدل نیازمند مدیریت دقیق حافظه ویدیویی (VRAM) است. در یک محیط تست با استفاده از نمونه محاسباتی سریع GPUSOROBAN مجهز به NVIDIA RTX A4000 (۱۶ گیگابایت GDDR6)، نسخه کوانتیده ۴ بیتی با کمبود حافظه مواجه شد. مشخصات دقیق سیستم مورد استفاده به شرح زیر بود:

  • GPU: NVIDIA RTX A4000 (16GiB GDDR6)
  • پهنای باند حافظه: ۴۴۸.۰ گیگابایت بر ثانیه
  • قدرت پردازشی: ۱۹.۱۷ TFLOPS (FP32)، ۳۸.۳۴ TFLOPS (BF16)، ۱۵۳.۴ TOPS (INT8)، ۳۰۶.۷ TOPS (INT4)
  • سیستم: ۱۱ هسته vCPU، ۵۰ گیگابایت حافظه سیستم، Ubuntu 24.04 Server، CUDA 13.2، درایور NVIDIA نسخه ۵۸۰

برای جا دادن مدل در حافظه، استفاده از نسخه کوانتیده ۲ بیتی (Qwen3.8-27B-UD-Q2_K_XL.gguf با حجم ۱۲ گیگابایت) که با Unsloth Dynamic 2.0 بهینه شده بود، در کنار یک رمزگذار بینایی کوانتیده (mmproj-bf16.gguf با حجم ۸۸۹ مگابایت) ضروری بود. این تنظیمات از llama.cpp نسخه 0.1.0-dev (بیلد ۱۰۴۵۰، کامیت ece963f41) استفاده می‌کرد. سازگاری با بیلد‌های موجود llama.cpp یک مزیت بزرگ است، زیرا معماری با Qwen3.5 سازگار باقی مانده است.

بیشترین فشار حافظه مربوط به KV Cache است. در حالت FP16 و با پنجره متنی ۶۵,۵۳۶ توکن، این حافظه ۴,۰۹۶ مگابایت اشغال می‌کند. اگر بخواهیم از ظرفیت کامل ۲۶۲,۱۴۴ توکن استفاده کنیم، تنها برای حافظه کش به ۱۶,۳۸۴ مگابایت VRAM نیاز داریم، بدون اینکه وزن‌های مدل را حساب کنیم. در حالت استاندارد، کل حافظه اشغال شده روی RTX A4000 برابر با ۱۳,۸۹۷.۵۳ مگابایت بود که ۹,۵۶۷.۸۹ مگابایت آن مربوط به داده‌های وزن مدل بود.

مقایسه حافظه کش (KV Cache)

سربار حافظه در Qwen3.8-27B به دلیل طراحی غنی لایه‌های تجمیع است. در مقایسه با سایر مدل‌های هیبریدی:

  • Muse Glimmer 30B: از SWA+Global (۳:۱) با ۱۳ لایه تجمیع (۲ هد در ۱۲۸ بعد) استفاده می‌کند. حافظه کش برای ۱۲۸ هزار توکن ۱,۷۴۲ مگابایت است. هدف طراحی: استنتاج سبک.
  • Gemma-4-31B: از SWA+Global (۵:۱) با ۱۰ لایه تجمیع (۴ هد در ۵۱۲ بعد) استفاده می‌کند. حافظه کش برای ۱۲۸ هزار توکن ۵,۹۲۰ مگابایت است. هدف طراحی: تعادل بین استدلال و حافظه.
  • Qwen3.8-27B: از GDN+Global (۳:۱) با ۱۶ لایه تجمیع (۴ هد در ۲۵۶ بعد) استفاده می‌کند. حافظه کش برای ۱۲۸ هزار توکن ۸,۱۹۲ مگابایت است. هدف طراحی: استدلال پیشرفته.

این اعداد نشان می‌دهد علی‌بابا پاسخ‌های عمیق و قابل‌اعتماد را به سرعت و سبکی استنتاج ترجیح داده است. شبکه دلتا گیت‌دار به تنهایی کارآمد است، اما تکرار بالای لایه‌های Global و طراحی غنی KV، نیازهای حافظه را به شدت افزایش داده است.

منطق تفکر و عملکرد استدلالی

یکی از چشمگیرترین تغییرات، فرآیند استدلال داخلی مدل است. مدل‌های قبلی Qwen به داشتن یک صدای داخلی «تردیدآمیز» معروف بودند و اغلب در مرحله تفکر، منطق خود را زیر سؤال می‌بردند. Qwen3.8-27B تا حد زیادی از این وضعیت عبور کرده است.

در llama.cpp پارامتر جدید reasoning_effort اجازه می‌دهد عمق تفکر را از طریق پرامپت سیستمی کنترل کنید. سطوح پشتیبانی شده عبارتند از:

  • xhigh (پیش‌فرض): پرامپتی را تزریق می‌کند تا مدل با دقت فکر کند، مفروضات را اعتبارسنجی نماید، جایگزین‌ها را بررسی کند و صحت و شفافیت را در اولویت قرار دهد.
  • medium: هیچ پرامپت سیستمی تزریق نمی‌شود.
  • low: پرامپتی را تزریق می‌کند تا تفکر کوتاه و متمرکز باشد و مستقیماً به نتیجه برسد.

تحلیل بخش تفکر مدل نشان می‌دهد که فرآیند کاملاً منطقی است. مدل زبان تفکر (انگلیسی) را از زبان خروجی (مثلاً ژاپنی) جدا می‌کند، استنتاج متنی را از زوایای مختلف انجام می‌دهد و در لحظه خوداصلاحی می‌کند. به عنوان مثال، وقتی از مدل درباره شرایط زمین در کیوشو پرسیده شد، مدل ابتدا شروع به نوشتن «میاگی» کرد اما بلافاصله آن را به «میازاکی» اصلاح کرد.

همچنین مدل طوفان فکری جامع برای دانش انجام می‌دهد، کلمات کلیدی را بر اساس منطقه و زمین‌شناسی لیست می‌کند و ساختار خروجی (مثلاً انتخاب بین جدول یا لیست گلوله‌ای) را پیش از نهایی کردن پاسخ، به صورت تکرار شونده شبیه‌سازی می‌کند. این فرآیند «بسیار منطقی» توصیف شده و فاقد لحن احساسی منفی است که در Qwen3.5 دیده می‌شد.

متدولوژی آموزش: فراتر از راه‌اندازی سرد

این پیشرفت نتیجه تغییر در روش آموزش است. تیم Qwen از متد «راه‌اندازی سرد زنجیره تفکر طولانی» (Long CoT Cold Start) که در DeepSeek-R1 استفاده شده بود، فاصله گرفته است؛ چرا که آن روش اغلب نویزهای احساسی از داده‌های فروم‌هایی مثل ردیت (Reddit) را وارد لحن مدل می‌کرد. این تمایل به «راه‌اندازی سرد» باعث می‌شد مدل‌ها در میانه استدلال متوقف شده و دوباره از صفر شروع کنند.

به جای آن، آن‌ها از یک معیار ارزیابی داده بدون نیاز به آموزش به نام High-Entropy Sum (HES) در مراحل SFT، RFT و RL استفاده کردند. HES مانع از این می‌شود که نقاط تصمیم‌گیری مهم توسط متون کلیشه‌ای و کم‌ارزش (boilerplate) رقیق شوند و به مدل اجازه می‌دهد راهکارهای باکیفیت را بهینه‌تر یاد بگیرد.

علاوه بر این، مدل پرچم‌دار Qwen3.8-Max از سیستم‌های RL مقیاس‌بندی شده در دنیای واقعی، یک سیستم پاداش عمومی برای اعتبارسنجی‌های متنوع و یک متعادل‌کننده داده‌های آنلاین برای ارتقای توانایی تکمیل وظایف در زنجیره‌های ابزاری استفاده کرد. این نشان می‌دهد دستاوردهای مدل ۲۷ میلیارد پارامتری صرفاً نتیجه تقطیر (Distillation) از مدل‌های پیشرو نیست، بلکه تکاملی واقعی در طراحی خط لوله آموزش است. همچنین احتمالاً تیم سازنده مشکل «بیش‌فکری» (overthinking) را که در تحقیقات اخیر روی تردیدهای خودکار در زنجیره تفکر طولانی شناسایی شده بود، برطرف کرده است.

قابلیت‌های چندوجهی

مدل Qwen3.8-27B دارای یک رمزگذار بینایی بر اساس معماری SigLIP2-SO-400M است. در تست‌های عملی، این مدل توانست نمودارهای فنی پیچیده را با دقت بالا تحلیل کند. این توانمندی در پردازش بصری، یادآور موفقیت‌های قبلی علی‌بابا در این حوزه است، مانند زمانی که مدل Qwen-Image-2.1 با ۷ میلیارد پارامتر توانست مدل‌های بسته را در تحلیل تصاویر شکست دهد. فعال کردن رمزگذار بینایی، مصرف حافظه را تقریباً ۱,۳۳۶ مگابایت افزایش می‌دهد و مجموع آن را روی RTX A4000 به ۱۵,۳۶۹.۵۱ مگابایت می‌رساند.

معماری و بررسی عملی مدل فشرده و متراکم کیوون ۳.۸-۲۷ بی علی‌بابا

در تحلیل یک نمودار معماری Muse Glimmer، مدل نه تنها مشخصات فنی را درست استخراج کرد، بلکه یک تناقض در برچسب‌های تصویر را هم شناسایی کرد؛ جایی که برچسب نمودار «پیکربندی ۵۲ بلوکی» را نوشته بود اما در توضیحات کنار آن «۵۰ بلوک» ذکر شده بود. مدل به درستی استدلال کرد که عدد ۵۲ احتمالاً شامل لایه‌های بینایی است و عدد ۵۰ فقط مربوط به لایه‌های رمزگشای متن است. حتی یک غلط تایپی احتمالی را شناسایی کرد و اشاره کرد که عبارت «بدون اطلاعات موقعیتی» احتمالاً به معنای «بدون کدگذاری موقعیتی» (no positional encoding) است.

این سطح از جزئیات از مدل‌های کلاس ۳۰ میلیارد پارامتری قبلی پیشی گرفت و پاسخی تولید کرد که تقریباً دو برابر طولانی‌تر از پاسخ Muse Glimmer 30B برای همان وظیفه بود. استدلال رمزگذار بینایی به طور محسوسی توانمندتر به نظر می‌رسید که احتمالاً به دلیل تنظیم دقیق (fine-tuning) اضافی است.

بنچمارک‌ها: جهش در هوش

ارزیابی‌های شخص ثالث نشان‌دهنده جهشی بزرگ است. در شاخص هوش Artificial Analysis، مدل Qwen3.8-27B با فعال بودن حالت تفکر، امتیاز ۵۲ را کسب کرد.

معماری و بررسی عملی مدل فشرده ۲۷ میلیارد پارامتری کیون ۳.۸ علی‌بابا

این امتیاز آن را با GPT-5.6 Luna برابر و از Claude Opus 4.6 پیشی می‌دهد. در وظایف کدنویسی ایجنتی، امتیاز ۷۳ را در Terminal Bench 2.1 کسب کرد که به طور قابل توجهی از امتیاز ۵۱.۷ مدل Muse Glimmer 30B بالاتر است. سایر بنچمارک‌های قابل توجه عبارتند از:

  • GPQA Diamond (استدلال علمی): ۸۹.۲ (در برابر ۸۳.۵ Muse Glimmer)
  • LiveCodeBench v6 (کدنویسی رقابتی): ۹۰.۳ (در برابر ۸۸.۸ Opus 4.6)
  • IFBench (پیروی از دستورات): ۷۹.۵ (در برابر ۶۲.۵ Opus 4.6)
  • CoWorkBench (کارهای اداری): ۷۰.۷ (در برابر ۶۱ مدل Qwen3.6-27B)
  • Agents' Last Exam (امتیاز): ۴۲.۹ (در برابر ۲۷.۳ مدل Qwen3.6-27B)
  • DeepSWE 1.1 (کدنویسی ایجنتی): ۴۲.۲ (در برابر ۱۳.۳ مدل Qwen3.6-27B)
  • HLE (استدلال چندرشته‌ای): ۳۰.۸ (در برابر ۲۲ مدل Muse Glimmer)

البته این هوش به قیمت کاهش سرعت تمام شده است. در تست‌ها، تعداد توکن‌های مصرفی Qwen3.8-27B برای رسیدن به پاسخ، تقریباً سه برابر Muse Glimmer بود. مدل Qwen3.8-27B زمان کل ۲۴۸,۶۷۹ میلی‌ثانیه را برای ۵,۸۳۵ توکن ثبت کرد (۲۳.۲۳ توکن بر ثانیه)، در حالی که Muse Glimmer برای ۱,۹۳۴ توکن به ۸۳,۱۳۶ میلی‌ثانیه زمان نیاز داشت (۲۲.۵۲ توکن بر ثانیه).

تحلیل تحریریه

برای متخصصان هوش مصنوعی محلی، Qwen3.8-27B توازن بین اندازه و هوش را تغییر می‌دهد. ما شاهد روندی هستیم که در آن «فشرده» دیگر به معنای «سازش» یا «ضعیف‌تر بودن» نیست. علی‌بابا با اولویت دادن به قابلیت استدلال خام نسبت به استنتاج سبک، ابزاری ایده‌آل برای تحقیقات عمیق (Deep Research) و جریان‌های کاری پیچیده ایجنتی خلق کرده است.

با این حال، نیاز بالای VRAM برای متون طولانی همچنان یک گلوگاه است. کاربران باید بین استدلال با دقت بالا (KV cache در حالت FP16) و پنجره‌های متنی طولانی‌تر (KV cache کوانتیده) یکی را انتخاب کنند. برای مثال، استفاده از کوانتیزاسیون q8_0 یا turbo3 می‌تواند حافظه کش ۱۳۱ هزار توکنی را از ۸,۱۹۲ مگابایت به ترتیب به ۴,۰۹۶ مگابایت یا ۲,۹۷۶ مگابایت کاهش دهد. برای پنجره کامل ۲۶۲ هزار توکنی، متد turbo3 می‌تواند حجم کش را به ۵,۹۵۲ مگابایت برساند.

حکم نهایی

پیروزی واقعی در اینجا مربوط به بهره‌وری آموزش است؛ فاصله گرفتن از آموزش Long-CoT با روش «راه‌اندازی سرد»، نشان‌دهنده رویکردی بالغ‌تر به یادگیری تقویت‌شده (RL) است که نویزهای احساسی را در منطق مدل کاهش می‌دهد. این تغییر، در کنار معیار HES، نشان می‌دهد که دستاوردهای مدل صرفاً نتیجه تقطیر از مدل‌های پیشرو نیست، بلکه تکاملی واقعی در طراحی خط لوله آموزش است.

اگر در حال ساخت خط لوله‌های RAG یا ایجنت‌های خودمختار هستید، باید مهندسی پرامپت خود را بازنگری کنید. ساختار منطقی استدلال Qwen3.8 اساساً با Qwen3.5 متفاوت است، به این معنی که پرامپت‌های قدیمی ممکن است دیگر همان رفتار را تحریک نکنند. منتظر واکنش جامعه به سربار KV cache باشید. اگر متدهای کوانتیزاسیون جدید بتوانند حجم کش را بدون از بین بردن عمق استدلال کاهش دهند، Qwen3.8-27B می‌تواند به ستون فقرات پیش‌فرض برای سیستم‌های ایجنتی محلی تبدیل شود.

چرا این موضوع مهم است؟

این مدل توازن بین اندازه و هوش را جابه‌جا می‌کند و ثابت می‌کند مدل‌های کوچک می‌توانند در استدلال با غول‌های ابری رقابت کنند. اعتبار این ادعا با امتیاز ۵۲ در شاخص هوش Artificial Analysis تأیید شده است.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights)، توسعه‌دهندگان ایرانی می‌توانند این مدل را بدون نیاز به API و دور زدن تحریم‌ها، به‌صورت محلی روی سرورهای خود مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

تغییر استراتژی علی‌بابا از MoE به مدل متراکم در این ابعاد، نشان می‌دهد که برای رسیدن به استدلال عمیق (Deep Reasoning)، هنوز فعال‌سازی تمام پارامترها موثرتر از مدل‌های پراکنده است. حذف متد Cold Start و جایگزینی آن با معیار HES، یک ضربه فنی به رویکرد DeepSeek است و ثابت می‌کند می‌توان بدون وارد کردن نویزهای رفتاریِ داده‌های اجتماعی، به زنجیره‌های تفکر طولانی دست یافت.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.