اگر به دنبال مدلهای استدلالی هستید که روی سختافزارهای متوسط اجرا شوند، بازی تغییر کرده است. در ۱۴ اوت ۲۰۲۶، تیم Qwen مدل Qwen3.8-27B را منتشر کرد؛ یک مدل متراکم که طبق مستندات رسمی در مخزن Hugging Face، به امتیاز ۸۹.۲٪ در محک GPQA Diamond دست یافته است.
این عرضه در حالی رخ میدهد که آزمایشگاههای چینی بهطور مستمر مرزهای هوش مصنوعی با وزنهای باز (Open Weights) — یعنی مدلهایی که «دستور پخت» آنها علناً منتشر شده تا هر کسی بتواند آنها را اجرا کند — را جابهجا میکنند. همانطور که در تحلیل قبلی ما دربارهی پیشتازی مدلهای بازمتن چینی اشاره کردیم، Qwen3.8 نشاندهنده چرخی استراتژیک از افزایش صرفِ تعداد پارامترها به سمت بهبود قابلیتهای عاملمحور (Agentic) و چندوجهی بومی است. این مدل که بر پایه معماری Qwen3.5 ساخته شده، توانمندترین عضو خانواده Qwen تا به امروز است. این رویکرد در تضاد با مدلهای غولپیکر است، هرچند علیبابا همزمان مدل عظیم ۲.۴ تریلیون پارامتری خود را برای وظایف پیچیدهتر عاملمحور معرفی کرده است.
برای یک برنامهنویس، این تغییر شبیه جایگزینی یک چتبات هوشمند با یک همکار دیجیتال قابلاعتماد است. در حالی که مدلهای قبلی فقط کد پیشنهاد میدادند، Qwen3.8 برای برنامهریزی، اجرا و اصلاح خطاهای خود در وظایف طولانیمدت طراحی شده است. این مدل پیشرفتهای چشمگیری در کدنویسی، کارهای تخصصی، پژوهشها و وظایف عاملمحور با افق زمانی طولانی نشان میدهد.
معماری هسته و کوانتش
مدل Qwen3.8-27B یک مدل زبانی علی (Causal Language Model) با یک رمزگذار بینایی یکپارچه است. این یک مدل متراکم با ۲۷ میلیارد پارامتر و بعد پنهان (Hidden Dimension) ۵۱۲۰ است. مدل دارای ۶۴ لایه و یک جاسازی توکن پد شده (Padded Token Embedding) به اندازه ۲۴۸,۳۲۰ است.
این مدل از یک چیدمان پنهان پیچیده استفاده میکند: ۱۶ × (۳ × (Gated DeltaNet ← FFN) ← ۱ × (Gated Attention ← FFN)). این ساختار ترکیبی، کارایی و عملکرد را از طریق پیکربندیهای خاص سرها (Heads) متعادل میکند:
- Gated DeltaNet: دارای ۴۸ سر توجه خطی برای V و ۱۶ سر برای QK، با بعد سر ۱۲۸ است.
- Gated Attention: دارای ۲۴ سر توجه برای Q و ۴ سر برای KV، با بعد سر ۲۵۶ است.
- شبکه پیشخور (FFN): از یک بعد میانی ۱۷,۴۰۸ استفاده میکند.
- رمزگذاری موقعیت: از بعد ۶۴ برای رمزگذاری موقعیت چرخشی (RoPE) بهره میبرد.
برای تسهیل استقرار محلی، تیم سازنده وزنهای کوانتیده (Quantization) شده در قالب FP8 را منتشر کرد. کوانتش — که شبیه فشردهسازی یک فایل حجیم برای اشغال فضای کمتر بدون افت کیفیت است — در اینجا با اندازه بلوک ۱۲۸ انجام شده تا معیارهای عملکرد تقریباً با مدل اصلی کوانتیده نشده یکسان بماند. این مدل با استفاده از پیشبینی چند-توکنی (MTP) با چندین گام آموزش دیده است. این تلاشها در راستای عرضه مدلهای ۲۷ میلیاردی برای تسهیل استقرار محلی هوش مصنوعی صورت گرفته است تا دسترسی به مدلهای قدرتمند آسانتر شود.
این وزنها با چارچوبهای استنتاج اصلی مانند vLLM، SGLang و TokenSpeed سازگار هستند. همچنین Unsloth نسخههای GGUF را با استفاده از کوانتش Dynamic V3.0 برای دستیابی به عملکرد SOTA روی سختافزارهای مصرفکننده ارائه داده است.
تفکر بومی و کنترل استدلال
مهمترین تغییر در Qwen3.8، معرفی «حالت تفکر» (Thinking Mode) بومی است. مدل بهطور پیشفرض، زنجیرههای استدلال داخلی را در تگهای <think>\n...</think>\n\n تولید میکند و سپس پاسخ نهایی را مینویسد. این فرآیند شبیه به زنجیره تفکر (Chain-of-Thought) است؛ یعنی همان حالتی که یک شاگرد ریاضی پای تخته بلندبلند فکر میکند تا به جواب برسد.
کاربران اکنون میتوانند عمق این استدلال را از طریق پارامتر reasoning_effort تنظیم کنند. این قابلیت اجازه میدهد تا بین سرعت و دقت توازن برقرار شود:
- xhigh: پیشفرض برای وظایف پیچیده که نیاز به تحلیل جامع و دقیق دارند.
- medium: ایجاد تعادل میان دقت و سرعت.
- low: استدلال بهینه برای سرعت بیشتر و کاهش هزینه.
علاوه بر این، قابلیت preserve_thinking اجازه میدهد بلوکهای استدلال در پیامهای تاریخی حفظ شوند که برای ثبات عاملها در گفتگوهای چندمرحلهای حیاتی است. این ویژگی باعث بهینهسازی استفاده از KV Cache و افزایش سرعت استنتاج (Inference) در هر دو حالت تفکر و غیرتفکر میشود.
برای کسانی که پاسخهای مستقیم را ترجیح میدهند، حالت تفکر را میتوان برای هر درخواست غیرفعال کرد. تیم سازنده پارامترهای نمونهبرداری (Sampling) متفاوتی را بر اساس حالت مدل توصیه میکند:
- حالت تفکر: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0.
- حالت دستورالعمل (بدون تفکر): temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0.
عملکرد در کدنویسی و وظایف عاملمحور
به گزارش تیم Qwen، این مدل جهشی بزرگ در مهندسی نرمافزار خودکار و برنامهریزی خودمختار داشته است. مدل بازخوردهای محیطی را بهطور مؤثرتری مدیریت میکند که منجر به تکمیل قابلاعتمادتر وظایف بهصورت سرتاسری (End-to-End) میشود.
در محک QwenSWEBench (یک بنچمارک داخلی برای ارزیابی قابلیتهای مهندسی نرمافزار)، مدل امتیاز ۷۹.۰٪ را کسب کرد که نسبت به ۴۹.۳٪ در نسخه Qwen3.6-27B پیشرفت خیرهکنندهای است. این ارزیابی با استفاده از ابزار Claude Code، مهلت ۸ ساعته و حداکثر توکن ۳۲,۷۶۸ انجام شده است.
تواناییهای عاملمحور مدل به کدنویسی محدود نمیشود. در CoWorkBench که وظایف طولانیمدت را در حوزههای علوم کامپیوتر، مالی، حقوق و بهرهوری پزشکی میسنجد، امتیاز ۷۰.۷٪ به دست آمد.
سایر نتایج کلیدی در بنچمارکهای کدنویسی و استدلال عبارتند از:
- Terminal Bench 2.1 (Terminus): ۷۳.۰٪ (در مقابل ۶۳.۴٪ برای Qwen3.6).
- SWE-bench Pro: ۶۱.۷٪ (ارزیابی شده با Claude Code در temp=1.0 و top_p=0.95).
- LiveCodeBench v6: ۹۰.۳٪.
- NL2Repo-Bench: ۴۲.۳٪ (تولید کد در سطح مخزن).
- DeepSWE 1.1: ۴۲.۲٪.
- IFBench: ۷۹.۵٪ برای پیروی از دستورات کلی.
- HLE: ۳۰.۸٪ برای استدلال چندرشتهای (قضاوت شده توسط GPT-4o).
- Agents' Last Exam: Pass@1 ۲۰.۴٪ / امتیاز ۴۲.۹٪.
یکپارچگی بومی بینایی و زبان
برخلاف مدلهایی که از آداپتورهای جداگانه استفاده میکنند، Qwen3.8 یک مدل بینایی-زبانی (VLM) بومی است. این یعنی مدل مستقیماً تصاویر و ویدیوها را پردازش میکند و میتواند نمودارهای STEM، اسناد و ویدیوهای با مقیاس ساعتی را بفهمد.
در بنچمارکهای چندوجهی، مدل در استفاده از کامپیوتر و ناوبری وب درخشیده است:
- OSWorld-Verified: ۸۴.۳٪ (استفاده از کامپیوتر).
- WebArena-Verified: ۶۴.۸٪ (استفاده از مرورگر).
- AndroidWorld: ۸۱.۹٪ (استفاده از موبایل).
- RecreationBench: ۴۷.۱٪ (بازسازی اپلیکیشن در اوبونتو، مک، ویندوز، اندروید و وب).
- SWE-MM: ۳۸.۶٪ (مهندسی نرمافزار چندوجهی).
- Vision2Web: ۶۲.۹٪ (توسعه وب بصری).
در زمینه استدلال بصری و ادراک، مدل دقت بالایی را نشان میدهد:
- MathVision: ۹۰.۰٪ بدون CI و ۹۴.۶٪ با CI.
- OmniDocBench 1.5: ۹۱.۱٪ برای هوشمندی اسناد.
- CharXiv (RQ): ۸۳.۷٪ بدون CI و ۹۰.۲٪ با CI برای تحلیل نمودارهای علمی.
- BabyVision: ۶۵.۷٪ بدون CI و ۸۵.۶٪ با CI.
- RealWorldQA: ۸۵.۹٪ برای ادراک دنیای واقعی.
- ERQA: ۶۵.۵٪ برای هوشمندی تجسمیافته (Embodied Intelligence).
پنجره زمینه و مدیریت متون طولانی
این مدل بهطور بومی از پنجره زمینه (Context Window) با اندازه ۲۶۲,۱۴۴ توکن پشتیبانی میکند. پنجره زمینه شبیه به میز کاری است که مدل در هر لحظه چند ورق را روی آن نگه میدارد. با استفاده از تکنیکهای مقیاسبندی RoPE مانند YaRN، این ظرفیت تا ۱,۰۰۰,۰۰۰ توکن قابل گسترش است که توسط vLLM، SGLang و TokenSpeed پشتیبانی میشود.
برای فعالسازی YaRN، کاربران میتوانند فایل config.json را در بخش rope_parameters با rope_theta برابر ۱۰,۰۰۰,۰۰۰ و partial_rotary_factor برابر ۰.۲۵ تغییر دهند. تیم سازنده اشاره میکند که ضریب مقیاسبندی باید بر اساس کاربرد تنظیم شود؛ مثلاً ضریب ۲.۰ برای ۵۲۴,۲۸۸ توکن مناسبتر است.
برای بارهای کاری تولیدی، تیم سازنده محدودیتهای خروجی خاصی را در این پنجره ۱ میلیون توکنی پیشنهاد میکند تا وظایف عاملمحور بهینه شوند:
- محتوای استدلالی: حداکثر طول خروجی ۲۶۲,۱۴۴ توکن.
- پاسخ نهایی: حداکثر طول خروجی ۱۳۱,۰۷۲ توکن.
برای درک ویدیوهای طولانی، تیم پیشنهاد میکند پارامتر longest_edge در video_preprocessor_config.json به ۴۶۹,۷۶۲,۰۴۸ افزایش یابد. این مقدار معادل ۲۲۴ هزار توکن ویدیو است و نمونهبرداری با نرخ فریم بالاتر برای ویدیوهای ساعتی را ممکن میسازد.
استقرار و دسترسی به API
برای کسانی که نمیخواهند درگیر مدیریت زیرساخت شوند، Qwen Cloud نسخه میزبانیشده را ارائه میدهد. این سرویس بهطور پیشفرض پنجره متنی ۱ میلیون توکنی و ابزارهای داخلی رسمی را پشتیبانی میکند.
توسعهدهندگان میتوانند از SDK پایتون OpenAI برای یکپارچهسازی استفاده کنند. API از پارامترهای خاص extra_body برای فعال یا غیرفعال کردن حالت تفکر و حفظ ردپای استدلال پشتیبانی میکند. برای کاربران Qwen Cloud، پارامترهای enable_thinking و preserve_thinking باید مستقیماً ارسال شوند و نباید در chat_template_kwargs قرار گیرند.
برای کاهش تکرارهای بیپایان، پارامتر presence_penalty بین ۰ تا ۲ قابل تنظیم است، هرچند مقادیر بالاتر ممکن است گاهی باعث ترکیب زبانها یا افت جزئی عملکرد شود.
جزئیات فنی پیادهسازی
تیم Qwen دستورالعملهای دقیقی برای بهینهسازی در مودالیتهها و چارچوبهای مختلف ارائه کرده است:
پردازش ویدیو:
- نمونهبرداری: بهطور پیشفرض از
fps=2وdo_sample_frames=Trueاستفاده میشود. - پیکربندی: کاربران میتوانند مقدار
fpsرا از طریقextra_bodyهنگام استفاده از vLLM با دستور--media-io-kwargs '{"video": {"num_frames": -1}}'سفارشی کنند. - بهینهسازی: تنظیم
longest_edgeروی ۴۶۹,۷۶۲,۰۴۸ وshortest_edgeروی ۴۰۹۶ در پیکربندی پیشپردازشگر برای تحلیل ویدیوهای ساعتی توصیه میشود.
تنظیمات چارچوبهای متن-طولانی:
- vLLM: نیاز به
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1و--hf-overridesخاص برایrope_parametersجهت رسیدن به ۱ میلیون توکن دارد. - SGLang: نیاز به
SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1و--json-model-override-argsبرای گسترش مشابه زمینه دارد. - TokenSpeed: نیاز به
TOKENSPEED_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1و--hf-overridesبرای فعالسازی محدودیت ۱ میلیون توکن دارد.
متدولوژی ارزیابی:
- ابزار کدنویسی: SWE-bench Pro و DeepSWE 1.1 با استفاده از Claude Code در temp=1.0 و top_p=0.95 ارزیابی شدند.
- NL2Repo-Bench: دستورات Bash برای دسترسی به مخازن خاص (مانند
pip installیاgit clone) غیرفعال شدند تا از «سوءاستفاده از پاداش» (Reward Hacking) جلوگیری شود. - قضاوت چندوجهی: ارزیابیهای Vision2Web توسط مدل
gpt-5.4-2026-03-05با استفاده از Claude Code انجام شده است. - ClawEval-MM: به صورت «Pass@3 / میانگین امتیاز» گزارش شده است، که در آن Pass@3 درصد وظایفی است که حداقل در یکی از سه تلاش پاس شدهاند.
تحلیل: ظهور مدلهای «متراکم استدلالی»
مدل Qwen3.8-27B سیگنالی است برای فاصله گرفتن از شعار «هرچه بزرگتر، بهتر». علیبابا با گنجاندن استدلال در سطح مدلهای پیشرو در یک بدنه ۲۷ میلیارد پارامتری، هوش مصنوعی عاملمحور سطح بالا را برای سختافزارهای میانرده عملی کرده است.
این موضوع پیشفرضهای این حوزه را درباره هزینه تفکر «سیستم ۲» (System 2) تغییر میدهد. اگر یک مدل ۲۷ میلیاردی بتواند به ۸۹.۲٪ در GPQA Diamond برسد، نیاز به مدلهای تریلیون پارامتری برای وظایف پژوهشی تخصصی کاهش مییابد.
برای کاربر نهایی، این به معنای عاملهای محلی قابلاعتمادتر است. توانایی تنظیم reasoning_effort به توسعهدهندگان اجازه میدهد اپلیکیشنهایی بسازند که برای پرسوجوهای ساده سریع و برای حل مسائل پیچیده عمیق باشند، بدون اینکه نیاز به تعویض مدل داشته باشند. در وظایف عاملمحور چندمرحلهای، تیم هشدار میدهد که تلاش استدلالی کمتر همیشه زمان کل را کاهش نمیدهد، زیرا میتواند منجر به شکستهای بیشتر و تکرار تلاشها شود.
منتظر باشید تا جامعه توسعهدهندگان این وزنها را از طریق Unsloth بازتنظیم (Fine-tune) کنند، زیرا افزودن پشتیبانی از نقش توسعهدهنده احتمالاً منجر به موجی از عاملهای کدنویسی تخصصی خواهد شد.
گام بعدی شما
- اگر از سختافزارهای مصرفکننده استفاده میکنید، نسخههای GGUF منتشر شده توسط Unsloth را برای تجربه استدلال محلی امتحان کنید.
- برای وظایف پیچیده کدنویسی، پارامتر
reasoning_effortرا رویxhighقرار دهید تا دقت مدل را به حداکثر برسانید. - در صورت استفاده از API، قابلیت
preserve_thinkingرا فعال کنید تا در گفتگوهای طولانی، مدل رشته افکار خود را گم نکند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو