پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Qwen3.8-27B دقت استدلال علمی را به ۸۹.۲٪ رساند

·۲۳ مرداد ۱۴۰۵۱۱ دقیقه مطالعه۲ بازدید
لوگوی کیوئن ۳.۸-۲۷بی FP8 در هاگینگ‌فیس
لوگوی کیوئن ۳.۸-۲۷بی FP8 در هاگینگ‌فیس
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تلفیق بومی حالت تفکر (Thinking Mode) با قابلیت‌های بینایی در یک مدل ۲۷ میلیاردی؛ این اولین بار است که یک مدل با این اندازه، دقت ۸۹.۲٪ در GPQA Diamond را ثبت می‌کند.

اگر به دنبال مدل‌های استدلالی هستید که روی سخت‌افزارهای متوسط اجرا شوند، بازی تغییر کرده است. در ۱۴ اوت ۲۰۲۶، تیم Qwen مدل Qwen3.8-27B را منتشر کرد؛ یک مدل متراکم که طبق مستندات رسمی در مخزن Hugging Face، به امتیاز ۸۹.۲٪ در محک GPQA Diamond دست یافته است.

این عرضه در حالی رخ می‌دهد که آزمایشگاه‌های چینی به‌طور مستمر مرزهای هوش مصنوعی با وزن‌های باز (Open Weights) — یعنی مدل‌هایی که «دستور پخت» آن‌ها علناً منتشر شده تا هر کسی بتواند آن‌ها را اجرا کند — را جابه‌جا می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی پیشتازی مدل‌های بازمتن چینی اشاره کردیم، Qwen3.8 نشان‌دهنده چرخی استراتژیک از افزایش صرفِ تعداد پارامترها به سمت بهبود قابلیت‌های عامل‌محور (Agentic) و چندوجهی بومی است. این مدل که بر پایه معماری Qwen3.5 ساخته شده، توانمندترین عضو خانواده Qwen تا به امروز است. این رویکرد در تضاد با مدل‌های غول‌پیکر است، هرچند علی‌بابا هم‌زمان مدل عظیم ۲.۴ تریلیون پارامتری خود را برای وظایف پیچیده‌تر عامل‌محور معرفی کرده است.

برای یک برنامه‌نویس، این تغییر شبیه جایگزینی یک چت‌بات هوشمند با یک همکار دیجیتال قابل‌اعتماد است. در حالی که مدل‌های قبلی فقط کد پیشنهاد می‌دادند، Qwen3.8 برای برنامه‌ریزی، اجرا و اصلاح خطاهای خود در وظایف طولانی‌مدت طراحی شده است. این مدل پیشرفت‌های چشمگیری در کدنویسی، کارهای تخصصی، پژوهش‌ها و وظایف عامل‌محور با افق زمانی طولانی نشان می‌دهد.

معماری هسته و کوانتش

مدل Qwen3.8-27B یک مدل زبانی علی (Causal Language Model) با یک رمزگذار بینایی یکپارچه است. این یک مدل متراکم با ۲۷ میلیارد پارامتر و بعد پنهان (Hidden Dimension) ۵۱۲۰ است. مدل دارای ۶۴ لایه و یک جاسازی توکن پد شده (Padded Token Embedding) به اندازه ۲۴۸,۳۲۰ است.

این مدل از یک چیدمان پنهان پیچیده استفاده می‌کند: ۱۶ × (۳ × (Gated DeltaNet ← FFN) ← ۱ × (Gated Attention ← FFN)). این ساختار ترکیبی، کارایی و عملکرد را از طریق پیکربندی‌های خاص سرها (Heads) متعادل می‌کند:

  • Gated DeltaNet: دارای ۴۸ سر توجه خطی برای V و ۱۶ سر برای QK، با بعد سر ۱۲۸ است.
  • Gated Attention: دارای ۲۴ سر توجه برای Q و ۴ سر برای KV، با بعد سر ۲۵۶ است.
  • شبکه پیش‌خور (FFN): از یک بعد میانی ۱۷,۴۰۸ استفاده می‌کند.
  • رمزگذاری موقعیت: از بعد ۶۴ برای رمزگذاری موقعیت چرخشی (RoPE) بهره می‌برد.

برای تسهیل استقرار محلی، تیم سازنده وزن‌های کوانتیده (Quantization) شده در قالب FP8 را منتشر کرد. کوانتش — که شبیه فشرده‌سازی یک فایل حجیم برای اشغال فضای کمتر بدون افت کیفیت است — در اینجا با اندازه بلوک ۱۲۸ انجام شده تا معیارهای عملکرد تقریباً با مدل اصلی کوانتیده نشده یکسان بماند. این مدل با استفاده از پیش‌بینی چند-توکنی (MTP) با چندین گام آموزش دیده است. این تلاش‌ها در راستای عرضه مدل‌های ۲۷ میلیاردی برای تسهیل استقرار محلی هوش مصنوعی صورت گرفته است تا دسترسی به مدل‌های قدرتمند آسان‌تر شود.

این وزن‌ها با چارچوب‌های استنتاج اصلی مانند vLLM، SGLang و TokenSpeed سازگار هستند. همچنین Unsloth نسخه‌های GGUF را با استفاده از کوانتش Dynamic V3.0 برای دستیابی به عملکرد SOTA روی سخت‌افزارهای مصرف‌کننده ارائه داده است.

تفکر بومی و کنترل استدلال

مهم‌ترین تغییر در Qwen3.8، معرفی «حالت تفکر» (Thinking Mode) بومی است. مدل به‌طور پیش‌فرض، زنجیره‌های استدلال داخلی را در تگ‌های <think>\n...</think>\n\n تولید می‌کند و سپس پاسخ نهایی را می‌نویسد. این فرآیند شبیه به زنجیره تفکر (Chain-of-Thought) است؛ یعنی همان حالتی که یک شاگرد ریاضی پای تخته بلندبلند فکر می‌کند تا به جواب برسد.

کاربران اکنون می‌توانند عمق این استدلال را از طریق پارامتر reasoning_effort تنظیم کنند. این قابلیت اجازه می‌دهد تا بین سرعت و دقت توازن برقرار شود:

  • xhigh: پیش‌فرض برای وظایف پیچیده که نیاز به تحلیل جامع و دقیق دارند.
  • medium: ایجاد تعادل میان دقت و سرعت.
  • low: استدلال بهینه برای سرعت بیشتر و کاهش هزینه.

علاوه بر این، قابلیت preserve_thinking اجازه می‌دهد بلوک‌های استدلال در پیام‌های تاریخی حفظ شوند که برای ثبات عامل‌ها در گفتگوهای چندمرحله‌ای حیاتی است. این ویژگی باعث بهینه‌سازی استفاده از KV Cache و افزایش سرعت استنتاج (Inference) در هر دو حالت تفکر و غیرتفکر می‌شود.

برای کسانی که پاسخ‌های مستقیم را ترجیح می‌دهند، حالت تفکر را می‌توان برای هر درخواست غیرفعال کرد. تیم سازنده پارامترهای نمونه‌برداری (Sampling) متفاوتی را بر اساس حالت مدل توصیه می‌کند:

  • حالت تفکر: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0.
  • حالت دستورالعمل (بدون تفکر): temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0.

عملکرد در کدنویسی و وظایف عامل‌محور

به گزارش تیم Qwen، این مدل جهشی بزرگ در مهندسی نرم‌افزار خودکار و برنامه‌ریزی خودمختار داشته است. مدل بازخوردهای محیطی را به‌طور مؤثرتری مدیریت می‌کند که منجر به تکمیل قابل‌اعتمادتر وظایف به‌صورت سرتاسری (End-to-End) می‌شود.

در محک QwenSWEBench (یک بنچمارک داخلی برای ارزیابی قابلیت‌های مهندسی نرم‌افزار)، مدل امتیاز ۷۹.۰٪ را کسب کرد که نسبت به ۴۹.۳٪ در نسخه Qwen3.6-27B پیشرفت خیره‌کننده‌ای است. این ارزیابی با استفاده از ابزار Claude Code، مهلت ۸ ساعته و حداکثر توکن ۳۲,۷۶۸ انجام شده است.

توانایی‌های عامل‌محور مدل به کدنویسی محدود نمی‌شود. در CoWorkBench که وظایف طولانی‌مدت را در حوزه‌های علوم کامپیوتر، مالی، حقوق و بهره‌وری پزشکی می‌سنجد، امتیاز ۷۰.۷٪ به دست آمد.

سایر نتایج کلیدی در بنچمارک‌های کدنویسی و استدلال عبارتند از:

  • Terminal Bench 2.1 (Terminus): ۷۳.۰٪ (در مقابل ۶۳.۴٪ برای Qwen3.6).
  • SWE-bench Pro: ۶۱.۷٪ (ارزیابی شده با Claude Code در temp=1.0 و top_p=0.95).
  • LiveCodeBench v6: ۹۰.۳٪.
  • NL2Repo-Bench: ۴۲.۳٪ (تولید کد در سطح مخزن).
  • DeepSWE 1.1: ۴۲.۲٪.
  • IFBench: ۷۹.۵٪ برای پیروی از دستورات کلی.
  • HLE: ۳۰.۸٪ برای استدلال چندرشته‌ای (قضاوت شده توسط GPT-4o).
  • Agents' Last Exam: Pass@1 ۲۰.۴٪ / امتیاز ۴۲.۹٪.

یکپارچگی بومی بینایی و زبان

برخلاف مدل‌هایی که از آداپتورهای جداگانه استفاده می‌کنند، Qwen3.8 یک مدل بینایی-زبانی (VLM) بومی است. این یعنی مدل مستقیماً تصاویر و ویدیوها را پردازش می‌کند و می‌تواند نمودارهای STEM، اسناد و ویدیوهای با مقیاس ساعتی را بفهمد.

در بنچمارک‌های چندوجهی، مدل در استفاده از کامپیوتر و ناوبری وب درخشیده است:

  • OSWorld-Verified: ۸۴.۳٪ (استفاده از کامپیوتر).
  • WebArena-Verified: ۶۴.۸٪ (استفاده از مرورگر).
  • AndroidWorld: ۸۱.۹٪ (استفاده از موبایل).
  • RecreationBench: ۴۷.۱٪ (بازسازی اپلیکیشن در اوبونتو، مک، ویندوز، اندروید و وب).
  • SWE-MM: ۳۸.۶٪ (مهندسی نرم‌افزار چندوجهی).
  • Vision2Web: ۶۲.۹٪ (توسعه وب بصری).

در زمینه استدلال بصری و ادراک، مدل دقت بالایی را نشان می‌دهد:

  • MathVision: ۹۰.۰٪ بدون CI و ۹۴.۶٪ با CI.
  • OmniDocBench 1.5: ۹۱.۱٪ برای هوشمندی اسناد.
  • CharXiv (RQ): ۸۳.۷٪ بدون CI و ۹۰.۲٪ با CI برای تحلیل نمودارهای علمی.
  • BabyVision: ۶۵.۷٪ بدون CI و ۸۵.۶٪ با CI.
  • RealWorldQA: ۸۵.۹٪ برای ادراک دنیای واقعی.
  • ERQA: ۶۵.۵٪ برای هوشمندی تجسم‌یافته (Embodied Intelligence).

پنجره زمینه و مدیریت متون طولانی

این مدل به‌طور بومی از پنجره زمینه (Context Window) با اندازه ۲۶۲,۱۴۴ توکن پشتیبانی می‌کند. پنجره زمینه شبیه به میز کاری است که مدل در هر لحظه چند ورق را روی آن نگه می‌دارد. با استفاده از تکنیک‌های مقیاس‌بندی RoPE مانند YaRN، این ظرفیت تا ۱,۰۰۰,۰۰۰ توکن قابل گسترش است که توسط vLLM، SGLang و TokenSpeed پشتیبانی می‌شود.

برای فعال‌سازی YaRN، کاربران می‌توانند فایل config.json را در بخش rope_parameters با rope_theta برابر ۱۰,۰۰۰,۰۰۰ و partial_rotary_factor برابر ۰.۲۵ تغییر دهند. تیم سازنده اشاره می‌کند که ضریب مقیاس‌بندی باید بر اساس کاربرد تنظیم شود؛ مثلاً ضریب ۲.۰ برای ۵۲۴,۲۸۸ توکن مناسب‌تر است.

برای بارهای کاری تولیدی، تیم سازنده محدودیت‌های خروجی خاصی را در این پنجره ۱ میلیون توکنی پیشنهاد می‌کند تا وظایف عامل‌محور بهینه شوند:

  • محتوای استدلالی: حداکثر طول خروجی ۲۶۲,۱۴۴ توکن.
  • پاسخ نهایی: حداکثر طول خروجی ۱۳۱,۰۷۲ توکن.

برای درک ویدیوهای طولانی، تیم پیشنهاد می‌کند پارامتر longest_edge در video_preprocessor_config.json به ۴۶۹,۷۶۲,۰۴۸ افزایش یابد. این مقدار معادل ۲۲۴ هزار توکن ویدیو است و نمونه‌برداری با نرخ فریم بالاتر برای ویدیوهای ساعتی را ممکن می‌سازد.

استقرار و دسترسی به API

برای کسانی که نمی‌خواهند درگیر مدیریت زیرساخت شوند، Qwen Cloud نسخه میزبانی‌شده را ارائه می‌دهد. این سرویس به‌طور پیش‌فرض پنجره متنی ۱ میلیون توکنی و ابزارهای داخلی رسمی را پشتیبانی می‌کند.

توسعه‌دهندگان می‌توانند از SDK پایتون OpenAI برای یکپارچه‌سازی استفاده کنند. API از پارامترهای خاص extra_body برای فعال یا غیرفعال کردن حالت تفکر و حفظ ردپای استدلال پشتیبانی می‌کند. برای کاربران Qwen Cloud، پارامترهای enable_thinking و preserve_thinking باید مستقیماً ارسال شوند و نباید در chat_template_kwargs قرار گیرند.

برای کاهش تکرارهای بی‌پایان، پارامتر presence_penalty بین ۰ تا ۲ قابل تنظیم است، هرچند مقادیر بالاتر ممکن است گاهی باعث ترکیب زبان‌ها یا افت جزئی عملکرد شود.

جزئیات فنی پیاده‌سازی

تیم Qwen دستورالعمل‌های دقیقی برای بهینه‌سازی در مودالیته‌ها و چارچوب‌های مختلف ارائه کرده است:

پردازش ویدیو:

  • نمونه‌برداری: به‌طور پیش‌فرض از fps=2 و do_sample_frames=True استفاده می‌شود.
  • پیکربندی: کاربران می‌توانند مقدار fps را از طریق extra_body هنگام استفاده از vLLM با دستور --media-io-kwargs '{"video": {"num_frames": -1}}' سفارشی کنند.
  • بهینه‌سازی: تنظیم longest_edge روی ۴۶۹,۷۶۲,۰۴۸ و shortest_edge روی ۴۰۹۶ در پیکربندی پیش‌پردازشگر برای تحلیل ویدیوهای ساعتی توصیه می‌شود.

تنظیمات چارچوب‌های متن-طولانی:

  • vLLM: نیاز به VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 و --hf-overrides خاص برای rope_parameters جهت رسیدن به ۱ میلیون توکن دارد.
  • SGLang: نیاز به SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 و --json-model-override-args برای گسترش مشابه زمینه دارد.
  • TokenSpeed: نیاز به TOKENSPEED_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 و --hf-overrides برای فعال‌سازی محدودیت ۱ میلیون توکن دارد.

متدولوژی ارزیابی:

  • ابزار کدنویسی: SWE-bench Pro و DeepSWE 1.1 با استفاده از Claude Code در temp=1.0 و top_p=0.95 ارزیابی شدند.
  • NL2Repo-Bench: دستورات Bash برای دسترسی به مخازن خاص (مانند pip install یا git clone) غیرفعال شدند تا از «سوءاستفاده از پاداش» (Reward Hacking) جلوگیری شود.
  • قضاوت چندوجهی: ارزیابی‌های Vision2Web توسط مدل gpt-5.4-2026-03-05 با استفاده از Claude Code انجام شده است.
  • ClawEval-MM: به صورت «Pass@3 / میانگین امتیاز» گزارش شده است، که در آن Pass@3 درصد وظایفی است که حداقل در یکی از سه تلاش پاس شده‌اند.

تحلیل: ظهور مدل‌های «متراکم استدلالی»

مدل Qwen3.8-27B سیگنالی است برای فاصله گرفتن از شعار «هرچه بزرگتر، بهتر». علی‌بابا با گنجاندن استدلال در سطح مدل‌های پیشرو در یک بدنه ۲۷ میلیارد پارامتری، هوش مصنوعی عامل‌محور سطح بالا را برای سخت‌افزارهای میان‌رده عملی کرده است.

این موضوع پیش‌فرض‌های این حوزه را درباره هزینه تفکر «سیستم ۲» (System 2) تغییر می‌دهد. اگر یک مدل ۲۷ میلیاردی بتواند به ۸۹.۲٪ در GPQA Diamond برسد، نیاز به مدل‌های تریلیون پارامتری برای وظایف پژوهشی تخصصی کاهش می‌یابد.

برای کاربر نهایی، این به معنای عامل‌های محلی قابل‌اعتمادتر است. توانایی تنظیم reasoning_effort به توسعه‌دهندگان اجازه می‌دهد اپلیکیشن‌هایی بسازند که برای پرس‌وجوهای ساده سریع و برای حل مسائل پیچیده عمیق باشند، بدون اینکه نیاز به تعویض مدل داشته باشند. در وظایف عامل‌محور چندمرحله‌ای، تیم هشدار می‌دهد که تلاش استدلالی کمتر همیشه زمان کل را کاهش نمی‌دهد، زیرا می‌تواند منجر به شکست‌های بیشتر و تکرار تلاش‌ها شود.

منتظر باشید تا جامعه توسعه‌دهندگان این وزن‌ها را از طریق Unsloth بازتنظیم (Fine-tune) کنند، زیرا افزودن پشتیبانی از نقش توسعه‌دهنده احتمالاً منجر به موجی از عامل‌های کدنویسی تخصصی خواهد شد.

گام بعدی شما

  • اگر از سخت‌افزارهای مصرف‌کننده استفاده می‌کنید، نسخه‌های GGUF منتشر شده توسط Unsloth را برای تجربه استدلال محلی امتحان کنید.
  • برای وظایف پیچیده کدنویسی، پارامتر reasoning_effort را روی xhigh قرار دهید تا دقت مدل را به حداکثر برسانید.
  • در صورت استفاده از API، قابلیت preserve_thinking را فعال کنید تا در گفتگوهای طولانی، مدل رشته افکار خود را گم نکند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار تیم Qwen، ثابت می‌کند که استدلال سطح بالا دیگر انحصار مدل‌های تریلیونی نیست. این دستاورد باعث می‌شود استقرار عامل‌های هوشمند در لبه (Edge) برای صنایع حساس به حریم خصوصی ممکن شود.

تأثیر برای ایران

به‌دلیل وزن‌های باز، توسعه‌دهندگان ایرانی می‌توانند این مدل را بدون نیاز به APIهای تحریمی روی سرورهای داخلی مستقر کنند و از آن برای ساخت عامل‌های کدنویسی تخصصی استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز علی‌بابا بر مدل‌های «متراکم استدلالی» نشان می‌دهد که عصر رقابت بر سر تعداد پارامترها به پایان رسیده است. وقتی یک مدل ۲۷ میلیاردی می‌تواند در استدلال‌های علمی با مدل‌های غول‌پیکر رقابت کند، هزینه «تفکر سیستم ۲» به‌شدت کاهش می‌یابد. این یعنی عامل‌های محلی و خصوصی به‌زودی جایگزین سرویس‌های ابری گران‌قیمت برای کارهای تخصصی می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.