پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Qwen3.8-27B در وظایف عامل‌محور چندوجهی از Opus4.6 Max پیشی گرفت

·۲۸ مرداد ۱۴۰۵۶ دقیقه مطالعه
بررسی عمیق Qwen3.8-27B: قدرتمندترین مدل بینایی-زبانی جدید Qwen
بررسی عمیق Qwen3.8-27B: قدرتمندترین مدل بینایی-زبانی جدید Qwen
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شکست مدل‌های بسته پیشرو (مانند Opus) در وظایف عملیاتی کامپیوتر توسط یک مدل ۲۷ میلیاردی با وزن‌های باز؛ این اولین بار است که یک مدل کوچک در مقیاس واقعی، در کنترل سیستم‌عامل بر مدل‌های عظیم غلبه می‌کند.

آیا یک مدل متراکم با ۲۷ میلیارد پارامتر می‌تواند در ناوبری خودکار مرورگر و سیستم‌عامل، سیستم‌های بسته و عظیم را شکست دهد؟ تیم Qwen با معرفی Qwen3.8-27B پاسخی قاطع به این پرسش داد و این فرض قدیمی را که تسلط عامل‌محور (Agentic) نیازمند تعداد پارامترهای نجومی است، به چالش کشید.

این عرضه در حالی رخ می‌دهد که صنعت از رابط‌های چت ایستا به سمت هوش مصنوعی عامل‌محور حرکت می‌کند؛ مدل‌هایی که می‌توانند در محیط‌های نرم‌افزاری واقعی برنامه‌ریزی کنند، اجرا نمایند و از خطاها بازیابی شوند. در حالی که نسل‌های پیشین بر بازیابی دانش خام تمرکز داشتند، سری Qwen3.8 به‌طور خاص روی «شکاف عملیاتی» تمرکز کرده است؛ جایی که مدل باید ادراک بصری را به کلیک‌ها و ضربات دقیق روی کیبورد تبدیل کند. این رویکرد در راستای استراتژی جامع علی‌بابا برای ارائه طیفی از مدل‌هاست که پیش‌تر با عرضه مدل عظیم Qwen3.8-Max با ۲.۴ تریلیون پارامتر آغاز شده بود تا نیازهای مختلف از استدلال پیچیده تا اجرای سریع پوشش داده شود.

برای توسعه‌دهندگان، این یک چرخش به سمت استقلال در میزبانی شخصی (Self-hosting) است. به‌جای اتکای دائمی به APIهای گران‌قیمت و بسته برای اتوماسیون مرورگر یا عامل‌های کدنویسی، تیم‌ها اکنون می‌توانند مدلی را روی زیرساخت خود مستقر کنند که با برترین‌های دنیای مدل‌های تجاری رقابت می‌کند. این مدل بخشی از مجموعه مدل‌های با وزن‌های باز سری Qwen3.8 است که هدف آن‌ها تسهیل استقرار محلی هوش مصنوعی برای سازمان‌ها و توسعه‌دهندگان است.

معماری و قابلیت‌های کلیدی

Qwen3.8-27B یک ترنسفورمر (Transformer) استاندارد نیست. این مدل از یک معماری ترکیبی استفاده می‌کند تا تعادلی میان استدلال دقیق و کارایی لازم برای حجم‌های بالای متنی ایجاد کند. این مدل یک مدل زبانی علی (Causal) با یک رمزگذار بینایی است؛ به این معنا که به‌طور بومی برای استدلال روی متن، تصویر و ویدیوهای طولانی آموزش دیده و از آداپتورهای چندوجهی الحاقی (Bolted-on) استفاده نمی‌کند.

مشخصات فنی

  • پارامترها: ۲۷ میلیارد (۲۸ میلیارد با احتساب سربار Padding).
  • بعد پنهان: ۵,۱۲۰ با ۶۴ لایه.
  • الگوی لایه‌ها: ۱۶ × (۳ × (Gated DeltaNet → FFN) → ۱ × (Gated Attention → FFN)).
  • Gated DeltaNet: ۴۸ سر (V) و ۱۶ سر (QK) با بعد سر ۱۲۸.
  • Gated Attention: ۲۴ سر (Q) و ۴ سر (KV) با بعد سر ۲۵۶ و RoPE dim ۶۴.
  • بعد میانی FFN: ۱۷,۴۰۸.
  • واژگان: ۲۴۸,۳۲۰ توکن (Token).
  • آموزش: بهره‌گیری از پیش‌بینی چند-توکنی (Multi-Token Prediction).

ویژگی‌های برجسته

  • چیدمان ترکیبی: مدل برای اکثر لایه‌ها از Gated DeltaNet (نوعی توجه خطی) استفاده می‌کند و هر چهار زیر-بلاک، یک بلوک Gated Attention کامل قرار می‌دهد. این ساختار هزینه محاسبات و KV Cache را برای متون طولانی کاهش می‌دهد اما توجه جهانی را برای استدلال‌های سخت حفظ می‌کند.
  • چندوجهی بومی: مدل قادر به پردازش هر چیزی از نمودارهای STEM و اسناد متراکم گرفته تا ویدیوهای یک‌ساعته است.
  • پنجره زمینه: پشتیبانی بومی از ۲۶۲,۱۴۴ توکن که با مقیاس‌بندی YaRN تا ۱,۰۰۰,۰۰۰ توکن قابل گسترش است.
  • کنترل تفکر: استدلال به‌صورت پیش‌فرض از طریق تگ‌های <think> فعال است. کاربران می‌توانند پارامتر reasoning_effort را بین حالت‌های xhigh (پیش‌فرض/دقیق)، medium (متعادل) و low (سریع/ارزان) تنظیم کنند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های کوچک اشاره کردیم، کاهش اندازه بدون افت کیفیت، کلید دموکراتیزه کردن هوش مصنوعی است.

محک استدلال و جهش عامل‌محور

بر اساس مستندات فنی، جهش از Qwen3.6 به Qwen3.8 به‌ویژه در وظایف مهندسی نرم‌افزار خیره‌کننده است. در محک DeepSWE 1.1، مدل Qwen3.8-27B امتیاز ۴۲.۲ را کسب کرد که بیش از سه برابر امتیاز ۱۳.۳ مدل پیشین (Qwen3.6-27B) است. همچنین در QwenSWEBench، امتیاز این مدل از ۴۹.۳ به ۷۹.۰ رسید.

در رویارویی مستقیم با مدل بسته Opus4.6 Max، مدل ۲۷ میلیاردی در چندین جبهه پیروز شد:

  • SWE-bench Pro: مدل Qwen (۶۱.۷) در برابر Opus (۵۳.۴).
  • CoWorkBench: مدل Qwen (۷۰.۷) در برابر Opus (۶۸.۲).
  • LiveCodeBench v6: مدل Qwen (۹۰.۳) در برابر Opus (۸۸.۸).
  • QwenSWEBench: مدل Qwen (۷۹.۰) در برابر Opus (۶۳.۸).
  • NL2Repo-Bench: مدل Qwen (۴۲.۳) در برابر Opus (۴۷.۶).

با این حال، Opus4.6 Max همچنان در استدلال‌های کلی (GPQA Diamond: ۹۱.۳ در برابر ۸۹.۲ و HLE: ۴۰.۰ در برابر ۳۰.۸) و اجرای خام ترمینال (Terminal-Bench 2.1: ۷۸.۲ در برابر ۷۳.۰) برتری دارد.

تسلط در محیط‌های چندوجهی

بیشترین تفاوت در محک‌های «استفاده از کامپیوتر» دیده می‌شود. Qwen3.8-27B در OSWorld-Verified به امتیاز ۸۴.۳ و در AndroidWorld به ۸۱.۹ رسید که به‌طور قابل‌توجهی بالاتر از امتیازات ۷۲.۷ و ۶۲.۰ مدل Opus است. همچنین در WebArena-Verified (۶۴.۸) و RecreationBench (۴۷.۱) پیشتاز است.

در جزئیات بینایی-زبانی:

  • مهندسی نرم‌افزار چندوجهی: در محک SWE-MM، مدل Qwen3.8-27B امتیاز ۳۸.۶ را کسب کرد و هر دو رقیب خود یعنی Opus4.6 Max (۲۷.۱) و Qwen3.6-27B (۲۵.۷) را شکست داد.
  • ادراک بصری: برای وظایف ایستا، مدل Qwen3.7-Plus برتری اندکی دارد. برای مثال در OmniDocBench 1.5، مدل Qwen3.7-Plus امتیاز ۹۱.۴ و Qwen3.8-27B امتیاز ۹۱.۱ را کسب کرد.
  • استدلال تخصصی: عملکرد قدرتمندی در MathVision (۹۴.۶) و BabyVision (۸۵.۶) نشان داد.
  • استدلال تجسم‌یافته: در ERQA امتیاز ۶۵.۵ را به دست آورد که در مقایسه با ۴۰.۸ مدل Opus، نشان‌دهنده بهینه‌سازی شدید برای «عمل بر اساس داده‌های بصری» به‌جای توصیف صرف آن‌هاست.

این نتایج نشان می‌دهد که مدل به‌طور خاص برای اقدام روی داده‌های بصری بهینه شده است. جالب است که مدل هم‌خانواده آن، Qwen3.7-Plus، همچنان در درک اسناد ایستا برتری جزئی دارد که نشان‌دهنده تفکیک استراتژیک بین تنظیمات «ادراک-محور» و «عمل-محور» است.

استقرار و یکپارچه‌سازی

این مدل تحت لایسنس Apache 2.0 منتشر شده و با استک‌های استاندارد متن‌باز سازگار است. استقرار از طریق Transformers، vLLM یا SGLang امکان‌پذیر است که همگی نقاط انتهایی (Endpoints) سازگار با OpenAI را فراهم می‌کنند.

برای کسانی که از کتابخانه Transformers استفاده می‌کنند، خط لوله image-text-to-text امکان تعامل مستقیم با تصاویر را فراهم می‌کند. برای نیازهای با توان عملیاتی بالا، vLLM و SGLang توصیه می‌شوند. برای گسترش پنجره زمینه به بیش از ۲۶۲ هزار توکن، توصیه می‌شود به‌جای افزایش ساده max-model-len از مقیاس‌بندی YaRN RoPE استفاده شود، زیرا پیاده‌سازی‌های استاتیک YaRN بخشی از عملکرد در زمینه‌های کوتاه را فدای محدوده گسترده‌تر می‌کنند.

برای بهینه‌سازی عملکرد، پارامترهای نمونه‌گیری متفاوتی توصیه می‌شود:

  • حالت تفکر: Temperature 1.0, top_p 0.95, top_k 20, repetition_penalty 1.0.
  • حالت بدون تفکر: Temperature 0.7, top_p 0.80, top_k 20, presence_penalty 1.5.

تیم Qwen قابلیت preserve_thinking را برای گردش‌کارهای چند-مرحله‌ای معرفی کرده است. این ویژگی ردپای استدلال‌های مراحل قبل را حفظ می‌کند تا ثبات تصمیم‌گیری افزایش یابد و از KV Cache در وظایف طولانی‌مدت بهتر استفاده شود. همچنین کاربران می‌توانند از طریق chat_template_kwargs مقدار enable_thinking را روی False تنظیم کنند تا برای کاربردهای حساس به تأخیر (Latency)، از مرحله استدلال عبور کنند.

تحلیل تحریریه

مدل Qwen3.8-27B به‌طور بنیادی تحلیل هزینه-فایده برای ساخت عامل‌های هوش مصنوعی را تغییر می‌دهد. برای سال‌ها، صنعت بر این باور بود که قابلیت‌های عامل‌محور پیشرو — یعنی توانایی ناوبری در یک سیستم‌عامل پیچیده یا یک کدبیس عظیم — منحصراً در اختیار مدل‌هایی با صدها میلیارد پارامتر است.

علی‌با با ارائه نتایج برتر در محک‌های استفاده از کامپیوتر تنها با ۲۷ میلیارد پارامتر، ثابت کرد که کارایی معماری و داده‌های آموزشی هدفمند، بسیار مهم‌تر از مقیاس خام هستند. این امر مانع ورود شرکت‌ها برای ساخت خطوط اتوماسیون خصوصی و امن را بدون پرداخت «مالیات API» یا نگرانی‌های حریم خصوصی داده‌های مدل‌های بسته، کاهش می‌دهد.

با این حال، اتکا به محک‌های منتشر شده توسط سازنده همچنان یک نکته قابل تامل است. از آنجایی که این ارزیابی‌ها با استفاده از ابزار Claude Code و با اصلاحات خود تیم Qwen انجام شده است، جامعه باید به سمت بازتولید مستقل حرکت کند تا تایید شود که این دستاوردها در موارد لبه‌ای (Edge cases) متنوع و واقعی نیز پابرجا هستند.

گام بعدی شما

  • اگر در حال توسعه عامل‌های کدنویسی هستید، مدل را با تنظیمات reasoning_effort مختلف تست کنید تا نقطه بهینه میان تأخیر و دقت را بیابید.
  • برای کاهش هزینه‌های استنتاج در محیط‌های تولیدی، استقرار مدل از طریق vLLM یا SGLang را جایگزین APIهای بسته کنید.
  • قابلیت preserve_thinking را در تسک‌های پیچیده فعال کنید تا از تکرار استدلال‌های مشابه در هر Turn جلوگیری شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با ارائه عملکرد برتر در اتوماسیون سیستم‌عامل با حجم پارامتر کم، هزینه ساخت عامل‌های هوشمند را به‌شدت کاهش می‌دهد. اعتبار این دستاورد از طریق برتری در محک‌های سخت‌گیرانه‌ای چون SWE-bench Pro تأیید شده است.

تأثیر برای ایران

به‌دلیل لایسنس Apache 2.0 و وزن‌های باز، توسعه‌دهندگان ایرانی می‌توانند بدون محدودیت‌های API و تحریم‌ها، این مدل را به‌صورت درون‌سازمانی مستقر کنند و عامل‌های اتوماسیون اختصاصی بسازند.

·نگاه ما
تحریریه دات‌هوش

موفقیت Qwen3.8-27B این فرضیه را می‌شکند که برای رسیدن به توانمندی‌های عامل‌محور در سطح Frontier، لزوماً به مدل‌های غول‌پیکر نیاز نیست. تمرکز علی‌بابا بر داده‌های آموزشی هدفمند برای «عمل» (Action) به‌جای «توصیف»، نشان می‌دهد که کیفیت داده‌های تعاملی با محیط نرم‌افزاری، از تعداد پارامترها مهم‌تر است. این مدل در واقع یک «تخصص‌گرای سریع» است که در محیط‌های عملیاتی، مدل‌های عمومی بزرگ‌تر را به چالش می‌کشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.