آیا یک مدل متراکم با ۲۷ میلیارد پارامتر میتواند در ناوبری خودکار مرورگر و سیستمعامل، سیستمهای بسته و عظیم را شکست دهد؟ تیم Qwen با معرفی Qwen3.8-27B پاسخی قاطع به این پرسش داد و این فرض قدیمی را که تسلط عاملمحور (Agentic) نیازمند تعداد پارامترهای نجومی است، به چالش کشید.
این عرضه در حالی رخ میدهد که صنعت از رابطهای چت ایستا به سمت هوش مصنوعی عاملمحور حرکت میکند؛ مدلهایی که میتوانند در محیطهای نرمافزاری واقعی برنامهریزی کنند، اجرا نمایند و از خطاها بازیابی شوند. در حالی که نسلهای پیشین بر بازیابی دانش خام تمرکز داشتند، سری Qwen3.8 بهطور خاص روی «شکاف عملیاتی» تمرکز کرده است؛ جایی که مدل باید ادراک بصری را به کلیکها و ضربات دقیق روی کیبورد تبدیل کند. این رویکرد در راستای استراتژی جامع علیبابا برای ارائه طیفی از مدلهاست که پیشتر با عرضه مدل عظیم Qwen3.8-Max با ۲.۴ تریلیون پارامتر آغاز شده بود تا نیازهای مختلف از استدلال پیچیده تا اجرای سریع پوشش داده شود.
برای توسعهدهندگان، این یک چرخش به سمت استقلال در میزبانی شخصی (Self-hosting) است. بهجای اتکای دائمی به APIهای گرانقیمت و بسته برای اتوماسیون مرورگر یا عاملهای کدنویسی، تیمها اکنون میتوانند مدلی را روی زیرساخت خود مستقر کنند که با برترینهای دنیای مدلهای تجاری رقابت میکند. این مدل بخشی از مجموعه مدلهای با وزنهای باز سری Qwen3.8 است که هدف آنها تسهیل استقرار محلی هوش مصنوعی برای سازمانها و توسعهدهندگان است.
معماری و قابلیتهای کلیدی
Qwen3.8-27B یک ترنسفورمر (Transformer) استاندارد نیست. این مدل از یک معماری ترکیبی استفاده میکند تا تعادلی میان استدلال دقیق و کارایی لازم برای حجمهای بالای متنی ایجاد کند. این مدل یک مدل زبانی علی (Causal) با یک رمزگذار بینایی است؛ به این معنا که بهطور بومی برای استدلال روی متن، تصویر و ویدیوهای طولانی آموزش دیده و از آداپتورهای چندوجهی الحاقی (Bolted-on) استفاده نمیکند.
مشخصات فنی
- پارامترها: ۲۷ میلیارد (۲۸ میلیارد با احتساب سربار Padding).
- بعد پنهان: ۵,۱۲۰ با ۶۴ لایه.
- الگوی لایهها: ۱۶ × (۳ × (Gated DeltaNet → FFN) → ۱ × (Gated Attention → FFN)).
- Gated DeltaNet: ۴۸ سر (V) و ۱۶ سر (QK) با بعد سر ۱۲۸.
- Gated Attention: ۲۴ سر (Q) و ۴ سر (KV) با بعد سر ۲۵۶ و RoPE dim ۶۴.
- بعد میانی FFN: ۱۷,۴۰۸.
- واژگان: ۲۴۸,۳۲۰ توکن (Token).
- آموزش: بهرهگیری از پیشبینی چند-توکنی (Multi-Token Prediction).
ویژگیهای برجسته
- چیدمان ترکیبی: مدل برای اکثر لایهها از Gated DeltaNet (نوعی توجه خطی) استفاده میکند و هر چهار زیر-بلاک، یک بلوک Gated Attention کامل قرار میدهد. این ساختار هزینه محاسبات و KV Cache را برای متون طولانی کاهش میدهد اما توجه جهانی را برای استدلالهای سخت حفظ میکند.
- چندوجهی بومی: مدل قادر به پردازش هر چیزی از نمودارهای STEM و اسناد متراکم گرفته تا ویدیوهای یکساعته است.
- پنجره زمینه: پشتیبانی بومی از ۲۶۲,۱۴۴ توکن که با مقیاسبندی YaRN تا ۱,۰۰۰,۰۰۰ توکن قابل گسترش است.
- کنترل تفکر: استدلال بهصورت پیشفرض از طریق تگهای
<think>فعال است. کاربران میتوانند پارامترreasoning_effortرا بین حالتهایxhigh(پیشفرض/دقیق)،medium(متعادل) وlow(سریع/ارزان) تنظیم کنند.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای کوچک اشاره کردیم، کاهش اندازه بدون افت کیفیت، کلید دموکراتیزه کردن هوش مصنوعی است.
محک استدلال و جهش عاملمحور
بر اساس مستندات فنی، جهش از Qwen3.6 به Qwen3.8 بهویژه در وظایف مهندسی نرمافزار خیرهکننده است. در محک DeepSWE 1.1، مدل Qwen3.8-27B امتیاز ۴۲.۲ را کسب کرد که بیش از سه برابر امتیاز ۱۳.۳ مدل پیشین (Qwen3.6-27B) است. همچنین در QwenSWEBench، امتیاز این مدل از ۴۹.۳ به ۷۹.۰ رسید.
در رویارویی مستقیم با مدل بسته Opus4.6 Max، مدل ۲۷ میلیاردی در چندین جبهه پیروز شد:
- SWE-bench Pro: مدل Qwen (۶۱.۷) در برابر Opus (۵۳.۴).
- CoWorkBench: مدل Qwen (۷۰.۷) در برابر Opus (۶۸.۲).
- LiveCodeBench v6: مدل Qwen (۹۰.۳) در برابر Opus (۸۸.۸).
- QwenSWEBench: مدل Qwen (۷۹.۰) در برابر Opus (۶۳.۸).
- NL2Repo-Bench: مدل Qwen (۴۲.۳) در برابر Opus (۴۷.۶).
با این حال، Opus4.6 Max همچنان در استدلالهای کلی (GPQA Diamond: ۹۱.۳ در برابر ۸۹.۲ و HLE: ۴۰.۰ در برابر ۳۰.۸) و اجرای خام ترمینال (Terminal-Bench 2.1: ۷۸.۲ در برابر ۷۳.۰) برتری دارد.
تسلط در محیطهای چندوجهی
بیشترین تفاوت در محکهای «استفاده از کامپیوتر» دیده میشود. Qwen3.8-27B در OSWorld-Verified به امتیاز ۸۴.۳ و در AndroidWorld به ۸۱.۹ رسید که بهطور قابلتوجهی بالاتر از امتیازات ۷۲.۷ و ۶۲.۰ مدل Opus است. همچنین در WebArena-Verified (۶۴.۸) و RecreationBench (۴۷.۱) پیشتاز است.
در جزئیات بینایی-زبانی:
- مهندسی نرمافزار چندوجهی: در محک SWE-MM، مدل Qwen3.8-27B امتیاز ۳۸.۶ را کسب کرد و هر دو رقیب خود یعنی Opus4.6 Max (۲۷.۱) و Qwen3.6-27B (۲۵.۷) را شکست داد.
- ادراک بصری: برای وظایف ایستا، مدل Qwen3.7-Plus برتری اندکی دارد. برای مثال در OmniDocBench 1.5، مدل Qwen3.7-Plus امتیاز ۹۱.۴ و Qwen3.8-27B امتیاز ۹۱.۱ را کسب کرد.
- استدلال تخصصی: عملکرد قدرتمندی در MathVision (۹۴.۶) و BabyVision (۸۵.۶) نشان داد.
- استدلال تجسمیافته: در ERQA امتیاز ۶۵.۵ را به دست آورد که در مقایسه با ۴۰.۸ مدل Opus، نشاندهنده بهینهسازی شدید برای «عمل بر اساس دادههای بصری» بهجای توصیف صرف آنهاست.
این نتایج نشان میدهد که مدل بهطور خاص برای اقدام روی دادههای بصری بهینه شده است. جالب است که مدل همخانواده آن، Qwen3.7-Plus، همچنان در درک اسناد ایستا برتری جزئی دارد که نشاندهنده تفکیک استراتژیک بین تنظیمات «ادراک-محور» و «عمل-محور» است.
استقرار و یکپارچهسازی
این مدل تحت لایسنس Apache 2.0 منتشر شده و با استکهای استاندارد متنباز سازگار است. استقرار از طریق Transformers، vLLM یا SGLang امکانپذیر است که همگی نقاط انتهایی (Endpoints) سازگار با OpenAI را فراهم میکنند.
برای کسانی که از کتابخانه Transformers استفاده میکنند، خط لوله image-text-to-text امکان تعامل مستقیم با تصاویر را فراهم میکند. برای نیازهای با توان عملیاتی بالا، vLLM و SGLang توصیه میشوند. برای گسترش پنجره زمینه به بیش از ۲۶۲ هزار توکن، توصیه میشود بهجای افزایش ساده max-model-len از مقیاسبندی YaRN RoPE استفاده شود، زیرا پیادهسازیهای استاتیک YaRN بخشی از عملکرد در زمینههای کوتاه را فدای محدوده گستردهتر میکنند.
برای بهینهسازی عملکرد، پارامترهای نمونهگیری متفاوتی توصیه میشود:
- حالت تفکر: Temperature 1.0, top_p 0.95, top_k 20, repetition_penalty 1.0.
- حالت بدون تفکر: Temperature 0.7, top_p 0.80, top_k 20, presence_penalty 1.5.
تیم Qwen قابلیت preserve_thinking را برای گردشکارهای چند-مرحلهای معرفی کرده است. این ویژگی ردپای استدلالهای مراحل قبل را حفظ میکند تا ثبات تصمیمگیری افزایش یابد و از KV Cache در وظایف طولانیمدت بهتر استفاده شود. همچنین کاربران میتوانند از طریق chat_template_kwargs مقدار enable_thinking را روی False تنظیم کنند تا برای کاربردهای حساس به تأخیر (Latency)، از مرحله استدلال عبور کنند.
تحلیل تحریریه
مدل Qwen3.8-27B بهطور بنیادی تحلیل هزینه-فایده برای ساخت عاملهای هوش مصنوعی را تغییر میدهد. برای سالها، صنعت بر این باور بود که قابلیتهای عاملمحور پیشرو — یعنی توانایی ناوبری در یک سیستمعامل پیچیده یا یک کدبیس عظیم — منحصراً در اختیار مدلهایی با صدها میلیارد پارامتر است.
علیبا با ارائه نتایج برتر در محکهای استفاده از کامپیوتر تنها با ۲۷ میلیارد پارامتر، ثابت کرد که کارایی معماری و دادههای آموزشی هدفمند، بسیار مهمتر از مقیاس خام هستند. این امر مانع ورود شرکتها برای ساخت خطوط اتوماسیون خصوصی و امن را بدون پرداخت «مالیات API» یا نگرانیهای حریم خصوصی دادههای مدلهای بسته، کاهش میدهد.
با این حال، اتکا به محکهای منتشر شده توسط سازنده همچنان یک نکته قابل تامل است. از آنجایی که این ارزیابیها با استفاده از ابزار Claude Code و با اصلاحات خود تیم Qwen انجام شده است، جامعه باید به سمت بازتولید مستقل حرکت کند تا تایید شود که این دستاوردها در موارد لبهای (Edge cases) متنوع و واقعی نیز پابرجا هستند.
گام بعدی شما
- اگر در حال توسعه عاملهای کدنویسی هستید، مدل را با تنظیمات
reasoning_effortمختلف تست کنید تا نقطه بهینه میان تأخیر و دقت را بیابید. - برای کاهش هزینههای استنتاج در محیطهای تولیدی، استقرار مدل از طریق vLLM یا SGLang را جایگزین APIهای بسته کنید.
- قابلیت
preserve_thinkingرا در تسکهای پیچیده فعال کنید تا از تکرار استدلالهای مشابه در هر Turn جلوگیری شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو