پرش به محتوای اصلی
پرش به محتوای مقاله

Qwen3.8-Flash-Next در برابر Claude Opus 4.6 در کدنویسی

·۴ شهریور ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
علی‌بابا مدل متن‌باز کیوئن ۳.۸ را معرفی کرد؛ ادعا می‌کند پس از فیبل ۵ در رتبه دوم قرار دارد
علی‌بابا مدل متن‌باز کیوئن ۳.۸ را معرفی کرد؛ ادعا می‌کند پس از فیبل ۵ در رتبه دوم قرار دارد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از لایه N-gram embedding با ۵۱ میلیارد پارامتر در رم سیستم برای کاهش هزینه آموزش و استنتاج بدون افت کیفیت در کدنویسی.

اگر امروز برای استقرار مدل‌های کدنویسی بودجه تخصیص می‌دهید، باید بدانید که هزینه آموزش مدل‌های سطح بالا در حال سقوط است. مدل Qwen3.8-Flash-Next نتایجی برتر در کدنویسی و کارهای اداری ارائه می‌دهد، در حالی که هزینه آموزش آن تنها یک‌نهم مدل پیشین یعنی Qwen3.7-Plus است.

طبق اعلام شرکت علی‌بابا در ۲۶ اوت ۲۰۲۶، این مدل چندوجهی (Multimodal) — شبیه انسانی که هم‌زمان متن، عکس و صدا را می‌فهمد — از معماری ترکیب خبره‌ها (Mixture of Experts) استفاده می‌کند و پیش‌نمایشی از ساختار Qwen4 است. این رویکرد در راستای استراتژی جدید این شرکت است که بهینه‌سازی شدید استنتاج را هدف اصلی معرفی مدل‌های جدید قرار داده است.

این عرضه در حالی رخ می‌دهد که آزمایشگاه‌های هوش مصنوعی از تعقیب اندازه پارامترها به سمت «بهره‌وری نهایی هزینه» حرکت کرده‌اند. در حالی که مدل‌های پرچمداری مثل Qwen3.8-Max برای بالاترین سطح عملکرد طراحی شده‌اند، نسخه Flash-Next قصد دارد قابلیت‌های نزدیک به پرچمدار را با هزینه‌ای ناچیز فراهم کند. این در حالی است که مدل Qwen3.8-Max با ۲.۴ تریلیون پارامتر به عنوان قدرتمندترین نسخه برای کارهای پیچیده عرضه شده بود. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کاهش هزینه استنتاج اکنون اولویت اول صنعت است.

جزئیات معماری

علی‌بابا روی «هوش پراکنده» تمرکز کرده است. این تیم ثابت کرد که با فعال کردن بخش کوچکی از مغز مدل برای هر کلمه، می‌توان کیفیت خروجی را در حوزه‌هایی مثل مهندسی نرم‌افزار بالا برد.

این رویکرد مستقیماً مدل‌های بزرگ‌تر را به چالش می‌کشد. برای مقایسه، مدل Qwen3.7-Plus دارای ۳۹۷ میلیارد پارامتر است که ۱۷ میلیارد از آن‌ها برای هر توکن فعال می‌شوند؛ یعنی تقریباً سه برابر مدل Flash-Next.

بهره‌وری این مدل از یک طراحی ترکیبی می‌آید. مدل در مجموع ۱۲۵ میلیارد پارامتر دارد اما برای هر توکن (Token) — تکه‌های کوچکی از متن شبیه برش‌های کیک — تنها ۶ میلیارد پارامتر را فعال می‌کند. نوآوری اصلی، لایه بردار معنایی (Embedding) با ۵۱ میلیارد پارامتر است که مثل یک «دیکشنری عبارات» برای گروه‌های رایج کلمات عمل می‌کند.

آلibaba مدل Qwen3.8-Flash-Next را با هدف «بهره‌وری هزینه نهایی» منتشر کرد.

بر اساس مستندات فنی، این لایه برخلاف لایه‌های استاندارد، در رم سیستم قرار می‌گیرد نه در حافظه گران‌قیمت GPU (واحد پردازش گرافیکی). این لایه اطلاعات سطح عبارت را با هزینه کم به ابتدای شبکه می‌فرستد. همچنین مدل از پنجره زمینه (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جای چند ورق دارد — با اندازه ۲۶۲,۱۴۴ توکن پشتیبانی می‌کند که با استفاده از YaRN تا یک میلیون توکن قابل گسترش است.

تحلیل عملکرد

به نقل از گزارش فنی تیم Qwen در گیت‌هاب، این مدل در گردش‌های کاری عامل‌محور (Agentic) — یعنی وقتی هوش مصنوعی باید مستقل باگ‌ها را در پروژه‌های واقعی پیدا و رفع کند — درخشان ظاهر شده است:

  • کدنویسی: امتیاز ۵۸.۷ در DeepSWE و ۶۲.۵ در SWE-bench Pro را کسب کرد و از DeepSeek-V4-Flash و Claude Opus 4.6 (Max) پیشی گرفت.
  • بهره‌وری: در CoWorkBench به امتیاز ۷۳.۹ رسید که به‌طور قابل‌توجهی بالاتر از ۴۵.۱ مدل DeepSeek است.
  • جریان‌های کاری حرفه‌ای: امتیاز ۵۵.۷ در JobBench را به دست آورد که تقریباً دو برابر امتیاز ۲۷.۶ مدل Qwen3.7-Plus است.
  • هوش عمومی: امتیاز ۸۱.۳ در IFBench و ۵۱.۲ در Agents' Last Exam ثبت کرد.

در استدلال علمی رقابت نزدیک است. در محک GPQA Diamond، مدل Flash-Next امتیاز ۹۱.۷ و در LiveCodeBench v6 امتیاز ۹۱.۹ را گرفت. با این حال، Claude Opus 4.6 همچنان در آزمون «آخرین امتحان بشریت» پیشتاز است.

برای کاربر تجاری، این یعنی کاهش شدید قیمت. نسخه تولیدی یعنی Qwen3.8-Flash با قیمت ۰.۱۶ دلار برای هر میلیون توکن ورودی و ۰.۴۷ دلار برای هر میلیون توکن خروجی عرضه شده است. این قیمت تقریباً ۱۲ برابر ارزان‌تر از پرچمدار Qwen3.8-Max است.

این استراتژی فشار شدیدی به OpenAI و Anthropic وارد می‌کند. OpenAI پیش از این با تخفیف‌های شدید در خط GPT-5.6 واکنش نشان داد تا از مهاجرت توسعه‌دهندگان به مدل‌های وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پختشان علناً منتشر شده — جلوگیری کند.

در حالی که رشد درآمد ارائه‌دهندگان هوش مصنوعی به دلیل این جنگ قیمتی کند می‌شود، کاربر نهایی برنده است. کدنویسی عامل‌محور با کارایی بالا، از یک سرویس لوکس به یک کالای عمومی تبدیل می‌شود.

توسعه‌دهندگان اکنون می‌توانند وزن‌های مدل را در Hugging Face و ModelScope برای تست محلی دریافت کنند.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای اتوماسیون کدنویسی استفاده می‌کنید، مدل Qwen3.8-Flash را جایگزین کنید تا هزینه‌هایتان تا ۹۰٪ کم شود.
  • معماری N-gram embedding را در پروژه‌های بهینه‌سازی حافظه بررسی کنید.
  • مدل را روی سخت‌افزارهای محلی تست کنید تا سرعت استنتاج در محیط‌های بسته را بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار فنی تیم Qwen، توازن قدرت را به نفع مدل‌های کوچک و ارزان تغییر می‌دهد. کاهش شدید هزینه استنتاج باعث می‌شود ابزارهای کدنویسی خودکار برای استارتاپ‌های کوچک به‌صرفه شود.

تأثیر برای ایران

به دلیل وزن‌های باز بودن مدل، توسعه‌دهندگان ایرانی می‌توانند آن را به‌صورت محلی میزبانی کنند و از هزینه‌های ارزی APIهای خارجی در پروژه‌های کدنویسی خود بکاهند.

·نگاه ما
تحریریه دات‌هوش

تمرکز علی‌بابا بر لایه‌های Embedding در رم سیستم به‌جای VRAM، یک چرخش هوشمندانه برای دور زدن گلوگاه‌های سخت‌افزاری است. این رویکرد نشان می‌دهد که برای رسیدن به عملکرد سطح پرچمدار، لزوماً نیاز به افزایش پارامترهای فعال نیست، بلکه مدیریت هوشمندانه حافظه می‌تواند کیفیت را بدون افزایش هزینه استنتاج بالا ببرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.