پرش به محتوای اصلی
پرش به محتوای مقاله

Qwen3.8 Max در برابر رقبا؛ استدلال قوی‌تر اما توهم بیشتر

·۱۵ مرداد ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
مدل جدید کیوئن علی‌بابا هم شغلت را می‌گیرد، اما این بار عالی است
مدل جدید کیوئن علی‌بابا هم شغلت را می‌گیرد، اما این بار عالی است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی بهره‌وری با قدرت استدلال خام؛ مدل جدید علی‌بابا با افزایش ۱۵ برابری مصرف توکن در هر عملیات، توانسته است به سطح هوش مدل‌های برتر جهان برسد.

۱.۱۴ دلار؛ این قیمت یک عملیات ساده در مدل Qwen3.8 Max است که بیش از دو برابر هزینه نسل پیشین است. طبق گزارش ۶ اوت ۲۰۲۶ از وب‌سایت Artificial Analysis، علی‌بابا در جدیدترین مدل خود، بهره‌وری اقتصادی را فدای قدرت خالص استدلال کرده است. این رویکرد در حالی اتخاذ شده که علی‌بابا پیش‌تر با رونمایی از مدل Qwen3.8 Max با ۲.۴ تریلیون پارامتر، ابعاد گسترده‌ی این معماری را به نمایش گذاشته بود.

این تغییر در حالی رخ می‌دهد که صنعت به سمت محاسبات زمان استنتاج (Test-time Compute) — شبیه به مهندسی که پیش از اجرای نقشه، ساعت‌ها روی جزئیات فکر می‌کند تا خطا نکند — حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی شکست عامل‌های هوش مصنوعی در مقیاس واقعی اشاره کردیم، تعادل میان پایداری و هزینه همیشه شکننده است و رویکرد جدید Qwen راستی‌آزمایی می‌کند.

بر اساس مستندات منتشر شده، عملکرد این مدل در محک‌های مختلف به این شرح است:

  • شاخص هوشمندی: مدل Qwen3.8 Max امتیاز ۵۶ را کسب کرد که با Claude Opus 4.8 برابری می‌کند و از GLM-5.2 (امتیاز ۵۱) پیشی گرفته است.
  • GDPval-AA: این مدل با جهش ۴۶۸ واحدی به امتیاز ۱,۷۳۹ رسید و Kimi K3 (امتیاز ۱,۶۸۵) را شکست داد. در این رده‌بندی تنها Claude Opus 5 با امتیاز ۱,۸۵۲ برتر است.

کیمی K3 با ۲۵٪ هزینه کمتر، همچنان از کیوئن ۳.۸ مکس و کلود اوپوس ۴.۸ پیشی می‌گیرد.

به نقل از گزارش‌های فنی، این پیشرفت با جریمه‌های سنگینی همراه شده است. مدل Qwen3.8 Max برای هر تسک به ۶۴ گام نیاز دارد، در حالی که این عدد در نسخه قبل تنها ۱۴ بود. همچنین حجم توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — به دلیل ارسال مجدد تاریخچه کامل گفتگو در هر گام، ۱۵ برابر افزایش یافته است.

اگرچه علی‌بابا قیمت خام توکن‌های ورودی را از ۲.۵۰ به ۲.۰۰ دلار برای هر میلیون توکن کاهش داد، اما حجم عظیم مصرفی در هر تسک، نسبت قیمت به عملکرد را نابود کرده است. برای مقایسه، Kimi K3 در شاخص هوشمندی تنها یک امتیاز کمتر دارد اما هر تسک را با قیمت ۰.۸۶ دلار به پایان می‌رساند.

اعتماد به مدل نیز کاهش یافته است. نرخ توهم (Hallucination) — وقتی مدل با اطمینان چیزی را می‌گوید که وجود ندارد، شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — در آزمون AA-Omniscience از ۲۳٪ به ۴۰٪ رسید. مدل اکنون به‌جای پذیرش نادانی، بیشتر به حدس زدن روی می‌آورد.

کاربران تجاری باید بررسی کنند که آیا این gains در استدلال، بازگشت سرمایه (ROI) واقعی ایجاد می‌کند یا تأخیر و هزینه بالا، آن را به یک بدهی تبدیل می‌کند. پرسش کلیدی این است که آیا آزمایشگاه‌های دیگر می‌توانند بدون انفجار ۱۵ برابری توکن‌ها، به چنین امتیازاتی برسند.

گام بعدی شما

  • اگر از Qwen3.8 Max برای تسک‌های انبوه استفاده می‌کنید، حتماً هزینه هر عملیات را با نسخه قبلی مقایسه کنید.
  • نرخ توهم ۴۰ درصدی را در خروجی‌های حساس با لایه‌ای از بازبینی انسانی کنترل کنید.
  • عملکرد Kimi K3 را به عنوان جایگزینی بهینه از نظر هزینه-به-عملکرد تست کنید.

اما داستان سخت‌افزاری مدیریت این هزینه‌ها حتی پیچیده‌تر است؛ به تحلیل ما درباره معماری تراشه‌های جدید برای استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش نشان می‌دهد که افزایش هوش در مدل‌های زاینده فعلاً با هزینهٔ عملیاتی مستقیم گره خورده است. اعتبار داده‌های Artificial Analysis تأیید می‌کند که رسیدن به سطح Claude Opus نیازمند صرف محاسبات بسیار بیشتر در لحظه پاسخ‌دهی است.

تأثیر برای ایران

به دلیل هزینه‌های بالای استنتاج و تحریم‌های API، استفاده از Qwen3.8 Max برای استارتاپ‌های ایرانی در مقیاس بالا به‌صرفه نیست و مدل‌های کوچک‌تر یا متن‌باز جایگزین بهتری هستند.

·نگاه ما
تحریریه دات‌هوش

به نظر ما علی‌بابا با این مدل اعتراف کرده که در حال حاضر راهی برای افزایش هوش بدون مصرف متکثف منابع پیدا نکرده است. این رویکرد «قدرت به هر قیمتی»، مدل را برای کاربردهای خاص (Niche) عالی اما برای استقرار در مقیاس تجاری (Enterprise) بسیار پرریسک می‌کند، زیرا هزینه استنتاج را به متغیری غیرقابل پیش‌بینی تبدیل کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.