۱.۱۴ دلار؛ این قیمت یک عملیات ساده در مدل Qwen3.8 Max است که بیش از دو برابر هزینه نسل پیشین است. طبق گزارش ۶ اوت ۲۰۲۶ از وبسایت Artificial Analysis، علیبابا در جدیدترین مدل خود، بهرهوری اقتصادی را فدای قدرت خالص استدلال کرده است. این رویکرد در حالی اتخاذ شده که علیبابا پیشتر با رونمایی از مدل Qwen3.8 Max با ۲.۴ تریلیون پارامتر، ابعاد گستردهی این معماری را به نمایش گذاشته بود.
این تغییر در حالی رخ میدهد که صنعت به سمت محاسبات زمان استنتاج (Test-time Compute) — شبیه به مهندسی که پیش از اجرای نقشه، ساعتها روی جزئیات فکر میکند تا خطا نکند — حرکت میکند. همانطور که در تحلیل قبلی ما دربارهی شکست عاملهای هوش مصنوعی در مقیاس واقعی اشاره کردیم، تعادل میان پایداری و هزینه همیشه شکننده است و رویکرد جدید Qwen راستیآزمایی میکند.
بر اساس مستندات منتشر شده، عملکرد این مدل در محکهای مختلف به این شرح است:
- شاخص هوشمندی: مدل Qwen3.8 Max امتیاز ۵۶ را کسب کرد که با Claude Opus 4.8 برابری میکند و از GLM-5.2 (امتیاز ۵۱) پیشی گرفته است.
- GDPval-AA: این مدل با جهش ۴۶۸ واحدی به امتیاز ۱,۷۳۹ رسید و Kimi K3 (امتیاز ۱,۶۸۵) را شکست داد. در این ردهبندی تنها Claude Opus 5 با امتیاز ۱,۸۵۲ برتر است.

به نقل از گزارشهای فنی، این پیشرفت با جریمههای سنگینی همراه شده است. مدل Qwen3.8 Max برای هر تسک به ۶۴ گام نیاز دارد، در حالی که این عدد در نسخه قبل تنها ۱۴ بود. همچنین حجم توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — به دلیل ارسال مجدد تاریخچه کامل گفتگو در هر گام، ۱۵ برابر افزایش یافته است.
اگرچه علیبابا قیمت خام توکنهای ورودی را از ۲.۵۰ به ۲.۰۰ دلار برای هر میلیون توکن کاهش داد، اما حجم عظیم مصرفی در هر تسک، نسبت قیمت به عملکرد را نابود کرده است. برای مقایسه، Kimi K3 در شاخص هوشمندی تنها یک امتیاز کمتر دارد اما هر تسک را با قیمت ۰.۸۶ دلار به پایان میرساند.
اعتماد به مدل نیز کاهش یافته است. نرخ توهم (Hallucination) — وقتی مدل با اطمینان چیزی را میگوید که وجود ندارد، شبیه دوستی که خاطرهای را اشتباه تعریف میکند — در آزمون AA-Omniscience از ۲۳٪ به ۴۰٪ رسید. مدل اکنون بهجای پذیرش نادانی، بیشتر به حدس زدن روی میآورد.
کاربران تجاری باید بررسی کنند که آیا این gains در استدلال، بازگشت سرمایه (ROI) واقعی ایجاد میکند یا تأخیر و هزینه بالا، آن را به یک بدهی تبدیل میکند. پرسش کلیدی این است که آیا آزمایشگاههای دیگر میتوانند بدون انفجار ۱۵ برابری توکنها، به چنین امتیازاتی برسند.
گام بعدی شما
- اگر از Qwen3.8 Max برای تسکهای انبوه استفاده میکنید، حتماً هزینه هر عملیات را با نسخه قبلی مقایسه کنید.
- نرخ توهم ۴۰ درصدی را در خروجیهای حساس با لایهای از بازبینی انسانی کنترل کنید.
- عملکرد Kimi K3 را به عنوان جایگزینی بهینه از نظر هزینه-به-عملکرد تست کنید.
اما داستان سختافزاری مدیریت این هزینهها حتی پیچیدهتر است؛ به تحلیل ما درباره معماری تراشههای جدید برای استنتاج مراجعه کنید.




گفتگو