اگر امروز برای اجرای یک عامل هوش مصنوعی در گردشکارهای چندساعته بودجهای اختصاص میدهید، احتمالاً با مشکل «شکاف مقرونبهصرفه بودن» روبرو شدهاید. این یعنی لحظهای که هزینهٔ استدلال مدل از ارزش واقعی کاری که انجام میدهد، بیشتر میشود.
به گزارش The Sequence، در ۲ سپتامبر ۲۰۲۶، سه رویکرد معماری متفاوت از سوی Anthropic، Zhipu و Alibaba برای حل این بحران هزینه ارائه شد. این مدلها سعی دارند استنتاج (Inference) — که شبیه به لحظهٔ خودِ آشپزی است، نه دورهی آموزش آشپز — را به شکلی بهینه کنند که عاملها بتوانند ساعتها بدون تخلیه بودجه فعالیت کنند. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی مدلهای بازمتن اشاره کردیم، کاهش هزینه اکنون به اندازه افزایش دقت اهمیت یافته است.
در این رقابت، سه محصول کلیدی معرفی شدند:
- Anthropic: مدلهای Claude Fable 5.1 و Mythos 5.1 را عرضه کرد. این دو مدل وزنهای یکسانی دارند اما با دو رژیم حفاظتی متفاوت برای ایجاد تعادل میان ایمنی و کاربرد عرضه شدهاند.
- Zhipu: مدل GLM-5.3-Flash را با ۳۲۰ میلیارد پارامتر معرفی کرد. برای کاهش هزینه، این مدل در لحظه استنتاج تنها ۱۸ میلیارد پارامتر را فعال میکند. این رویکرد تکاملیافتهای از تلاشات پیشین برای بهینهسازی مدلهای حجیم است، مشابه آنچه در اجرای مدل ۷۵۳ میلیارد پارامتری GLM-5.2 روی یک GPU شاهد بودیم. طبق اعلام این شرکت، مدل مذکور یک هفته روی تراشههای چینی تست شد تا پایداریاش ثابت شود.
- Alibaba: خانواده Qwen 3.8 را منتشر کرد که شامل نخستین مدل کلاس Max با وزنهای باز (Open Weights) — یعنی مدلهایی که دستور پختشان علناً منتشر شده و نه فقط غذای آماده — و پیشنمایشی از معماری Qwen 4 است.

این تغییر مسیر نشان میدهد که صنعت از تعقیب کورکورانه نمرات بنچمارک، به سمت بهینهسازی «هزینه به ازای هر ساعت خودمختاری» حرکت کرده است. آزمایشگاهها با تکنیکهایی مثل فعالسازی گزینشی پارامترها، سعی دارند هوش یک مدل غولپیکر را با قیمت یک مدل کوچک بفروشند. این تلاشها در راستای افزایش بهرهوری است، درست مانند فناوری DFlash 2 که توان عملیاتی مدلهای زبانی را تا ۴.۶ برابر افزایش داد تا سرعت پاسخدهی در مقیاس بالا بهبود یابد.
برای یک صاحب کسبوکار، این یعنی «حلقه عاملمحور» (Agentic Loop) — جایی که هوش مصنوعی ساعتها برنامهریزی میکند، اجرا میکند و خطایش را میگیرد — بالاخره از نظر مالی برای محیط تولید توجیهپذیر شده است. شما اکنون بسته به میزان ریسکپذیری خود، میتوانید بین ایمنی سختگیرانه (Mythos) یا انعطافپذیری مدلهای باز (Qwen) انتخاب کنید.
گام بعدی شما
- اگر از مدلهای بسته استفاده میکنید، مدلهای سری Flash را برای وظایف تکراری و طولانی تست کنید تا کاهش هزینه را بسنجید.
- توسعهدهندگان مدلهای باز را دنبال کنند تا پیشنمایش معماری Qwen 4 را بررسی کنند.
- استراتژی استقرار خود را از «دقت حداکثری» به «بهینهترین هزینه برای نتیجه قابلقبول» تغییر دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ برای درک نقش تراشههای جدید در این کاهش هزینه، به تحلیل ما دربارهی سختافزارهای استنتاج مراجعه کنید.




گفتگو