اگر امروز برای پردازش دادههای حجیم در مدلهای زبانی هزینه میپردازید، باید بدانید که قیمت استنتاج در برخی مدلهای پیشرو به شدت سقوط کرده است. هزینه ۰.۱۴ دلار برای هر میلیون توکن ورودی در مدل DeepSeek V4-Flash، عملاً هوش مصنوعی سطح بالا را به یک کالای ارزانقیمت و در دسترس تبدیل میکند. طبق گزارشهای منتشر شده در اواخر اوت ۲۰۲۶، این ریزش قیمتها نشاندهنده یک چرخش ساختاری است؛ جایی که هزینه داشتن یک هوش مصنوعی توانمند در حال نزدیک شدن به صفر است. این روند در راستای تلاشهای گستردهتر برای بهینهسازی هزینههاست، مشابه آنچه در کاهش ۳۵ درصدی هزینههای توکن برای کسبوکارهای کوچک توسط Whisperflow مشاهده شد.
برای سالها، صنعت تنها با افزودن پارامترها به دنبال «مرزهای دانش» بود، اما اکنون وارد عصر معماریهای «بهینه-محور» شدهایم. رقابت دیگر بر سر این نیست که چه کسی باهوشترین مدل را دارد، بلکه بر سر این است که چه کسی این هوش را با کمترین هزینه عملیاتی ارائه میدهد.
همانطور که در تحلیلهای قبلی ما دربارهی اقتصاد مدلهای بازمتن اشاره کردیم، این روند باعث میشود قدرت پردازش از انحصار شرکتهای غولپیکر خارج شود. مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — دیگر نیازی به بودجههای میلیونی برای استفاده در مقیاس وسیع ندارد.
جبهه غرب: تمرکز بر ایمنی و قدرت ویژه
در ۱ سپتامبر ۲۰۲۶، شرکت Anthropic از مدلهای Claude Fable 5.1 و Claude Mythos 5.1 پردهبرداری کرد. این مدلها بازار سازمانی سطح بالا را هدف قرار دادهاند؛ جایی که قابلیت اطمینان و ایمنی بر هزینه اولویت دارد. مدل Fable 5.1 از طریق API و ارائهدهندگان ابری اصلی، از جمله AWS Bedrock، Google Cloud و Microsoft Foundry در دسترس است. در مقابل، Mythos 5.1 تنها برای سازمانهای تأییدشده در ایالات متحده محدود شده است که بهطور خاص در بخشهای امنیت سایبری و علوم زیستی فعالیت میکنند.
مدل Fable 5.1 یک پنجره متنی (Context Window) — شبیه به میز کاری که جا برای چند ورق دارد، نه برای کل کتابخانه — به اندازه ۱ میلیون توکن و خروجی حداکثری ۱۲۸ هزار توکن دارد. این مدل از قابلیت «تفکر تطبیقی» (Adaptive thinking) بهره میبرد که همواره فعال است و دانش آن تا ژوئن ۲۰۲۶ بهروز است. آنتروپیک تضمین کرده است که این مدلها حداقل تا ۱ سپتامبر ۲۰۲۷ در دسترس خواهند بود. این بهروزرسانی در واقع پاسخی به چالشهای اقتصادی نسل قبل است، چرا که بهبودهای عملکردی Fable 5 پیشتر نتوانسته بود هزینههای بالای توکن را برای کاربران توجیه کند.
به نقل از مستندات آنتروپیک، Fable 5.1 در محکهای کلیدی برتری چشمگیری نسبت به نسل قبل خود، یعنی Fable 5 دارد:
- Terminal-Bench-Science 0.1: ۵۲.۶٪ (در مقابل ۲۴.۷٪ برای Fable 5)
- Terminal-Bench 4.0: ۵۵.۸٪ (در مقابل ۴۲.۰٪ برای Fable 5)
- CursorBench 3.2.0: ۷۳.۴٪ (در مقابل ۷۰.۵٪ برای Fable 5)
- AutomationBench: ۳۱.۴٪ (در مقابل ۱۷.۱٪ برای Fable 5)
نکته جالب این است که Fable 5.1 در تمامی محکهای منتشر شده، حتی از مدل Opus 5 خود این شرکت نیز پیشی گرفته است، با وجود اینکه هزینه Opus 5 برای هر توکن نصف این مدل است. همچنین، این مدل در همراستاسازی ایمنی پیشرفت کرده و نرخ مداخلات حفاظتی در حوزههای سایبری را ۶۰٪ و در حوزههای زیستشناسی را ۸۵٪ نسبت به Fable 5 کاهش داده است.
آنتروپیک همچنین هزینه خواندن از حافظه موقت (Cache) را ۷۵٪ کاهش داده و به ۰.۲۵ دلار برای هر میلیون توکن رسانده است. هزینه ورودی ۱۰ دلار و خروجی ۵۰ دلار برای هر میلیون توکن تعیین شده است. برای حمایت بیشتر از سازمانها، قابلیت «حفاظهای پیشرو سازمانی» (Enterprise Frontier Safeguards) — که به مشتریان اجازه میدهد دادههای خود را در زیرساخت ابری شخصیشان نگه دارند — از پاییز ۲۰۲۶ در دسترس خواهد بود.
در ۳ سپتامبر ۲۰۲۶، شرکت OpenAI عرضه محدود GPT-6 Astra را آغاز کرد. گرگ بروکمن، رئیس این شرکت، این نسخه را ورود به «عصر AGI» نامید. Astra برای کاربران Pro, Enterprise و Business Premium در دسترس است. این نخستین مدل اوپنایآی است که در چارچوب آمادگی داخلی شرکت، به آستانه «بحرانی» (Critical) در قابلیتهای امنیت سایبری رسیده است.
اوپنایآی در Astra از تکنیکی به نام «عمق بازگشتی» (recurrent depth) استفاده کرده که برخی متخصصان امنیتی هشدار دادهاند کنترل آن دشوارتر است. به دلیل همین قابلیتهای پیشرفته سایبری، شرکت پیش از عرضه هشدار صریحی منتشر کرد. اگرچه اوپنایآی هنوز محکهای کمی را برای رقابت با دادههای آنتروپیک منتشر نکرده است، اما ادعا میکند Astra سریعتر و تطبیقپذیرتر از نسخههای قبلی است.
هجوم چین: وزنهای باز و قیمتهای تهاجمی
در حالی که آزمایشگاههای غربی مدلهای خود را بسته نگه میدارند، چین از استراتژی وزنهای باز (Open Weights) — یعنی انتشار «دستور پخت» مدل به جای فقط غذای آماده — برای جذب بازار توسعهدهندگان استفاده میکند. این اتفاق یک بازار موازی ایجاد کرده است: مدلهای بسته و پریمیوم برای کاربردهای تحت نظارت و مدلهای وزنباز برای استقرار شخصی یا پروژههای حساس به هزینه.
شرکت Alibaba در ۳ اوت ۲۰۲۶ مدل Qwen3.8-Max را معرفی کرد. این مدل چندوجهی (Multimodal) — شبیه به ما که با چند حس دنیا را میخوانیم — متن، تصویر و ویدیو را پردازش میکند. این مدل ۲.۴ تریلیون پارامتر کلی دارد، اما در هر پرسوجو تنها ۹۵ میلیارد پارامتر فعال میشوند. پنجره متنی آن ۱ میلیون توکن است و قیمت آن بهصورت تخت ۲ دلار برای ورودی و ۶ دلار برای خروجی تعیین شده است. هزینه ورودی حافظه موقت (Cache) نیز ۰.۲۵ دلار برای هر میلیون توکن است.
محکهای گزارششده توسط علیبابا برای Qwen3.8-Max عبارتند از:
- Terminal-Bench 2.1: ۸۶.۶
- GPQA Diamond: ۹۲.۶
این مدل در Arena.AI رتبه اول مدلهای چینی را دارد، اما در رتبهبندی جهانی هنوز پشت سر Claude Fable 5 و چندین نسخه از مدلهای Opus آنتروپیک قرار میگیرد. علیبابا وعده داده است که بهزودی وزنهای این مدل را منتشر کند.
سپس در ۲۶ اوت ۲۰۲۶، مدل Qwen3.8-Flash معرفی شد که پیشنمایشی از معماری آتی Qwen4 است. این مدل بسیار بهینه است و از ۱۲۵ میلیارد پارامتر کلی، تنها ۶ میلیارد فعال میشوند. قیمت آن بسیار تهاجمی است: ۰.۱۵ دلار برای ورودی و ۰.۴۷ دلار برای خروجی. این مدل در SWE-bench Pro امتیاز ۶۲.۵٪ گرفت و از امتیاز ۵۵.۴٪ مدل DeepSeek V4 Pro پیشی گرفت و در اکثر وظایف کدنویسی و اداری، عملکرد بهتری نسبت به DeepSeek V4 Flash دارد.
شرکت DeepSeek نیز در ۳۱ ژوئیه ۲۰۲۶ مدل V4-Flash را به عنوان یک مدل ترکیب خبرهها (Mixture of Experts) با وزنهای باز منتشر کرد. قیمت این مدل ۰.۱۴ دلار برای ورودی و ۰.۲۸ دلار برای خروجی است. در زمان عرضه، این مدل در محک SWE امتیاز ۸۰.۶٪ و در شاخص هوش Artificial Analysis امتیازی بین ۵۲ تا ۵۴ را به دست آورد. با وجود افزایش قیمت خروجی تا ۳۷۱٪ در ساعات پیک در اواسط اوت، همچنان پیشرو در قیمتگذاری صنعت است و برخی پلتفرمهای شخص ثالث حتی میزبانی ارزانتری برای آن ارائه میدهند.
شرکت Zhipu نیز در اواخر اوت ۲۰۲۶ مدل GLM-5.3-Flash را عرضه کرد. این مدل وزنباز دارای ۳۲۰ میلیارد پارامتر کلی است که ۱۸ میلیارد آنها فعال هستند (320B-A18B). این مدل از پنجره متنی ۱ میلیون توکنی پشتیبانی میکند. Zhipu ادعا میکند قیمت این مدل یکدهم GLM-5.3 و یکبیستم Claude Opus 4.8 است. در محک داخلی Z.ai Code Bench 2، عملکرد برنامهنویسی آن با Claude Opus 4.8 قابل مقایسه توصیف شده است.
شکاف بازاریابی AGI
با وجود ادعاهای اوپنایآی درباره Astra، هیچ اجماع علمی وجود ندارد که ما به هوش مصنوعی عام (AGI) رسیده باشیم. AGI به سیستمی گفته میشود که قادر به انجام هر کار فکری انسانی باشد؛ از استدلال بینحوزهای و انتقال یادگیری گرفته تا تعیین اهداف مستقل و فعالیت با خودمختاری واقعی.
مدلهای فعلی همچنان «هوش مصنوعی محدود» هستند. آنها در توزیعهای خاص فوقالعادهاند، اما برای تعمیم دادن، هنوز به مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — و تنظیم دقیق (Fine-tuning) و نظارت انسانی نیاز دارند. مدلی که در ریاضیات یا کدنویسی نمره بالایی میگیرد، برای اجرا در گردشکارهای پیچیده دنیای واقعی همچنان به مسیریابی صریح، لایههای امنیتی و گیتهای تایید انسانی نیاز دارد.
آنچه میبینیم جهشی به سوی هوش عام نیست، بلکه فشرده شدن مرزهاست. فاصله بین بهترین مدلهای بسته و مدلهای وزنباز در تسکهای خاص در حال کاهش است. این یک تغییر در اقتصاد استقرار است، نه ظهور هوش عام.
پیامدهای استراتژیک برای کسبوکارها
برای سازمانها، استراتژی «یک مدل برای همه کارها» دیگر جواب نمیدهد. بازار به دو مسیر موازی تقسیم شده است:
- مدلهای بسته پریمیوم: (Fable 5.1, Astra) برای زمانی که امنیت، قابلیت اطمینان و اکوسیستم بالغ اولویت است.
- رقیبان وزنباز: (DeepSeek V4-Flash, Qwen3.8-Flash, GLM-5.3-Flash) برای بارهای کاری حساس به هزینه یا نیاز به میزبانی شخصی.
توسعهدهندگان اکنون میتوانند حلقههای عاملمحور (Agentic) پیچیدهای بسازند — جایی که مدل دهها بار برای حل یک مسئله تکرار میکند — بدون اینکه بودجه پروژه تمام شود. این بهینهسازی در هزینهها، بهویژه در مدلهای جدید، کاهش ۴۵ درصدی هزینههای عملیاتی عاملهای هوش مصنوعی در Fable 5.1 را ممکن ساخته است. وقتی هزینه ورودی ۰.۱۴ دلار است، هزینه اصلی از صورتحساب API به طراحی یکپارچهسازی و نظارت انسانی منتقل میشود.
مدلهای وزنباز همچنین وابستگی به یک فروشنده خاص (Vendor Lock-in) را از بین میبرند. سازمانها اکنون میتوانند:
- برای زبانهای تخصصی هر حوزه، تنظیم دقیق (Fine-tuning) — شبیه به وقتی که به یک پزشک عمومی، تخصص پوست میدهیم — انجام دهند.
- استنتاج را بهصورت درونسازمانی (On-premises) برای تضمین حریم خصوصی و اقامت دادهها اجرا کنند.
- مدلها را کوانتیزه کرده و روی GPUهای معمولی (Consumer-grade) اجرا کنند.
تنها نقطه ضعف این است که مدلهای وزنباز معمولاً مستندات امنیتی رسمی و ضمانتهای پشتیبانی سازمانی کمتری نسبت به مدلهای بسته پیشرو دارند.
لبه رقابتی جدید
مزیت رقابتی تغییر کرده است. دسترسی به یک مدل قدرتمند دیگر یک «خندق دفاعی» نیست، چون هوش مصنوعی توانمند اکنون به یک کالای عمومی تبدیل شده است. ارزش واقعی اکنون در ارکستراسیون، کیفیت دادههای اختصاصی، طراحی گردشکار و زیرساختهای قابل اعتماد نهفته است.
ما شاهد فاصله گرفتن از مقیاسبندی خام (Brute-force scaling) هستیم. چرخه عرضه شتاب گرفته و بهروزرسانیهای بزرگ اکنون هر ۳ تا ۴ ماه یکبار رخ میدهند. برای مثال، Fable 5 در ژوئن ۲۰۲۶ آمد و Fable 5.1 در سپتامبر. DeepSeek V4 در آوریل عرضه شد و V4-Flash در ژوئیه.
اینکه مدلی با ۶ میلیارد پارامتر فعال (Qwen3.8-Flash) میتواند در محکهای کدنویسی مدلهای بسیار بزرگتر را شکست دهد، نشان میدهد نوآوری در معماری اکنون مهمتر از اندازه خوشه محاسباتی است.
منتظر موج بعدی ارزیابیهای مستقل از مدلهای وزنباز چینی باشید. با تثبیت این محکها، صنعت به سمت سیستمهای مسیریاب چندمدلی (Multi-model routing) حرکت میکند که هر تسک را به ارزانترین مدلی که توانایی انجام آن را دارد میسپارد. عصر تکمدلی به پایان رسیده و عصر «مدل بهعنوان کالا» آغاز شده است.
گام بعدی شما
- اگر از مدلهای گرانقیمت برای کارهای تکراری استفاده میکنید، مدلهای Flash چینی را برای کاهش هزینهها تست کنید.
- برای پروژههای حساس به حریم خصوصی، استقرار مدلهای وزنباز را بهصورت درونسازمانی بررسی کنید.
- طراحی سیستمهای مسیریاب (Router) را جایگزین استفاده از یک مدل واحد برای تمام تسکها کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو