پرش به محتوای اصلی
پرش به محتوای مقاله

آیا قیمت‌های نزدیک به صفر مدل‌های وزن‌باز، تسلط غرب را می‌شکند؟

·۱۵ شهریور ۱۴۰۵۹ دقیقه مطالعه
مدل‌های هوش مصنوعی ۲۰۲۶: فیبل ۵.۱، آسترا و چالش چین
مدل‌های هوش مصنوعی ۲۰۲۶: فیبل ۵.۱، آسترا و چالش چین
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش شدید هزینه استنتاج در مدل‌های Flash چینی تا سطح ۰.۱۴ دلار؛ در حالی که پیش از این، مدل‌های ارزان‌قیمت معمولاً افت شدید کیفیت داشتند، اما اکنون مدل‌های Flash در کدنویسی با مدل‌های پریمیوم رقابت می‌کنند.

اگر امروز برای پردازش داده‌های حجیم در مدل‌های زبانی هزینه می‌پردازید، باید بدانید که قیمت استنتاج در برخی مدل‌های پیشرو به شدت سقوط کرده است. هزینه ۰.۱۴ دلار برای هر میلیون توکن ورودی در مدل DeepSeek V4-Flash، عملاً هوش مصنوعی سطح بالا را به یک کالای ارزان‌قیمت و در دسترس تبدیل می‌کند. طبق گزارش‌های منتشر شده در اواخر اوت ۲۰۲۶، این ریزش قیمت‌ها نشان‌دهنده یک چرخش ساختاری است؛ جایی که هزینه داشتن یک هوش مصنوعی توانمند در حال نزدیک شدن به صفر است. این روند در راستای تلاش‌های گسترده‌تر برای بهینه‌سازی هزینه‌هاست، مشابه آنچه در کاهش ۳۵ درصدی هزینه‌های توکن برای کسب‌وکارهای کوچک توسط Whisperflow مشاهده شد.

برای سال‌ها، صنعت تنها با افزودن پارامترها به دنبال «مرزهای دانش» بود، اما اکنون وارد عصر معماری‌های «بهینه-محور» شده‌ایم. رقابت دیگر بر سر این نیست که چه کسی باهوش‌ترین مدل را دارد، بلکه بر سر این است که چه کسی این هوش را با کمترین هزینه عملیاتی ارائه می‌دهد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی اقتصاد مدل‌های بازمتن اشاره کردیم، این روند باعث می‌شود قدرت پردازش از انحصار شرکت‌های غول‌پیکر خارج شود. مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — دیگر نیازی به بودجه‌های میلیونی برای استفاده در مقیاس وسیع ندارد.

جبهه غرب: تمرکز بر ایمنی و قدرت ویژه

در ۱ سپتامبر ۲۰۲۶، شرکت Anthropic از مدل‌های Claude Fable 5.1 و Claude Mythos 5.1 پرده‌برداری کرد. این مدل‌ها بازار سازمانی سطح بالا را هدف قرار داده‌اند؛ جایی که قابلیت اطمینان و ایمنی بر هزینه اولویت دارد. مدل Fable 5.1 از طریق API و ارائه‌دهندگان ابری اصلی، از جمله AWS Bedrock، Google Cloud و Microsoft Foundry در دسترس است. در مقابل، Mythos 5.1 تنها برای سازمان‌های تأییدشده در ایالات متحده محدود شده است که به‌طور خاص در بخش‌های امنیت سایبری و علوم زیستی فعالیت می‌کنند.

مدل Fable 5.1 یک پنجره متنی (Context Window) — شبیه به میز کاری که جا برای چند ورق دارد، نه برای کل کتابخانه — به اندازه ۱ میلیون توکن و خروجی حداکثری ۱۲۸ هزار توکن دارد. این مدل از قابلیت «تفکر تطبیقی» (Adaptive thinking) بهره می‌برد که همواره فعال است و دانش آن تا ژوئن ۲۰۲۶ به‌روز است. آنتروپیک تضمین کرده است که این مدل‌ها حداقل تا ۱ سپتامبر ۲۰۲۷ در دسترس خواهند بود. این به‌روزرسانی در واقع پاسخی به چالش‌های اقتصادی نسل قبل است، چرا که بهبودهای عملکردی Fable 5 پیش‌تر نتوانسته بود هزینه‌های بالای توکن را برای کاربران توجیه کند.

به نقل از مستندات آنتروپیک، Fable 5.1 در محک‌های کلیدی برتری چشمگیری نسبت به نسل قبل خود، یعنی Fable 5 دارد:

  • Terminal-Bench-Science 0.1: ۵۲.۶٪ (در مقابل ۲۴.۷٪ برای Fable 5)
  • Terminal-Bench 4.0: ۵۵.۸٪ (در مقابل ۴۲.۰٪ برای Fable 5)
  • CursorBench 3.2.0: ۷۳.۴٪ (در مقابل ۷۰.۵٪ برای Fable 5)
  • AutomationBench: ۳۱.۴٪ (در مقابل ۱۷.۱٪ برای Fable 5)

نکته جالب این است که Fable 5.1 در تمامی محک‌های منتشر شده، حتی از مدل Opus 5 خود این شرکت نیز پیشی گرفته است، با وجود اینکه هزینه Opus 5 برای هر توکن نصف این مدل است. همچنین، این مدل در همراستاسازی ایمنی پیشرفت کرده و نرخ مداخلات حفاظتی در حوزه‌های سایبری را ۶۰٪ و در حوزه‌های زیست‌شناسی را ۸۵٪ نسبت به Fable 5 کاهش داده است.

آنتروپیک همچنین هزینه خواندن از حافظه موقت (Cache) را ۷۵٪ کاهش داده و به ۰.۲۵ دلار برای هر میلیون توکن رسانده است. هزینه ورودی ۱۰ دلار و خروجی ۵۰ دلار برای هر میلیون توکن تعیین شده است. برای حمایت بیشتر از سازمان‌ها، قابلیت «حفاظ‌های پیشرو سازمانی» (Enterprise Frontier Safeguards) — که به مشتریان اجازه می‌دهد داده‌های خود را در زیرساخت ابری شخصی‌شان نگه دارند — از پاییز ۲۰۲۶ در دسترس خواهد بود.

در ۳ سپتامبر ۲۰۲۶، شرکت OpenAI عرضه محدود GPT-6 Astra را آغاز کرد. گرگ بروکمن، رئیس این شرکت، این نسخه را ورود به «عصر AGI» نامید. Astra برای کاربران Pro, Enterprise و Business Premium در دسترس است. این نخستین مدل اوپن‌ای‌آی است که در چارچوب آمادگی داخلی شرکت، به آستانه «بحرانی» (Critical) در قابلیت‌های امنیت سایبری رسیده است.

اوپن‌ای‌آی در Astra از تکنیکی به نام «عمق بازگشتی» (recurrent depth) استفاده کرده که برخی متخصصان امنیتی هشدار داده‌اند کنترل آن دشوارتر است. به دلیل همین قابلیت‌های پیشرفته سایبری، شرکت پیش از عرضه هشدار صریحی منتشر کرد. اگرچه اوپن‌ای‌آی هنوز محک‌های کمی را برای رقابت با داده‌های آنتروپیک منتشر نکرده است، اما ادعا می‌کند Astra سریع‌تر و تطبیق‌پذیرتر از نسخه‌های قبلی است.

هجوم چین: وزن‌های باز و قیمت‌های تهاجمی

در حالی که آزمایشگاه‌های غربی مدل‌های خود را بسته نگه می‌دارند، چین از استراتژی وزن‌های باز (Open Weights) — یعنی انتشار «دستور پخت» مدل به جای فقط غذای آماده — برای جذب بازار توسعه‌دهندگان استفاده می‌کند. این اتفاق یک بازار موازی ایجاد کرده است: مدل‌های بسته و پریمیوم برای کاربردهای تحت نظارت و مدل‌های وزن‌باز برای استقرار شخصی یا پروژه‌های حساس به هزینه.

شرکت Alibaba در ۳ اوت ۲۰۲۶ مدل Qwen3.8-Max را معرفی کرد. این مدل چندوجهی (Multimodal) — شبیه به ما که با چند حس دنیا را می‌خوانیم — متن، تصویر و ویدیو را پردازش می‌کند. این مدل ۲.۴ تریلیون پارامتر کلی دارد، اما در هر پرس‌وجو تنها ۹۵ میلیارد پارامتر فعال می‌شوند. پنجره متنی آن ۱ میلیون توکن است و قیمت آن به‌صورت تخت ۲ دلار برای ورودی و ۶ دلار برای خروجی تعیین شده است. هزینه ورودی حافظه موقت (Cache) نیز ۰.۲۵ دلار برای هر میلیون توکن است.

محک‌های گزارش‌شده توسط علی‌بابا برای Qwen3.8-Max عبارتند از:

  • Terminal-Bench 2.1: ۸۶.۶
  • GPQA Diamond: ۹۲.۶

این مدل در Arena.AI رتبه اول مدل‌های چینی را دارد، اما در رتبه‌بندی جهانی هنوز پشت سر Claude Fable 5 و چندین نسخه از مدل‌های Opus آنتروپیک قرار می‌گیرد. علی‌بابا وعده داده است که به‌زودی وزن‌های این مدل را منتشر کند.

سپس در ۲۶ اوت ۲۰۲۶، مدل Qwen3.8-Flash معرفی شد که پیش‌نمایشی از معماری آتی Qwen4 است. این مدل بسیار بهینه است و از ۱۲۵ میلیارد پارامتر کلی، تنها ۶ میلیارد فعال می‌شوند. قیمت آن بسیار تهاجمی است: ۰.۱۵ دلار برای ورودی و ۰.۴۷ دلار برای خروجی. این مدل در SWE-bench Pro امتیاز ۶۲.۵٪ گرفت و از امتیاز ۵۵.۴٪ مدل DeepSeek V4 Pro پیشی گرفت و در اکثر وظایف کدنویسی و اداری، عملکرد بهتری نسبت به DeepSeek V4 Flash دارد.

شرکت DeepSeek نیز در ۳۱ ژوئیه ۲۰۲۶ مدل V4-Flash را به عنوان یک مدل ترکیب خبره‌ها (Mixture of Experts) با وزن‌های باز منتشر کرد. قیمت این مدل ۰.۱۴ دلار برای ورودی و ۰.۲۸ دلار برای خروجی است. در زمان عرضه، این مدل در محک SWE امتیاز ۸۰.۶٪ و در شاخص هوش Artificial Analysis امتیازی بین ۵۲ تا ۵۴ را به دست آورد. با وجود افزایش قیمت خروجی تا ۳۷۱٪ در ساعات پیک در اواسط اوت، همچنان پیشرو در قیمت‌گذاری صنعت است و برخی پلتفرم‌های شخص ثالث حتی میزبانی ارزان‌تری برای آن ارائه می‌دهند.

شرکت Zhipu نیز در اواخر اوت ۲۰۲۶ مدل GLM-5.3-Flash را عرضه کرد. این مدل وزن‌باز دارای ۳۲۰ میلیارد پارامتر کلی است که ۱۸ میلیارد آن‌ها فعال هستند (320B-A18B). این مدل از پنجره متنی ۱ میلیون توکنی پشتیبانی می‌کند. Zhipu ادعا می‌کند قیمت این مدل یک‌دهم GLM-5.3 و یک‌بیستم Claude Opus 4.8 است. در محک داخلی Z.ai Code Bench 2، عملکرد برنامه‌نویسی آن با Claude Opus 4.8 قابل مقایسه توصیف شده است.

شکاف بازاریابی AGI

با وجود ادعاهای اوپن‌ای‌آی درباره Astra، هیچ اجماع علمی وجود ندارد که ما به هوش مصنوعی عام (AGI) رسیده باشیم. AGI به سیستمی گفته می‌شود که قادر به انجام هر کار فکری انسانی باشد؛ از استدلال بین‌حوزه‌ای و انتقال یادگیری گرفته تا تعیین اهداف مستقل و فعالیت با خودمختاری واقعی.

مدل‌های فعلی همچنان «هوش مصنوعی محدود» هستند. آن‌ها در توزیع‌های خاص فوق‌العاده‌اند، اما برای تعمیم دادن، هنوز به مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب — و تنظیم دقیق (Fine-tuning) و نظارت انسانی نیاز دارند. مدلی که در ریاضیات یا کدنویسی نمره بالایی می‌گیرد، برای اجرا در گردش‌کارهای پیچیده دنیای واقعی همچنان به مسیریابی صریح، لایه‌های امنیتی و گیت‌های تایید انسانی نیاز دارد.

آنچه می‌بینیم جهشی به سوی هوش عام نیست، بلکه فشرده شدن مرزهاست. فاصله بین بهترین مدل‌های بسته و مدل‌های وزن‌باز در تسک‌های خاص در حال کاهش است. این یک تغییر در اقتصاد استقرار است، نه ظهور هوش عام.

پیامدهای استراتژیک برای کسب‌وکارها

برای سازمان‌ها، استراتژی «یک مدل برای همه کارها» دیگر جواب نمی‌دهد. بازار به دو مسیر موازی تقسیم شده است:

  • مدل‌های بسته پریمیوم: (Fable 5.1, Astra) برای زمانی که امنیت، قابلیت اطمینان و اکوسیستم بالغ اولویت است.
  • رقیبان وزن‌باز: (DeepSeek V4-Flash, Qwen3.8-Flash, GLM-5.3-Flash) برای بارهای کاری حساس به هزینه یا نیاز به میزبانی شخصی.

توسعه‌دهندگان اکنون می‌توانند حلقه‌های عامل‌محور (Agentic) پیچیده‌ای بسازند — جایی که مدل ده‌ها بار برای حل یک مسئله تکرار می‌کند — بدون اینکه بودجه پروژه تمام شود. این بهینه‌سازی در هزینه‌ها، به‌ویژه در مدل‌های جدید، کاهش ۴۵ درصدی هزینه‌های عملیاتی عامل‌های هوش مصنوعی در Fable 5.1 را ممکن ساخته است. وقتی هزینه ورودی ۰.۱۴ دلار است، هزینه اصلی از صورت‌حساب API به طراحی یکپارچه‌سازی و نظارت انسانی منتقل می‌شود.

مدل‌های وزن‌باز همچنین وابستگی به یک فروشنده خاص (Vendor Lock-in) را از بین می‌برند. سازمان‌ها اکنون می‌توانند:

  • برای زبان‌های تخصصی هر حوزه، تنظیم دقیق (Fine-tuning) — شبیه به وقتی که به یک پزشک عمومی، تخصص پوست می‌دهیم — انجام دهند.
  • استنتاج را به‌صورت درون‌سازمانی (On-premises) برای تضمین حریم خصوصی و اقامت داده‌ها اجرا کنند.
  • مدل‌ها را کوانتیزه کرده و روی GPUهای معمولی (Consumer-grade) اجرا کنند.

تنها نقطه ضعف این است که مدل‌های وزن‌باز معمولاً مستندات امنیتی رسمی و ضمانت‌های پشتیبانی سازمانی کمتری نسبت به مدل‌های بسته پیشرو دارند.

لبه رقابتی جدید

مزیت رقابتی تغییر کرده است. دسترسی به یک مدل قدرتمند دیگر یک «خندق دفاعی» نیست، چون هوش مصنوعی توانمند اکنون به یک کالای عمومی تبدیل شده است. ارزش واقعی اکنون در ارکستراسیون، کیفیت داده‌های اختصاصی، طراحی گردش‌کار و زیرساخت‌های قابل اعتماد نهفته است.

ما شاهد فاصله گرفتن از مقیاس‌بندی خام (Brute-force scaling) هستیم. چرخه عرضه شتاب گرفته و به‌روزرسانی‌های بزرگ اکنون هر ۳ تا ۴ ماه یک‌بار رخ می‌دهند. برای مثال، Fable 5 در ژوئن ۲۰۲۶ آمد و Fable 5.1 در سپتامبر. DeepSeek V4 در آوریل عرضه شد و V4-Flash در ژوئیه.

اینکه مدلی با ۶ میلیارد پارامتر فعال (Qwen3.8-Flash) می‌تواند در محک‌های کدنویسی مدل‌های بسیار بزرگ‌تر را شکست دهد، نشان می‌دهد نوآوری در معماری اکنون مهم‌تر از اندازه خوشه محاسباتی است.

منتظر موج بعدی ارزیابی‌های مستقل از مدل‌های وزن‌باز چینی باشید. با تثبیت این محک‌ها، صنعت به سمت سیستم‌های مسیریاب چندمدلی (Multi-model routing) حرکت می‌کند که هر تسک را به ارزان‌ترین مدلی که توانایی انجام آن را دارد می‌سپارد. عصر تک‌مدلی به پایان رسیده و عصر «مدل به‌عنوان کالا» آغاز شده است.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای کارهای تکراری استفاده می‌کنید، مدل‌های Flash چینی را برای کاهش هزینه‌ها تست کنید.
  • برای پروژه‌های حساس به حریم خصوصی، استقرار مدل‌های وزن‌باز را به‌صورت درون‌سازمانی بررسی کنید.
  • طراحی سیستم‌های مسیریاب (Router) را جایگزین استفاده از یک مدل واحد برای تمام تسک‌ها کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر قیمت‌ها بر اساس اعتبار داده‌های DeepSeek و Alibaba، دسترسی به مدل‌های سطح بالا را دموکراتیزه می‌کند. اکنون توسعه‌دهندگان می‌توانند بدون نگرانی از هزینه‌های API، سیستم‌های عامل‌محور پیچیده با تکرارهای زیاد بسازند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به این مدل‌ها برای توسعه‌دهندگان ایرانی دشوار است، اما انتشار وزن‌های باز این مدل‌ها فرصتی است تا تیم‌های داخلی آن‌ها را به‌صورت محلی و بدون نیاز به پرداخت ارزی استقرار دهند.

·نگاه ما
تحریریه دات‌هوش

سقوط قیمت استنتاج به زیر ۰.۲ دلار، نقطه پایان استراتژی «مدل واحد» در سازمان‌هاست. حالا ارزش افزوده از «داشتن مدل» به «طراحی جریان کار» منتقل شده است؛ یعنی برنده کسی نیست که باهوش‌ترین مدل را دارد، بلکه کسی است که می‌داند هر تکه از مسئله را به کدام مدل ارزان‌قیمت بسپارد. این یعنی تبدیل شدن هوش مصنوعی از یک ابزار استراتژیک به یک زیرساخت مشابه برق و آب.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.