پرش به محتوای اصلی
پرش به محتوای مقاله

«سقوط شتابان هزینه‌ها»؛ تحلیل جدید از تغییر ماهیت پروژه‌های هوش مصنوعی

·۳۰ مرداد ۱۴۰۵۱۶ دقیقه مطالعه۲ بازدید
تحلیل
هوش مصنوعی ارزان‌تر: انقلابی در علوم اعصاب با CatalystNeuro
هوش مصنوعی ارزان‌تر: انقلابی در علوم اعصاب با CatalystNeuro
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف شتاب خیره‌کننده در کاهش «کف قیمت» قابلیت‌ها؛ در حالی که همه به دنبال مدل‌های هوشمندتر بودند، هزینه دستیابی به هوشِ سطح متوسط ۵۶ برابر ارزان‌تر شده است.

تصور کنید سیستمی که سال گذشته برای هر عملیات ۱.۲۲ دلار هزینه داشت، امروز همان کار را با ۲ سنت انجام می‌دهد. این سقوط ۵۶ برابری هزینهٔ استنتاج (Inference) در کمتر از شش ماه، نشان می‌دهد که «کفِ قیمت» هوش مصنوعی بسیار سریع‌تر از پیش‌بینی‌ها در حال پایین آمدن است. به نقل از تحلیل بن دیکتر (Ben Dichter) از CatalystNeuro که در ۲۱ اوت ۲۰۲۶ منتشر شد، این فروپاشی قیمت‌ها بسیار سریع‌تر از آن چیزی رخ می‌دهد که تمرکز فعلی صنعت بر قابلیت‌های «مرزی» (Frontier) القا می‌کند.

بیشتر اخبار هوش مصنوعی بر «سقف» تمرکز دارند؛ یعنی اینکه هوشمندترین مدل موجود چه کاری می‌تواند انجام دهد که هیچ مدل دیگری قادر به آن نیست. این مسیر است که تیترهای خبری را می‌سازد، مانند مدل‌هایی که باگ‌های گسترده در کل یک کدبیس را رفع می‌کنند یا مسائل ریاضی دشواری را حل می‌کنند که پیش از این انسان‌ها را به بن‌بست کشانده بود. با این حال، مسیر دوم و آرام‌تری از پیشرفت وجود دارد که به آن «کف» می‌گوییم؛ یعنی اینکه یک سطح مشخص از قابلیت را با چه قیمتی می‌توان خرید.

در حالی که سقف قابلیت‌ها، انواع جدیدی از وظایف را ممکن می‌کند، کف قیمت است که «مقیاس» و «حجم» را ممکن می‌سازد. مقدار زیادی از کارهای مفید نیازی به هوشمندترین مدل موجود ندارند، بلکه به مدلی نیاز دارند که «به اندازه کافی خوب» باشد و بتوان آن را هزاران بار اجرا کرد. مثال‌هایی از این دست عبارتند از: خواندن تک‌تک مقالات علمی در مورد یک موضوع خاص، بررسی تمام قراردادهای یک آرشیو برای یافتن یک بند مشخص، یا خلاصه‌سازی تمام رشته‌گفتگوها در یک تالار گفتگوی بزرگ. در این موارد، سوال این نیست که آیا مدلی وجود دارد که بتواند کار را انجام دهد، بلکه سوال این است که آیا این مدل می‌تواند آن کار را ده هزار بار در چارچوب یک بودجه محدود انجام دهد یا خیر.

توازن بین هوش و هزینه

برای اندازه‌گیری این پدیده، دیکتر از شاخص هوش مصنوعی Artificial Analysis (نسخه ۴.۱.۱) استفاده کرده است که مانند یک آزمون IQ برای مدل‌های زبانی بزرگ (LLM) عمل می‌کند. این شاخص در واقع میانگین وزنی ۹ ارزیابی است که در چهار دسته گروه‌بندی شده‌اند:

  • وظایف عامل‌محور (Agentic tasks) (۳۴٪): این بخش توانایی مدل در تکمیل کارهای چندمرحله‌ای و عامل‌محور را می‌سنجد، به جای اینکه صرفاً به سوالات امتحانی پاسخ دهد.
  • برنامه‌نویسی (۲۴٪)
  • استدلال علمی (۲۴٪)
  • قابلیت‌های عمومی (۱۸٪)

این وزن‌دهی نشان‌دهنده یک چرخش استراتژیک در این حوزه به سمت کارهای عامل‌محور چندمرحله‌ای است. برای درک بهتر زمینه، مدل Claude 4.5 Sonnet (Reasoning) از شرکت Anthropic که بسیاری از توسعه‌دهندگان برای شروع گردش‌کارهای کدنویسی عامل‌محور از طریق ابزارهایی مانند Cline از آن استفاده می‌کردند، امتیاز هوشی ۳۷.۴ داشت. امروز، پیشتازی در این حوزه بر عهده Claude Opus 5 (max effort) است که به امتیاز ۶۳.۱ رسیده است.

برای تجسم این امتیازات، دیکتر به «بنچمارک پلیکان» اثر سایمون ویلیسون اشاره می‌کند. در این بنچمارک، از مدل خواسته می‌شود تا «یک تصویر SVG از یک پلیکان در حال دوچرخه‌سواری» تولید کند. پیشرفت در خانواده مدل‌های GPT-5.6 به خوبی سطوح این شاخص را نشان می‌دهد:

  • شاخص ۳۳.۹: مدل GPT-5.6 Luna (سطح low)
  • شاخص ۴۷.۰: مدل GPT-5.6 Luna (سطح high)
  • شاخص ۵۰.۱: مدل GPT-5.6 Luna (سطح xhigh)
  • شاخص ۶۰.۹: مدل GPT-5.6 Sol (سطح max)

با افزایش امتیاز شاخص، خروجی مدل جزئیات بیشتر، تناسبات بهتر و پلیکانی را نشان می‌دهد که به وضوح در حال رکاب زدن است، به جای اینکه صرفاً روی دوچرخه شناور باشد.

فروپاشی کف قیمت

دیکتر با ترسیم نمودار هوش در برابر «هزینه هر وظیفه» (میانگین هزینه دلاری برای اجرای یک تسک از مجموعه ارزیابی، شامل توکن‌های ورودی، استدلال و پاسخ)، یک «مرز پارتو» (Pareto frontier) را شناسایی کرد. این مرز، ارزان‌ترین راه برای رسیدن به هر سطح مشخص از هوش را نشان می‌دهد. داده‌های استخراج‌شده از ۱۳۷ مدل که تا DeepSeek V3 در دسامبر ۲۰۲۴ بازمی‌گردد، نشان می‌دهد که این مرز با شتابی فزاینده به سمت بالا و چپ حرکت می‌کند.

بین اوت و دسامبر ۲۰۲۵، این مرز به کندی حرکت می‌کرد و تنها دو جهش کوچک بین اوت و اکتبر و یک جهش بین اکتبر و دسامبر مشاهده شد. با این حال، نماهای برداشته شده در فوریه و آوریل ۲۰۲۶ تغییرات عظیمی را نشان دادند. تا ژوئن ۲۰۲۶، ۱۰ مدل از ۱۱ مدل پیشرو، مدل‌های جدیدی بودند که پس از آوریل عرضه شده بودند. امروز، ۱۵ مدل از ۱۶ مدل پیشرو، پس از ژوئن منتشر شده‌اند.

ردیابی سقف و کف

لبه راست این مرز، سقف قابلیت‌ها را ردیابی می‌کند. در یک سال، سقف قابلیت‌ها ۲۸ امتیاز در شاخص هوش رشد کرده است:

  • اوت ۲۰۲۵: شاخص ۳۵.۳ (مدل GPT-5 با هزینه ۰.۲۶ دلار در هر وظیفه)
  • اکتبر ۲۰۲۵: شاخص ۳۷.۴ (مدل Claude 4.5 Sonnet)
  • فوریه ۲۰۲۶: شاخص ۴۸.۴ (مدل Claude Sonnet 4.6)
  • آوریل ۲۰۲۶: شاخص ۵۵.۰ (مدل Claude Opus 4.7 با هزینه ۲.۲۳ دلار)
  • ژوئن ۲۰۲۶: شاخص ۶۲.۱ (مدل Claude Fable 5 با هزینه ۳.۱۴ دلار)
  • امروز: شاخص ۶۳.۱ (مدل Claude Opus 5 با هزینه ۲.۳۴ دلار)

به طور هم‌زمان، نیمه چپ مرز، افزایش هوش مدل‌های ارزان‌قیمت را نشان می‌دهد. تا ۱۹ اوت ۲۰۲۶، نردبان تلاش‌های GPT-5.6 Luna تقریباً تمام محدوده زیر شاخص ۵۲ را در اختیار دارد. سطحی از هوش که در اوت ۲۰۲۵ به عنوان «سقف» شناخته می‌شد، اکنون تنها با هزینه ۰.۰۰۸۸ دلار در هر وظیفه در دسترس است.

نقش تقطیر (Distillation) و وزن‌های باز

سطوح قابلیت معمولاً یک قوس پیش‌بینی‌پذیر را دنبال می‌کنند: ابتدا یک عرضه ممتاز توسط آزمایشگاه‌هایی مانند OpenAI یا Anthropic و سپس کالایی شدن سریع. این روند توسط دو نیروی اصلی هدایت می‌شود:

۱. مدل‌های کوچک تقطیر شده (Small Distilled Models): خانواده GPT-5.6 Luna در حال حاضر بر نیمه پایین مرز پارتو مسلط است. تنظیمات «تلاش کم» (low effort) این مدل، سطح هوش سقف اوت ۲۰۲۵ را تنها با هزینه ۰.۰۰۸۸ دلار فراهم می‌کند.
۲. مدل‌های با وزن‌های باز (Open Weights Models): در ژوئن ۲۰۲۶، مدل‌های بازی مانند MiMo-V2.5، DeepSeek V4 Pro، MiniMax-M3 و GLM-5.2 بر محدوده میانی (شاخص ۳۸ تا ۵۳) مسلط بودند. این روند کالایی شدن با عرضه مدل‌های وزن-باز مانند Kimi K3 شتاب گرفت که به کاهش چشمگیر هزینه‌های عملیاتی کمک کرد. در حالی که مدل‌های باز پیش از این فقط در پایین‌ترین محدوده ظاهر می‌شدند، برای مدت کوتاهی پیش از عرضه GPT-5.6 Luna، زمینه‌های میانی را در اختیار گرفتند؛ اما در حال حاضر، تنها ۲ مدل از ۱۶ مدل پیشرو، مدل‌های باز هستند.

کمی‌سازی زمان نصف شدن هزینه

در چندین سطح هوشی، رکورد هزینه برای رسیدن به آن سطح تقریباً هر چهار تا ده هفته یک بار نصف می‌شود.

  • سطح شاخص ≥ ۴۰: این سطح با Claude Sonnet 4.6 در فوریه و با هزینه ۱.۲۲ دلار باز شد. ظرف دو روز، Gemini 3.1 Pro Preview آن را به ۰.۳۳ دلار کاهش داد. تا آوریل، مدل باز-وزن MiMo-V2.5-Pro آن را به ۰.۰۳۴ دلار رساند و اکنون GPT-5.6 Luna آن را در ۰.۰۲۲ دلار نگه داشته است. این نشان‌دهنده یک سقوط ۲۹ برابری هزینه با زمان نصف شدن حدود ۷۳ روز است.
  • سطح شاخص ≥ ۵۰: این مرز در مارس توسط GPT-5.4 با هزینه ۱.۱۰ دلار رد شد. سپس توسط GPT-5.5، GLM-5.2 و Grok 4.5 پایین آورده شد. مدل GPT-5.6 Luna (xhigh) در ۹ ژوئیه رکورد را با ۰.۱۶ دلار شکست و کاهش ۸۰ درصدی قیمت توسط OpenAI در ۳۰ ژوئیه، آن را به ۰.۰۳۲ دلار رساند. این یک سقوط ۳۵ برابری در پنج ماه با زمان نصف شدن حدود ۲۹ روز است.
  • سطح شاخص ≥ ۶۰: گران‌ترین سطح است. تنها ۶ مدل امتیاز بالای ۶۰ دارند و ارزان‌ترین آن‌ها، Grok 4.6، هزینه ۰.۸۴ دلار در هر وظیفه دارد. با این حال، این رکورد از ژوئن تاکنون ۳.۸ برابر کاهش یافته و زمان نصف شدن آن حدود ۳۴ روز است.

پیچ تنظیم «تلاش» (The Effort Dial)

مدل‌های مدرن اکنون «تلاش» یا سطوح استدلال را به عنوان یک پیچ تنظیم کلیدی در نظر می‌گیرند و هزینه و هوش را به طور جدایی‌ناپذیری به هم پیوند می‌دهند. یک مدل واحد می‌تواند طیف وسیعی از طیف هزینه/هوش را پوشش دهد:

  • GPT-5.6 Luna: از ۰.۰۰۸۸ دلار (تلاش کم) تا ۰.۰۴۷ دلار (تلاش حداکثری) متغیر است.
  • Claude Opus 5: از ۰.۴۳ دلار (کم) تا ۲.۳۴ دلار (حداکثری) متغیر است و در این بازه حدود ده امتیاز هوشی کسب می‌کند.

هزینه هوش مصنوعی صد برابر کاهش می‌یابد — تأثیر آن بر علوم اعصاب محاسباتی چیست؟

ملاحظات داده‌ای و متدولوژی

دیکتر به چندین محدودیت در داده‌های مورد استفاده برای بازسازی مرز پارتو اشاره می‌کند. مهم‌ترین مورد این است که هزینه‌ها آخرین مقادیر اندازه‌گیری شده بر اساس تاریخ عرضه هستند، نه اندازه‌گیری‌های تاریخی در لحظه عرضه. از آنجایی که قیمت‌ها اغلب در طول عمر یک مدل کاهش می‌یابند، این موضوع باعث می‌شود تحلیل به طور سیستماتیک سقوط قیمت را کمتر از حد واقعی نشان دهد و تاریخ آن را زودتر از واقعیت تخمین بزند.

برای کاهش این خطا، دیکتر بزرگترین تغییر قیمت اخیر را اصلاح کرد: کاهش ۸۰ درصدی قیمت GPT-5.6 Luna توسط OpenAI در ۳۰ ژوئیه ۲۰۲۶ (سه هفته پس از عرضه در ۹ ژوئیه). او همچنین متوجه کاهش ۲۰ درصدی قیمت مدل Terra در همان روز شد، در حالی که قیمت Sol بدون تغییر ماند. او با مقیاس‌بندی مقدار اندازه‌گیری شده بر اساس نسبت قیمت، هزینه عرضه Luna را بازسازی کرد که باعث شد زمان نصف شدن اندازه‌گیری شده برای سه سطح پایین‌تر، چند روز طولانی‌تر شود.

پوشش داده‌ها نیز مسئله دیگری است. مدل‌های بازنشسته تنها در صورتی گنجانده شدند که صفحات آن‌ها هنوز اندازه‌گیری‌ها را داشتند، که منجر به بازیابی ۴۴ مدل از ۲۲۸ مدل بازنشسته شد. این بدان معناست که مدل‌هایی مانند o3 و GPT-5.3 Codex و همچنین کل دوران GPT-4 در این تحلیل نامرئی هستند. در نتیجه، قدیمی‌ترین مرزها بر اساس مدل‌های کمتری نسبت به آنچه در واقعیت وجود داشت بنا شده‌اند و قیمت اولیه واقعی سطوح پایین‌تر احتمالاً توسط مدل‌هایی تعیین شده بود که در این تحلیل ثبت نشده‌اند.

پارادوکس جِوِنز در هوش مصنوعی

برخلاف انتظار، با کاهش هزینه هوش، کل هزینه‌کرد برای مدل‌های زبانی بزرگ (LLM) در حال افزایش است. این نمونه‌ای از «پارادوکس جِوِنز» (Jevons Paradox) است: وقتی یک منبع کارآمدتر می‌شود، کاهش هزینه باعث ایجاد کاربردهای جدید چنان زیادی می‌شود که مصرف کل آن منبع افزایش می‌یابد. در این میان، برخی شرکت‌ها به جای بهینه‌سازی LLMها، به دنبال جایگزینی کامل آن‌ها هستند؛ برای مثال قمار ۱ میلیارد دلاری AMI Labs تلاشی برای جایگزینی این مدل‌ها با مدل‌های جهانی (World Models) است تا شاید پارادایم هزینه‌ها را به کلی تغییر دهد.

برای مثال، اسکن متنی ۱۰,۰۰۰ مقاله برای اندازه‌گیری استفاده مجدد از مجموعه‌داده‌ها در DANDI Archive، سال گذشته یک مطالعه آزمایشی بسیار گران‌قیمت می‌بود. با قیمت‌های مارس ۲۰۲۶، این عملیات چندین هزار دلار هزینه داشت. امروز، هزینه آن کمی بیش از صد دلار است. با هزینه ۰.۰۲ دلار به ازای هر مقاله، محققان می‌توانند اسکن را روی کل مجموعه داده اجرا کنند، هنگام تغییر خط‌لوله (pipeline) آن را تکرار کنند و برای کاهش نویز، نتایج را سه بار اجرا نمایند. هزینه هر مقاله بیش از یک مرتبه بزرگی کاهش یافت، اما هزینه کل پروژه افزایش یافت زیرا کار در مقیاس وسیع شد.

پیامدهایی برای طراحی سیستم

این نوسانات شدید نشان می‌دهد که سخت‌افزاری کردن (Hardcoding) نام یک مدل خاص در یک اپلیکیشن، سریع‌ترین راه برای پرداخت هزینه اضافی است. در عوض، این تحلیل استدلال می‌کند که باید به سمت معماری‌هایی رفت که در آن‌ها مدل یک قطعه قابل تعویض است و مسیریابی (Routing) بین سطوح قابلیت به صورت صریح انجام می‌شود.

مسیریاب‌های مدل (Model Routers)، مانند آنچه OpenRouter ارائه می‌دهد، در حال عملیاتی کردن این موضوع هستند. OpenRouter مسیریابی را ارائه می‌دهد که یک امتیاز قابلیت حداقلی را می‌گیرد و هر درخواست را به ارزان‌ترین مدل در مرز Artificial Analysis می‌فرستد که آن امتیاز را کسب کرده باشد. این به سیستم‌ها اجازه می‌دهد تا بدون نیاز به ردیابی دستی توسط توسعه‌دهنده، به طور خودکار از حرکت مرز قیمت‌ها بهره‌مند شوند.

پیش‌بینی‌ها و تغییر ۱۰۰ برابری

برون‌یابی این نرخ‌ها نشان‌دهنده یک تغییر عظیم در ماه‌های آینده است. بر اساس زمان نصف شدن فعلی حدود ۳۴ روز برای سطح ≥ ۶۰، رکورد ۰.۸۴ دلاری Grok 4.6 باید تا اوایل دسامبر به زیر ده سنت برسد. به طور مشابه، سطح شاخص ۵۵ (که در حال حاضر توسط Grok 4.5 با ۰.۳۶ دلار در اختیار است) باید تا اواسط اکتبر به زیر ۱۰ سنت برسد.

اگر روندهای فعلی ادامه یابد، هوشی که در ابتدای ۲۰۲۶ هر وظیفه آن ۱ دلار هزینه داشت، تا پایان سال به ۰.۰۱ دلار خواهد رسید. این تغییر، «خواندن همه چیز» را به حالت پیش‌فرض تبدیل می‌کند. نظارت روتین بر هر مقاله جدید، هر ایمیل یا هر تیکت پشتیبانی تریویال (trivial) می‌شود. کشف قانونی (Legal discovery)، بررسی‌های سیستماتیک، کیوریشن داده‌ها در مقیاس بزرگ و تریاژ پشتیبانی مشتری، همگی هر چند ماه یک بار یک مرتبه بزرگی ارزان‌تر می‌شوند.

گردش‌کارهای چند-مرحله‌ای (Multi-pass workflows) — یعنی اجرای یک تسک سه بار و گرفتن اجماع از نتایج — به یک استاندارد تبدیل خواهد شد، زیرا هزینه آن‌ها کمتر از هزینه یک بار اجرای همان تسک در چند ماه پیش خواهد بود. در چنین محیطی، منبع کمیاب دیگر «هوش» نیست، بلکه «قضاوت انسانی» است که برای تصمیم‌گیری در مورد اینکه این هوش را به چه سمتی هدایت کنیم، حقیقت زمینی (ground truth) برای تأیید آن و سیستم‌هایی برای اجرای آن در مقیاس وسیع مورد نیاز است.

منتظر نسخه بعدی شاخص هوش باشید. مدل‌های مرزی فعلی در حال اشباع کردن مقیاس موجود هستند (از ژوئن تاکنون تنها یک امتیاز رشد کرده‌اند)، که احتمالاً منجر به ایجاد یک بنچمارک جدید خواهد شد. اگر الگو حفظ شود، مرز بعدی با قیمت چند دلار در هر وظیفه معرفی خواهد شد و ظرف یک فصل کالایی خواهد شد.

گام بعدی شما

  • اگر از API مدل‌های گران‌قیمت استفاده می‌کنید، فوراً از یک Model Router برای کاهش هزینه‌ها بدون افت کیفیت استفاده کنید.
  • گردش‌کارهای «چند-مرحله‌ای» (Multi-pass) را جایگزین تک-مرحله‌ای‌ها کنید؛ اکنون اجرای سه بار یک تسک برای رسیدن به اجماع، ارزان‌تر از یک بار اجرای سال گذشته است.
  • برای وظایف حجیم، به جای مدل‌های Frontier، روی مدل‌های Distilled با امتیاز بالای ۴۰ تمرکز کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این روند بر اساس داده‌های Artificial Analysis، مدل‌های هوش مصنوعی را از ابزارهای خاص به زیرساخت‌های عمومی تبدیل می‌کند. کاهش هزینه استنتاج باعث می‌شود اتوماسیون در مقیاس میلیونی برای کسب‌وکارهای کوچک نیز اقتصادی شود.

تأثیر برای ایران

کاهش شدید هزینه‌های API، موانع مالی توسعه‌دهندگان ایرانی را برای اجرای پروژه‌های مقیاس‌بزرگ کاهش می‌دهد، هرچند دسترسی به مدل‌های پیشرو همچنان نیازمند دور زدن محدودیت‌های جغرافیایی است.

·نگاه ما
تحریریه دات‌هوش

سقوط قیمت استنتاج نشان می‌دهد که ما از عصر «دسترسی به هوش» به عصر «بهینه‌سازی مصرف هوش» وارد شده‌ایم. وقتی هزینه به این شدت کاهش می‌یابد، استراتژی‌های مهندسی پرامپت برای کاهش توکن‌ها جای خود را به معماری‌های Agentic می‌دهد که در آن‌ها تکرار و بازبینی (Iteration) به دلیل ارزان بودن، اولویت می‌یابد. در واقع، مدل‌های زبانی در حال تبدیل شدن به یک Utility یا کالای مصرفی شبیه برق و آب هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.