پرش به محتوای اصلی
پرش به محتوای مقاله

مطالعه استنفورد: مدل‌های زبانی کوچک در ۸۱٪ وظایف با مدل‌های ابری برابری می‌کنند

·۲۹ مرداد ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
اگر این درست باشد، ابرشرکت‌های فناوری نابود شده‌اند.
اگر این درست باشد، ابرشرکت‌های فناوری نابود شده‌اند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات عددی این موضوع که ۸۱٪ از کاربردهای عمومی AI دیگر نیازی به ابر ندارند و مدل‌های محلی در استدلال (Reasoning) به‌سرعت در حال رسیدن به سقف عملکرد مدل‌های ابری هستند.

اگر امروز برای اجرای مدل‌های هوش مصنوعی به اشتراک‌های ماهانه و سرورهای ابری متکی هستید، احتمالاً به‌زودی سخت‌افزار روی میزتان تمام نیازهای شما را پوشش می‌دهد. طبق مطالعه دانشگاه استنفورد که در مه ۲۰۲۶ منتشر شد، مدل‌های زبانی کوچک (SLM) در ۸۱.۲٪ از موارد کاربرد عمومی، عملکردی برابر یا حتی بهتر از مدل‌های غول‌پیکر ابری دارند. این یافته‌ها نشان می‌دهد که دوران سلطه مطلق مراکز داده ممکن است به نقطه اشباع رسیده باشد.

سال‌ها تصور می‌شد که هوش مصنوعی برای رسیدن به سطح استدلال بالا، به مقیاس عظیم — یعنی پارامترهای بیشتر و برق بیشتر — نیاز دارد. همین باور باعث شد شرکت‌های بزرگ (Hyperscalers) صدها میلیارد دلار روی مزارع سرور عظیم هزینه کنند. اما اکنون تغییر مسیر به سمت هوش مصنوعی محلی، دیگر فقط بحث حریم خصوصی نیست، بلکه بحث بازدهی خالص عملکرد است.

شکاف عملکرد

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی رایانش لبه (Edge Computing) اشاره کردیم، انتقال پردازش از ابر به دستگاه کاربر، گامی ضروری برای کاهش تأخیر و هزینه است. در این پژوهش، تیم استنفورد مدل‌های محلی از جمله QWEN 3، GEMMA 3، GPT-OSS و GRANITE 4.0 را در برابر غول‌های ابری مثل ChatGPT 5، Claude Sonnet 4.5 و Gemini 2.5 Pro قرار داد. این آزمایش‌ها روی رایانه‌های شخصی مجهز به تراشه‌های Nvidia و Apple M4 انجام شد.

انتخاب این سخت‌افزارها بازتاب‌دهنده تجهیزاتی است که در حال حاضر در رایانه‌های رومیزی رده‌بالا در دسترس هستند. نکته قابل توجه این است که این مطالعه پیش از آنکه انویدیا تراشه اختصاصی هوش مصنوعی خود برای رایانه‌های شخصی را معرفی کند، تکمیل شده است؛ پیشرفتی که نویسندگان معتقدند تنها باعث شتاب بخشیدن به خروج از مراکز داده و حرکت به سمت مدل‌های اجرا شده روی دسکتاپ خواهد شد.

به نقل از گزارش سعد-فالسون و همکاران (۲۰۲۶)، نتایج بر اساس نوع وظیفه متفاوت است:

  • درخواست‌های چت: که بخش اعظم ترافیک فعلی را تشکیل می‌دهند؛ مدل‌های کوچک در ۹۸.۶٪ موارد، به‌طور میانگین در تمامی حوزه‌ها، پاسخ‌هایی برابر یا بهتر از مدل‌های ابری دادند.
  • وظایف استدلالی: این بخش دشوارتر است، اما مدل‌های کوچک به‌سرعت در حال پیشرفت هستند و در ۶۲.۵٪ موارد برابری کردند.
  • میانگین وزنی: با ترکیب تکرار چت و استدلال بر اساس فراوانی استفاده، مدل‌های کوچک در ۸۱.۲٪ سناریوها برنده یا مساوی شدند.

با این حال، مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — هنوز در حوزه‌های تخصصی پیشرو هستند. طبق این مطالعه، مهندسی، علوم زیستی، حمل‌ونقل و علوم کامپیوتر همچنان قلعه‌های مستحکم مدل‌های ابری هستند.

مسیر تکامل استدلال

شگفت‌انگیزترین بخش این گزارش، سرعت رشد توانایی استدلال است. پژوهشگران عملکرد مدل‌ها را بین سال ۲۰۲۳ تا اکتبر ۲۰۲۵ رصد کردند. در سال ۲۰۲۳، مدل‌های کوچک در پنج سطح دشواری، معمولاً به نرخ موفقیت ۵۰ درصدی می‌رسیدند. اما تا اکتبر ۲۰۲۵، این آمار به‌صورت خیره‌کننده‌ای تغییر کرد:

  • سطوح ۱ و ۲ (آسان‌ترین): نرخ موفقیت ۹۹٪.
  • سطوح ۳ و ۴ (سخت‌تر): نرخ موفقیت ۸۵٪ تا ۹۲٪.
  • سطوح ۵ (سخت‌ترین): نرخ موفقیت ۵۱.۵٪.

تنها پیچیده‌ترین وظایف استدلالی در «سطح ۵» به عنوان یک مانع باقی مانده‌اند. این مسیر نشان می‌دهد که در ۴ مورد از هر ۵ کاربرد، می‌توان زیرساخت‌های گران‌قیمت نیمه‌هادی در مراکز داده را با سخت‌افزار محلی جایگزین کرد.

بهره‌وری و اقتصاد

مدل‌های محلی فقط در کیفیت رقابتی نیستند، بلکه به‌شدت ارزان‌ترند. بر اساس مستندات این پژوهش، هزینه انرژی و محاسبات (Compute) — که شبیه کرایه آشپزخانه صنعتی است و هرچه دستور پخت سنگین‌تر باشد، هزینه هر وعده بیشتر می‌شود — در مدل‌های کوچک بسته به مدل و سخت‌افزار مورد استفاده، ۵۰٪ تا ۸۵٪ کمتر از مدل‌های ابری است.

از نظر بهره‌وری سخت‌افزاری، میزان استنتاج (Inference) — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند و شبیه خودِ آشپزی است، نه دوره آموزش آشپز — به ازای هر وات در مدل‌های کوچک، معمولاً هفت برابر بیشتر از مدل‌های ابری است. این بدان معناست که پردازش یک وظیفه روی دسکتاپ یا دستگاه موبایل، اساساً ارزان‌تر از ارسال همان درخواست به یک مرکز داده است.

چرخش بازار

پیامدهای اقتصادی این تغییر عظیم است. گزارش تخمین می‌زند بازار هدف مدل‌های کوچک در آمریکا به ۱۰ تریلیون دلار رسیده که یک‌سوم کل تولید ناخالص داخلی (GDP) این کشور است که ۳۰ تریلیون دلار برآورد می‌شود.

این یعنی ۸۰٪ از حجم کاری مورد انتظار هوش مصنوعی می‌تواند از ابر خارج شود. اگر این روند ادامه یابد، سرمایه‌گذاری‌های کلان (Capex) که در حال حاضر به سمت مراکز داده‌های عظیم سرازیر شده است، ممکن است بازگشت سرمایه و رشد درآمد مورد انتظار را نداشته باشد. در واقع، نویسندگان اشاره می‌کنند که مراکز داده ممکن است در حال حاضر بدترین سرمایه‌گذاری در فضای AI باشند.

تغییر محور سخت‌افزاری

این چرخش، برندگان مسابقه را تغییر می‌دهد. در حالی که تراشه‌های رده‌بالای H100 انویدیا قدرت ابر را تأمین می‌کنند، تقاضا ممکن است به سمت تراشه‌های ارزان‌تر مخصوص PC بچرخد. این اتفاق حاشیه سود سازندگانی که روی قیمت‌های سازمانی تکیه کرده‌اند را کاهش می‌دهد. بهترین سناریو برای انویدیا این است که GPUهای رده‌بالای مرکز داده را با تراشه‌های جدید برای PC جایگزین کند، هرچند این امر احتمالاً رشد کلی درآمد را تحت تأثیر قرار می‌دهد.

علاوه بر این، برتری مدل‌های ابری در «هوش مصنوعی عامل‌محور» (Agentic AI) — جایی که مدل‌ها به‌طور مستقل عمل می‌کنند — در حال حاضر تنها خندق دفاعی اصلی است. در حال حاضر نرخ موفقیت مدل‌های کوچک در وظایف عامل‌محور زیر ۵۰٪ است، اما مطالعه نشان می‌دهد این شکاف هم احتمالاً همانند استدلال، به‌زودی پر خواهد شد.

همچنین محدودیت‌هایی در مورد دستگاه‌های موبایل وجود دارد. مدل‌هایی که می‌توانند روی آیفون اجرا شوند، به‌طور قابل توجهی ضعیف‌تر از مدل‌های قابل اجرا روی PC هستند. با این حال، حتی این مدل‌های موبایلی هم از جایگزین‌های ابری بهینه‌تر و کم‌مصرف‌تر هستند.

در نهایت، برای کاربر نهایی، «مغز» هوش مصنوعی از یک سرور دوردست به دستگاهی در جیب یا روی میز منتقل می‌شود. شرکت‌هایی مثل OpenAI و Anthropic ممکن است برای رقابت با مدل‌هایی مثل GRANITE شرکت IBM یا QWEN چین، مجبور شوند مدل‌های خود را کوچک‌تر و بهینه‌تر کنند، هرچند این کار احتمالاً منجر به حاشیه سود کمتر می‌شود.

برندگان واقعی ممکن است نه ارائه‌دهندگان خدمات ابری، بلکه تولیدکنندگان سخت‌افزار مانند Apple و Dell باشند. منتظر عرضه تراشه‌های اختصاصی AI شرکت انویدیا برای PC باشید، که نویسندگان معتقدند مهاجرت از ابر را بیش از پیش شتاب خواهد داد.

گام بعدی شما

  • بررسی مدل‌های QWEN 3 و GEMMA 3 روی سخت‌افزارهای محلی با استفاده از ابزارهایی مثل Ollama.
  • ارزیابی مجدد هزینه‌های API در مقابل هزینه خرید سخت‌افزار برای سازمان‌هایی که حجم درخواست‌های چت بالایی دارند.
  • دنبال کردن معرفی تراشه‌های اختصاصی AI شرکت انویدیا برای PC که شتاب‌دهنده این مهاجرت خواهد بود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر داده‌های تجربی استنفورد، اعتبار فرضیه «مقیاس‌پذیری مطلق» را به چالش می‌کشد. کاهش وابستگی به مراکز داده، قدرت را از ارائه‌دهندگان ابری به تولیدکنندگان سخت‌افزار لبه مانند اپل منتقل می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی، این یک خبر عالی است؛ چرا که اجرای مدل‌های محلی (SLM) محدودیت‌های دسترسی به API و تحریم‌های پرداخت ارزی را به‌طور کامل حذف می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «بیشترین پارامتر» به «بیشترین بازدهی به ازای هر وات» تغییر کرده است. این داده‌ها نشان می‌دهد که مدل‌های غول‌پیکر در حال تبدیل شدن به ابزارهای تخصصی (Specialized) هستند، در حالی که مدل‌های کوچک به استاندارد پیش‌فرض برای کارهای روزمره تبدیل می‌شوند. احتمالاً شاهد ظهور یک بازار جدید از «بهینه‌سازان مدل» خواهیم بود که تخصصشان تبدیل مدل‌های ابری به نسخه‌های محلی بدون افت کیفیت است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.