پرش به محتوای اصلی
پرش به محتوای مقاله

«تخمین ارزش»؛ راهکار جدید دیپ‌مایند برای بهینه‌سازی بودجهٔ استنتاج

·۳۱ مرداد ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
جعبه پاندورای مسیریابی هوش مصنوعی: تخصیص کارآمد وقتی تخمین ارزش هزینه‌بر است
جعبه پاندورای مسیریابی هوش مصنوعی: تخصیص کارآمد وقتی تخمین ارزش هزینه‌بر است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل مسیریابی مدل‌ها از یک فرآیند تخمینی (Black-box) به یک مسئله بهینه‌سازی مالی مبتنی بر «ارزش اطلاعات» (VoI) که هزینه خودِ تصمیم‌گیری را در محاسبات لحاظ می‌کند.

انتخاب مدل اشتباه برای یک پرس‌وجوی پیچیده، محاسبات را هدر می‌دهد؛ اما صرف زمان و هزینه زیاد برای تصمیم‌گیری درباره اینکه «کدام مدل بهتر است»، دقیقاً همان‌قدر گران تمام می‌شود. گوگل دیپ‌مایند (Google DeepMind) در ۲۰ اوت ۲۰۲۶ این تضاد را با تبدیل مسیریابی هوش مصنوعی به یک مسئله ریاضی به نام «جعبه پانجورا» حل کرد؛ جایی که هزینه بازرسی هر مدل در برابر سود احتمالی در کیفیت خروجی سنجیده می‌شود.

بسیاری از سامانه‌های مسیریابی فعلی فرض می‌کنند تخمین مدل بهینه رایگان است یا هزینه‌ای ثابت دارد. اما در واقعیت، یک تخمین‌گر ارزان مثل k-NN سریع اما نویزدار است، در حالی که یک تخمین‌گر دقیق — مثلاً مدلی که یک زنجیره تفکر (Chain-of-Thought) را تحلیل می‌کند — به محاسبات سنگینی نیاز دارد. این یک پارادوکس ایجاد می‌کند: مسیریاب خودش بودجه‌ای را مصرف می‌کند که قرار است در کل سیستم ذخیره کند. این موضوع در سامانه‌های ناهمگن که ترکیبی از مدل‌های کوچک، مدل‌های استدلالی بزرگ و پیکربندی‌های مختلف تولید بازیابی‌افزا (RAG) هستند، حیاتی است.

همان‌طور که در تحلیل‌های پیشین ما درباره بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، مدیریت منابع در مقیاس صنعتی دیگر یک انتخاب نیست، بلکه یک ضرورت است. تیم دیپ‌مایند با تکیه بر مبانی نظری وایتزمن (۱۹۷۹)، چارچوبی معرفی کرد که در آن هر مدل متخصص مانند یک «جعبه» با ارزشی پنهان است. در این مدل، مسیریاب تنها زمانی یک جعبه را باز می‌کند (یعنی هزینه تخمین گران‌قیمت را می‌پردازد) که بهبود مورد انتظار در کیفیت، از هزینه آن بازرسی بیشتر باشد. این رویکرد، مسیریابی را از یک شبکه عصبی «جعبه سیاه» به یک سیاست ریاضی تفسیرپذیر و مبتنی بر توزیع گاوسی تبدیل می‌کند.

رویکرد متمرکز: مسیریاب پانجورا

مسیریاب پانجورا (Pandora's Router) ابتدا تخمین‌های «ارزان» را از تمام متخصصان جمع‌آوری می‌کند. سپس برای هر مدل یک «قیمت ذخیره» (Reserve Price) محاسبه می‌کند. مسیریاب تخمین‌گرهای گران‌قیمت را به ترتیب نزولی قیمت ذخیره فراخوانی می‌کند و به محض اینکه بهترین مقدار مشاهده‌شده از قیمت ذخیره تمام گزینه‌های باقی‌مانده بیشتر شود، عملیات را متوقف می‌کند.

برای مدیریت مدل‌های مشابه که سیگنال‌های هم‌پوشان می‌فرستند، این مسیریاب از یک مدل گاوسی چندمتغیره برای به‌روزرسانی پویا قیمت‌ها استفاده می‌کند. این کار مانع از آن می‌شود که سیستم برای اطلاعات تکراری از دو مدل تقریباً یکسان، هزینه پرداخت کند.

در عمل، این مسیریاب بین دو حالت افراطی تعادل ایجاد می‌کند:

  • فقط تخمین ارزان: هزینه صفر، اما احتمال خطای بالا.
  • همیشه تخمین گران: هزینه حداکثری، اما کمترین میزان خطا.

پانجورا به‌صورت پویا تصمیم می‌گیرد: وقتی هزینه تخمین‌گر گران‌قیمت پایین است، بیشتر بازرسی می‌کند و وقتی هزینه بالاست، این کار را به ندرت انجام می‌دهد.

رویکرد غیرمتمرکز: پیشنهاددهنده پانجورا

دیپ‌مایند با درک این موضوع که برخی مدل‌ها اطلاعات خصوصی دارند — مثلاً یک مدل RAG که از مرتبط بودن اسناد بازیابی‌شده خود آگاه است — پیشنهاددهنده پانجورا (Pandora's Bidder) را توسعه داد. در این نسخه، یک مسیریاب مرکزی قیمت را بر اساس تخمین‌های مدل‌های غیراستراتژیک تعیین می‌کند.

یک مدل متخصص استراتژیک باید تصمیم بگیرد که آیا برای اصلاح تخمین خود هزینه پرداخت کند یا خیر. این مدل از منطق «ارزش اطلاعات» (Value of Information) استفاده می‌کند: اگر قیمت پایین باشد، تسک را می‌پذیرد و تنها در بازه‌ای که عدم قطعیت در اوج است، برای بازرسی هزینه می‌کند.

این مکانیسم به متخصصان اجازه می‌دهد بدون به اشتراک گذاشتن داده‌های اختصاصی خود با مسیریاب مرکزی، در بازار مسیریابی شرکت کنند. با این حال، طبق مستندات مقاله، یک ریسک جدی وجود دارد: وقتی تخمین‌های رقیب نویزدار باشند، پیشنهادهای استراتژیک می‌توانند به قیمت کاهش کارایی کل سیستم، سود مدل خاصی را افزایش دهند.

بنچمارک‌های عملکرد در دنیای واقعی

دیپ‌مایند این چارچوب را در سه حوزه مختلف با استفاده از مجموعه‌داده‌های MATH، Omni-Math، AIME و HMMT آزمایش کرد.

۱. ریاضیات (مقیاس‌بندی زمان استنتاج):

  • پیکربندی: انتخاب بین Gemma3-4B (ارزان) و Gemini-3.1-Flash-Lite (گران).
  • سازوکار: تخمین‌گر گران‌قیمت ۲۰ توکن اول از زنجیره تفکر را تحلیل می‌کرد تا احتمال موفقیت مسیر استدلال را بسنجد.
  • نتیجه: پانجورا مجموع «پشیمانی» (Regret) و هزینه‌های بازرسی را بهتر از هر روش پایه کاهش داد.

۲. تولید بازیابی‌افزا (RAG):

  • پیکربندی: سه متخصص (بدون بازیابی، RAG ویکی‌پدیا و RAG پاب‌مد).
  • سازوکار: هزینه بازیابی ۰.۰۵ برای هر پرس‌وجو در نظر گرفته شد.
  • نتیجه: پانجورا دقیقاً یاد گرفت چه زمانی پیچیدگی پرس‌وجو، هزینه بازیابی را توجیه می‌کند.

۳. انتخاب در مقیاس بزرگ (EmbedLLM):

  • پیکربندی: بیش از ۱۰۰ مدل با وزن‌های باز (Open Weights) که هزینه‌شان متناسب با تعداد پارامترها بود.
  • سازوکار: تخمین‌های ارزان از KNN روی بردار معنایی (Embedding) پرامپت‌ها استفاده کردند.
  • نتیجه: به‌دلیل همبستگی بالای مدل‌های مشابه، به‌روزرسانی گاوسی حیاتی بود. پانجورا در حالی که هزینه‌های عظیم را حذف کرد، کیفیتی مشابه استراتژی «همیشه بازرسی» حفظ کرد.

تغییر پارادایم مسیریابی

این پژوهش این فرض بنیادین را که مسیریابی یک هزینه سربار صفر است، تغییر می‌دهد. با معرفی منطق «ارزش اطلاعات»، دیپ‌مایند معیاری برای حسابرسی درگاه‌های هوش مصنوعی ارائه کرده است. اگر یک مسیریاب بدون جهش متناظر در کیفیت، تخمین‌گرهای گران‌قیمت را فراخوانی کند، از نظر ریاضی در حال هدر دادن منابع است. این موضوع با مقاله دانشگاه برکلی درباره «مقیاس‌بندی سیستم» هم‌سو است که در آن تصمیم‌گیرنده تعیین می‌کند چقدر محاسبات صرف تخمین شود، نه فقط اینکه کدام مدل انتخاب شود.

علاوه بر این، استفاده از فرمول‌های بسته برای قیمت‌های ذخیره به این معناست که این مسیریاب‌ها برای سازگاری با مدل‌های جدید نیازی به آموزش مجدد گسترده ندارند. این ویژگی پانجورا را به جزئی عملیاتی در معماری «ترکیب مسیریاب‌ها» (Mixture-of-Routers) تبدیل می‌کند.

برای مهندسان هوش مصنوعی، این یعنی مسیریابی اکنون می‌تواند به عنوان یک مسئله مالی بهینه شود. پیاده‌سازی مسیریابی به سبک پانجورا می‌تواند سربار مسیریابی را بدون کاهش دقت، بین ۳۰ تا ۷۰ درصد کاهش دهد. این موضوع با پیش‌نمایش عمومی سرویس‌های مسیریابی مدل در Google Cloud API Gateway در اوت ۲۰۲۶ اهمیت دوچندانی می‌یابد.

محدودیت‌ها و پرسش‌های باز

با وجود موفقیت‌ها، این چارچوب محدودیت‌هایی دارد. مدل گاوسی یک تقریب است و در حوزه‌هایی با مقادیر چندوجهی یا توزیع‌های دم‌سنگین، دقت آن کاهش می‌یابد. همچنین، مسئله کلی پانجورا NP-hard است و مقاله مجبور شده از تقریب‌های شبیه‌سازی مونت‌کارلو استفاده کند.

در حالت غیرمتمرکز، فعلاً تنها یک متخصص استراتژیک در نظر گرفته شده است. با حضور چندین عامل استراتژیک، تعادل بازار بسیار پیچیده‌تر می‌شود. در نهایت، این پژوهش هنوز هزینه‌های پویا که بر اساس بار سرور یا قراردادهای تجاری نوسان می‌کنند را لحاظ نکرده است.

با رشد تعداد مدل‌های متخصص و انفجار هزینه‌های استنتاج، توانایی تصمیم‌گیری درباره اینکه «چه زمانی نباید به انتخاب فکر کرد»، محرک اصلی بهره‌وری خواهد بود. گوگل دیپ‌مایند ثابت کرد که با فرموله کردن مسیریابی به عنوان یک جعبه پانجورا، می‌توان تعادلی بهینه بین هزینه دانستن و هزینه انجام دادن ایجاد کرد.

گام بعدی شما

  • اگر از معماری‌های چندمدلی استفاده می‌کنید، هزینه تخمین‌گرهای خود را با خروجی نهایی مقایسه کنید تا نقاط هدررفت منابع را بیابید.
  • بررسی کنید آیا مدل‌های شما همبستگی بالایی دارند؛ در این صورت پیاده‌سازی به‌روزرسانی‌های گاوسی برای حذف تخمین‌های تکراری ضروری است.
  • در طراحی گیت‌وی‌های هوش مصنوعی، به جای شبکه‌های عصبی پیچیده برای مسیریابی، از سیاست‌های ریاضی مبتنی بر قیمت ذخیره استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell و بهینه‌سازی استنتاج در لایه سخت‌افزار مراجعه کنید.

چرا این موضوع مهم است؟

این چارچوب با تکیه بر اعتبار ریاضیات احتمالات، اجازه می‌دهد شرکت‌ها بدون کاهش کیفیت، هزینه‌های عملیاتی مدل‌های زبانی را به شدت کاهش دهند. این یک نقطه عطف در مدیریت زیرساخت‌های هوش مصنوعی است که بهره‌وری را از سطح مدل به سطح سیستم منتقل می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه GPU یا هزینه‌های بالای API مواجه‌اند، پیاده‌سازی این منطق ریاضی در لایه گیت‌وی می‌تواند هزینه‌های استنتاج را تا ۷۰٪ کاهش دهد.

·نگاه ما
تحریریه دات‌هوش

دیپ‌مایند با این پژوهش، مسیریابی را از یک مسئله مهندسی ساده به یک مسئله مدیریت دارایی تبدیل کرده است. نکته کلیدی اینجاست که در دنیای مدل‌های تخصصی، «ندانستن» گاهی ارزان‌تر از «دانستن» است و پذیرش این واقعیت ریاضی، کلید مقیاس‌پذیری سیستم‌های Agentic است. این رویکرد احتمالاً منجر به ظهور بازارسازهایی می‌شود که قیمت لحظه‌ای استنتاج مدل‌ها را بر اساس ارزش اطلاعات مدیریت می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.