پرش به محتوای اصلی
پرش به محتوای مقاله

Exabase: کاهش ۸۱ درصدی هزینه توکن‌ها با استخراج حافظه

·۱۸ مرداد ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
راهنما
نحوه کاهش ۸۱ درصدی هزینه توکن API مدل‌های زبانی بزرگ
نحوه کاهش ۸۱ درصدی هزینه توکن API مدل‌های زبانی بزرگ
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل تاریخچه خام گفتگو با یک لایه استخراج حافظه ساختاریافته که هزینه‌ها را از رشد خطی به رشد ثابت تبدیل می‌کند.

اگر صورت‌حساب ماهانه API شما با هر پیام کاربر به‌صورت خطی رشد می‌کند، احتمالاً در حال پرداخت هزینه برای داده‌های تکراری و بی‌ربط هستید. طبق گزارشی که در ۹ اوت ۲۰۲۶ منتشر شد، یک تغییر معماری ساده در مدیریت بستر متن توانست هزینه ماهانه یک سیستم هوش مصنوعی متوسط را از ۱۲٬۴۰۰ دلار به ۲٬۳۰۰ دلار برساند؛ یعنی کاهشی ۸۱ درصدی در هزینه‌های جاری.

بسیاری از تیم‌های مهندسی تصور می‌کنند افزایش هزینه‌ها نشانه موفقیت محصول و رشد کاربران است. اما واقعیت این است که این هزینه‌ها معمولاً به‌دلیل انباشتن حجم زیادی از داده‌های نامرتبط در هر درخواست افزایش می‌یابد. این وضعیت باعث می‌شود یک منحنی هزینه خطی ایجاد شود که به‌جای سودمندی واقعی، با طول گفتگو رشد کند. اگر هزینه توکن‌های شما هر ماه بیشتر می‌شود، شما اشتباه نمی‌کنید؛ حقیقت ساده‌تر و قابل‌حل‌تر از آن چیزی است که اکثر تیم‌ها تصور می‌کنند. این چالش‌ها دقیقاً همان نقاط ضعفی هستند که در بررسی مدل‌های قیمت‌گذاری توکنی در برابر پرداخت به ازای نتیجه به آن‌ها پرداختیم و نشان دادیم چگونه ساختار فعلی هزینه‌ها می‌تواند بودجه‌های عملیاتی را به گمراهی بکشاند.

همان‌طور که در تحلیل قبلی ما درباره‌ی ابزارهایی مثل اولاما (Ollama) و کاهش هزینه‌ها از طریق اجرای مدل‌های محلی اشاره کردیم، اکنون تمرکز بر بهینه‌سازی معماری برای APIهای ابری است. مشکل از انتخاب مدل نیست، بلکه نویز ارسالی به مدل است. برای مثال، یک درخواست به GPT-4o با ۱۵٬۰۰۰ توکن بستر متن، تقریباً ۱۰ برابر گران‌تر از درخواستی است که تنها بر اساس ۱٬۵۰۰ توکن ساخته شده است. چون مدل نمی‌تواند تشخیص دهد کدام توکن‌ها واقعاً مفید هستند، شما برای تک‌تک آن‌ها هزینه می‌پردازید، فارغ از اینکه کاربردی داشته باشند یا خیر.

سه موتور تولید هزینه توکن

بیشتر اتلاف توکن‌ها از سه الگوی خاص ناشی می‌شود که بخش اعظم هزینه‌های غیرضروری در معماری‌های رایج عامل‌های هوش مصنوعی را تشکیل می‌دهند:

  • تزریق کامل تاریخچه گفتگو: این روش شامل الحاق کل لاگ‌های چت به هر درخواست جدید است. این یعنی شما برای سلام و احوالپرسی‌ها، بحث‌های حاشیه‌ای و جملات تکراری که هیچ ربطی به سؤال فعلی ندارند، هزینه می‌دهید. یک گفتگوی ۲۰ پیامی ممکن است در مجموع ۱۲٬۰۰۰ توکن باشد، در حالی که پاسخ مورد نیاز اغلب در یک تبادل کوتاه نهفته است.
  • بازیابی ساده k-برتر در RAG: در روش‌های استاندارد تولید بازیابی‌افزا (RAG) — که شبیه دانش‌آموزی است که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — سیستم ۵ تا ۸ تکه متن برتر را بر اساس شباهت برداری برمی‌دارد و همه را در پرامپت می‌ریزد. حتی اگر فقط یک یا دو تکه حاوی جواب واقعی باشند، سیستم هزینه کل مجموعه را پرداخت می‌کند.
  • استفاده از مدل برای جست‌وجوی ساده: سؤالاتی مثل «این کاربر چه پلنی دارد» اصلاً نیازی به استدلال ندارند. این‌ها صرفاً بررسی یک حقیقت (Fact Check) هستند، با این حال بسیاری از سیستم‌ها یک فراخوانی کامل مدل را صرف استخراج این جواب از تاریخچه دفن‌شده‌ی گفتگو می‌کنند.

با طولانی‌تر شدن گفتگوها و رشد پایگاه‌های دانش، این اتلاف‌ها به‌صورت ترکیبی افزایش می‌یابد. در پیام چهلم، برخی معماری‌ها ۲۵٬۰۰۰ توکن در هر درخواست تزریق می‌کنند که بیشتر آن هرگز به طور معنادار مورد توجه مدل قرار نمی‌گیرد.

نحوه کاهش ۸۱ درصدی هزینه توکن API مدل‌های زبانی بزرگ

چرا راهکارهای رایج شکست می‌خورند؟

وقتی هزینه‌های توکن شروع به افزایش می‌کند، تیم‌ها اغلب به سراغ وصله‌های سریع می‌روند. متأسفانه این راهکارهای محبوب معمولاً مشکل را جابه‌جا می‌کنند نه حل:

  • کوتاه کردن گفتگوها: این کار کاربران را مجبور به تجربه محصولی بدتر می‌کند، صرفاً برای اینکه هزینه محاسبات کم شود.
  • سوییچ به مدل‌های ارزان‌تر: اگرچه این کار قیمت هر توکن را کاهش می‌دهد، اما مدل‌های ضعیف‌تر در مواجهه با بستر متن نویزی بیشتر دچار مشکل می‌شوند و در نتیجه، یک مشکل هزینه به یک مشکل کیفیت تبدیل می‌شود.
  • خلاصه‌سازی تاریخچه: این روش ذاتاً دارای فقدان داده (Lossy) است. یک مدل خلاصه‌ساز باید حدس بزند چه چیزی در آینده مهم خواهد بود، پیش از آنکه بداند چه سؤالاتی در راه است.
  • گسترش پنجره متنی: تحقیقات به‌طور مداوم نشان می‌دهد که با انباشت توکن‌های نامرتبط، عملکرد مدل افت می‌کند. پنجره متنی (Context Window) — که مثل میز کاری است که جا برای چند ورق دارد، نه برای کل کتابخانه — اگر بزرگ‌تر شود، فقط فضای بیشتری برای نویزی ایجاد می‌کند که مدل نمی‌تواند به‌طور قابل‌اعتمادی از آن استفاده کند.

هیچ‌کدام از این رویکردها ریشه مشکل معماری را هدف قرار نمی‌دهند: ارسال بستر متنی که به مدل در پاسخ به سؤال پیش‌رو کمک نمی‌کند.

نحوه کاهش ۸۱ درصدی هزینه توکن API مدل‌های زبانی بزرگ

چرخش معماری در Exabase

شرکت Exabase لایه‌ای از داده‌ها را پیشنهاد می‌کند که مخصوص عامل‌های هوش مصنوعی ساخته شده و فقط حقایقی را استخراج می‌کند که اهمیت دارند. رویکرد آن‌ها بستر متن خام را با سه مکانیزم خاص جایگزین کرده است:

استخراج حافظه به‌جای تاریخچه خام

به‌جای تاریخچه خام، API حافظه آن‌ها حقایق ساختاریافته را استخراج می‌کند. یک گفتگوی ۸٬۰۰۰ توکنی می‌تواند به کسری کوچکی از حجم اولیه خود تبدیل شود و فقط ترجیحات، تصمیمات و محدودیت‌های بیان‌شده را ذخیره کند. در درخواست بعدی، شما به‌جای بازپخش کل گفتگو، فقط حافظه‌های مرتبط با آن پرسش خاص را بازیابی می‌کنید.

این موتور حافظه همچنین تضادها را به‌طور خودکار حل می‌کند؛ اگر کاربر در میانه چت پلن خود را ارتقا داده باشد، مدل فقط وضعیت فعلی و دقیق را می‌بیند، نه دو حقیقت متناقض که از نقاط مختلف گفتگو استخراج شده باشند.

بازیابی دقیق به‌جای تخلیه تکه‌ها

قابلیت Deep Search آن‌ها به‌جای برداشتن تکه‌های k-برتر بر اساس شباهت برداری، در سطح زیر-سند (sub-document) عمل می‌کند. این سیستم قطعات دقیقی را همراه با شماره صفحه و ارجاع به مکان دقیق بازمی‌گرداند. این یعنی یک عامل می‌تواند بدون وارد کردن کل سند به بستر متن، به منبع استناد کند.

بستر متن کوچک‌تر و تیزتر باعث می‌شود مدل انرژی کمتری برای فیلتر کردن نویز و انرژی بیشتری برای تولید جواب مفید صرف کند. چند قطعه دقیق و بسیار مرتبط معمولاً بستر متنی کمتری نسبت به یک سیستم RAG استاندارد ایجاد می‌کنند، در حالی که جواب واقعی را کامل‌تر پوشش می‌دهند.

جست‌وجوی حافظه به‌جای فراخوانی کامل مدل

حقایقی مثل سطح پلن کاربر، زبان مورد علاقه یا منطقه زمانی، وظایف تولیدی نیستند، بلکه جست‌وجوهای ساده (Lookups) هستند. با وجود حافظه ساختاریافته، این‌ها به فراخوانی‌های API تبدیل می‌شوند که در حدود ۲۰۰ میلی‌ثانیه پاسخ می‌دهند و صفر توکن از مدل مصرف می‌کنند.

هر جست‌وجویی که جایگزین یک فراخوانی کامل مدل شود، کل هزینه توکن و تأخیر (Latency) آن فراخوانی را حذف می‌کند. در یک جلسه گفتگو معمولی، معمولاً چندین مورد از این فرصت‌ها در معرض دید قرار دارند اما نادیده گرفته می‌شوند.

نحوه کاهش ۸۱ درصدی هزینه توکن API مدل‌های زبانی بزرگ

داده‌های مربوط به صرفه‌جویی

برای کمی کردن این دستاوردها، Exabase یک ماشین‌حساب آنلاین برای صرفه‌جویی در توکن‌ها ارائه داده است. برای یک سیستم متوسط که از GPT-4o (با قیمت ۲.۵ دلار به ازای هر میلیون توکن ورودی) استفاده می‌کند و ورودی‌هایش چنین است:

  • میانگین پیام‌ها در هر گفتگو: ۲۰
  • تکه‌های RAG بازیابی شده در هر درخواست: ۸
  • درخواست‌های روزانه: ۱۰٬۰۰۰

نتایج نشان می‌دهد هزینه ماهانه از ۱۲.۴ هزار دلار (بدون Exabase) به ۲.۳ هزار دلار (با Exabase) کاهش می‌یابد که معادل ۱۰.۱ هزار دلار صرفه‌جویی و کاهش ۸۱ درصدی است. این رقم چه در تعداد توکن‌ها در هر درخواست و چه در کل صورت‌حساب ماهانه ثابت می‌ماند.

این کارایی توسط موتور حافظه M-1 پشتیبانی می‌شود. در محک عمومی LongMemEval برای حافظه گفتگو، M-1 به دقت ۹۶.۴٪ در بازیابی ۵۰ مورد برتر رسید. نکته مهم این است که این نتیجه با استفاده از مدلی کوچک‌تر و ارزان‌تر نسبت به رقبا به دست آمده است، که ثابت می‌کند بازیابی دقیق، کیفیت را بهبود می‌بخشد و همزمان هزینه‌ها را در شرایط سخت و اندازه‌گیری‌شده به‌طور مستقل، کاهش می‌دهد.

نحوه کاهش ۸۱ درصدی هزینه توکن API مدل‌های زبانی بزرگ

تشخیص اتلاف توکن در سیستم خودتان

توسعه‌دهندگان می‌توانند با ردیابی میانگین توکن‌ها در هر درخواست در طول زمان، اتلاف خود را شناسایی کنند. اگر این عدد سریع‌تر از حجم درخواست‌ها رشد می‌کند، شما با یک مشکل بستر متن روبرو هستید، نه صرفاً مشکل حجم ترافیک.

هزینه‌های کل خود را به چهار دسته تقسیم کنید:
۱. پرامپت‌های سیستمی
۲. تاریخچه گفتگو
۳. تکه‌های RAG
۴. پیام واقعی کاربر

در بیشتر معماری‌ها، تاریخچه گفتگو و تکه‌های RAG با هم بیش از ۸۰٪ از کل هزینه توکن‌ها را تشکیل می‌دهند. ماشین‌حساب Exabase به تیم‌ها اجازه می‌دهد حجم درخواست، طول پیام و مدل انتخابی خود را تست کنند تا صرفه‌جویی احتمالی را بر اساس نسبت‌های استخراج مشاهده‌شده بسنجند. این ماشین‌حساب اشاره می‌کند که تخمین‌ها فقط بر اساس قیمت توکن‌های ورودی است و بازیابی حافظه بر اساس نسبت‌های مشاهده‌شده مدل‌سازی شده است، نه اینکه برای هر مورد استفاده تضمین شده باشد.

هزینه پیاده‌سازی

این تغییر نیازی به بازنویسی کامل کد ندارد. Exabase یک سطح رایگان برای تیم‌های کوچک با ۳۰ دلار اعتبار، ۱ گیگابایت حافظه و تا ۱۰۰ پایگاه داده ارائه می‌دهد تا تیم‌ها بتوانند پیش از تعهد مالی، صرفه‌جویی در توکن‌ها را روی ترافیک واقعی اعتبارسنجی کنند.

برای نیازهای بزرگ‌تر، پلن Scale با قیمت ۱۴۹ دلار در ماه (یا ۱٬۴۹۰ دلار به‌صورت سالانه که دو ماه رایگان است) ارائه می‌شود. این پلن شامل ۲ ترابایت حافظه و سیاست عدم ذخیره داده‌ها (Zero Data Retention) است. قیمت‌های سازمانی نیز به‌صورت سفارشی و بر اساس نیازهای پشتیبانی و ذخیره‌سازی مورد توافق تعیین می‌شود.

این رویکرد هزینه‌های هوش مصنوعی را از رشد خطی به یک خط صاف تبدیل می‌کند. با تبدیل بستر متن از یک جریان خام به یک دارایی ساختاریافته، توسعه‌دهندگان می‌توانند بدون افزایش متناسب صورت‌حساب API، تعداد کاربران خود را افزایش دهند. برای کسانی که عامل‌های تولیدی (Production) را مدیریت می‌کنند، گام بعدی این است که نسبت «توکن‌های استدلالی» به «توکن‌های جست‌وجو» را در لاگ‌های فعلی خود بررسی کنند تا ببینند چه مقدار از صورت‌حسابشان صرفاً پرداخت هزینه برای یک کوئری دیتابیس است.

گام بعدی شما

  • نسبت «توکن‌های استدلالی» به «توکن‌های جست‌وجو» را در لاگ‌های فعلی خود بررسی کنید تا بفهمید چه مقدار از بودجه شما صرف کوئری‌های ساده دیتابیس می‌شود.
  • اگر از RAG استفاده می‌کنید، تعداد تکه‌های بازیابی شده (Top-K) را کاهش داده و اثر آن را بر دقت مدل بسنجید.
  • ابزارهای استخراج حافظه ساختاریافته را برای جایگزینی تاریخچه خام گفتگوها در عامل‌های خود تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری هزینه مقیاس‌پذیری عامل‌های هوش مصنوعی را به‌شدت کاهش می‌دهد و اجازه می‌دهد محصولات تجاری بدون ترس از ورشکستگی بر اثر هزینه‌های API رشد کنند. اعتبار این ادعا با نتایج بنچمارک LongMemEval و کاهش واقعی هزینه‌ها در محیط عملیاتی تأیید شده است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه ارزی برای پرداخت هزینه‌های APIهای گران‌قیمت مثل GPT-4o روبرو هستند، پیاده‌سازی لایه‌های بهینه‌ساز حافظه تنها راه عملی برای مقیاس‌پذیری محصولات است.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «بزرگ‌تر کردن پنجره متنی» به «دقیق‌تر کردن بازیابی» تغییر کرده است. این رویکرد ثابت می‌کند که کیفیت پاسخ‌های مدل‌های زبانی بیش از آنکه به حجم داده‌های ورودی وابسته باشد، به نبود نویز در بستر متن بستگی دارد. در واقع، مدیریت حافظه اکنون به یک لایه زیرساختی مستقل تبدیل شده که جدا از خودِ مدل عمل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.