پرش به محتوای اصلی
پرش به محتوای مقاله

افشای تدریجی در Ratel چگونه نیاز به حافظه‌های برداری را حذف می‌کند؟

·۲۵ تیر ۱۴۰۵۴ دقیقه مطالعه
مهندسی زمینه برای عامل‌های هوش مصنوعی: ~۸۰٪ توکن کمتر، رفع overload ابزارها، بازیابی معنایی و BM25، افشای تدریجی، بدون پایگاه
مهندسی زمینه برای عامل‌های هوش مصنوعی: ~۸۰٪ توکن کمتر، رفع overload ابزارها، بازیابی معنایی و BM25، افشای تدریجی، بدون پایگاه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم افشای تدریجی برای ابزارها که به‌جای ذخیره همه قابلیت‌ها در پرامپت، آن‌ها را به‌صورت پویا و در لحظه نیاز بازیابی می‌کند.

اگر امروز برای اجرای عامل‌های هوش مصنوعی هزینه می‌کنید، احتمالاً بخش بزرگی از بودجه شما صرف توکن‌های تکراری و بی‌فایده می‌شود. Ratel که در ۱۶ ژوئیه ۲۰۲۶ معرفی شد، یک لایه مهندسی زمینه (Context Engineering) جدید برای عامل‌های هوش مصنوعی است که ادعا می‌کند می‌تواند کل سربار توکن‌ها را تا ۸۰٪ کاهش دهد. این سطح از بهره‌وری برای حل مشکل «بیش‌باری ابزار» (Tool Overload) طراحی شده است؛ نقصی رایج در اکثر چارچوب‌های عامل‌ها که در آن بارگذاری تمام طرح‌واره‌های ابزارهای موجود در پرامپت سیستم، باعث اتلاف هزینه و گیج شدن مدل می‌شود. این تلاش‌ها در راستای بهینه‌سازی هزینه‌های عملیاتی است، مشابه آنچه در معماری TokenFold برای کاهش ۳۰ درصدی هزینه‌های عامل‌های کدنویسی مشاهده شد.

تصور کنید یک دستیار دیجیتال را که تمام دفترچه‌های راهنمای تک‌تک ابزارهای دنیا را در هر لحظه در جیب خود حمل می‌کند. چنین دستیاری کند شده و مستعد اشتباه است. Ratel این حجم زیاد را با یک سیستم کاتالوگ جایگزین می‌کند که فقط دفترچه راهنمای خاصی را که برای انجام وظیفه فعلی نیاز است، به دستیار تحویل می‌دهد.

شکاف مهندسی زمینه

طبق مستندات ratel-ai، طرح‌واره‌های ابزار (tool schemas)، مهارت‌ها و لیست‌های رو به رشد دستورالعمل‌ها در پرامپت سیستم، توکن‌هایی هستند که در هر بار فراخوانی مدل، هزینه آن‌ها پرداخت می‌شود. ارسال همه این موارد به‌صورت پیش‌فرض، یک جریمه دوگانه ایجاد می‌کند: افزایش هزینه‌های هر نوبت گفتگو و کاهش دقت مدل. با رشد حجم زمینه (Context)، احتمال اینکه مدل‌ها گزینه اشتباهی را انتخاب کنند یا از مسیر وظیفه منحرف شوند، بیشتر می‌شود.

مکانیزم افشای تدریجی

برای حل این مشکل، Ratel از مکانیزم «افشای تدریجی» (Progressive Disclosure) برای نمایه‌سازی ابزارها و مهارت‌ها استفاده می‌کند. در این روش، به‌جای استفاده از یک پرامپت ایستا (Static)، عامل یک تابع جست‌وجو را فراخوانی می‌کند تا قابلیت مناسب را بیابد و سپس آن قابلیت به‌صورت پویا به زمینه تزریق شود. این ساختار به عامل اجازه می‌دهد تا در نمایه‌های جداگانه ابزارها و مهارت‌ها جست‌وجو کرده و نتایجی متمرکز را بازگرداند. این رویکردی جدید در مدیریت ابزارهاست که یادآور استفاده از گراف‌های ساختاری برای کاهش تا ۲۴ برابری هزینه استنتاج در محیط‌های پیچیده است.

مهندسی زمینه برای عامل‌های هوش مصنوعی. ~۸۰٪ توکن کمتر. رفع overload ابزارها. مهارت و حافظه با بازیابی معنایی و BM25. افشای تد

جزئیات فنی

مشخصات کلیدی فنی این سیستم شامل موارد زیر است:

  • BM25 درون-پروسسی: الگوریتم پیش‌فرض بازیابی، همان الگوریتمی است که اکثر موتورهای جست‌وجو را پشتیبانی می‌کند. این الگوریتم روی متادیتای ابزارها (که نسبت به طرح‌واره آگاه است)، نام مهارت‌ها، توضیحات و تگ‌ها اعمال می‌شود تا نتایجی سریع و قطعی، بدون نیاز به یک پایگاه‌داده برداری (Vector DB)، حاصل شود.
  • رتبه‌بندی ترکیبی: کاربران می‌توانند برای هر کاتالوگ یا هر بار فراخوانی، رتبه‌بندی معنایی یا ترکیبی را فعال کنند. این قابلیت از یک نقطه اتصال (Endpoint) امبدینگ سازگار با OpenAI یا یک مدل درون-پروسسی برای جست‌وجو در نمایه‌های متراکم (Dense Indexes) به‌صورت ناهمگام استفاده می‌کند.
  • کاتالوگ‌های دوگانه: سیستم به‌طور کلی بین «کاتالوگ ابزار» (توابع قابل اجرا یا Executable Functions) و «کاتالوگ مهارت» (نقشه راه‌ها و دستورالعمل‌ها یا Playbooks) تفکیک قائل می‌شود.
  • هسته پردازشی: موتور بازیابی ratel-ai-core با زبان Rust نوشته شده و تحت لایسنس Apache-2.0 منتشر شده است، در حالی که SDKها و سیستم‌های تله‌متری تحت لایسنس MIT قرار دارند.

Ratel برای هر دو زبان TypeScript (با اتصال NAPI) و Python (با اتصال PyO3) کیت توسعه (SDK) ارائه می‌دهد و به توسعه‌دهندگان اجازه می‌دهد ابزارها را با طرح‌واره‌های ورودی و خروجی مشخص ثبت کنند. برای مثال، ابزاری مانند read_file — که با یک ورودی مسیر به‌صورت رشته (string) و خروجی محتوا به‌صورت رشته تعریف شده — می‌تواند در قالب یک مهارت به نام inspect-local-file بسته‌بندی شود. بدنه این مهارت، مانند دستور «فایل مورد نظر را بخوان و سپس پاسخ خود را بر اساس محتویات آن استوار کن»، تا زمانی که عامل از طریق تابع get_skill_content نقشه راه مربوطه را بارگذاری نکند، خارج از زمینه (Context) باقی می‌ماند.

اکوسیستم و یکپارچه‌سازی

فراتر از SDK اصلی، این پروژه شامل چندین ابزار تخصصی است:

  • ratel-local: یک توزیع محلی که به‌طور خاص برای عامل‌های کدنویسی (Coding Agents) و تنظیمات MCP (پروتکل زمینه مدل) طراحی شده است.
  • ratel-bench: ابزاری برای بنچمارک که جهت تولید داده‌های موجود در سایت benchmark.ratel.sh استفاده می‌شود.
  • مسیرهای یکپارچه‌سازی: این سیستم به‌گونه‌ای طراحی شده است که در جریان‌های کاری Vercel AI SDK و Pydantic AI به‌طور کامل عمل کند.

این تغییر رویکرد، صنعت را از ذهنیت «همه چیز در پرامپت» به سمت تحویل پویا و به‌موقع (Just-in-time) قابلیت‌ها سوق می‌دهد. با تبدیل ابزارها به یک کتابخانه قابل جست‌وجو به‌جای یک لیست ایستا، توسعه‌دهندگان می‌توانند عامل‌های خود را به صدها ابزار گسترش دهند,بدون اینکه به محدودیت‌های زمینه برخورد کنند یا استدلال مدل را تخریب نمایند.

برای کیف پول توسعه‌دهندگان، این به معنای پرداخت توکن کمتر در هر نوبت است. در عمل، این روش با حذف نویزهایی که مدل را به سمت انتخاب ابزار اشتباه یا انحراف از هدف می‌برد، قابلیت اطمینان (Reliability) عامل‌ها را متحول می‌کند.

توسعه‌دهندگان می‌توانند این بهبودهای عملکردی را از طریق بنچمارک رسمی در benchmark.ratel.sh آزمایش کنند یا SDK را در چارچوب عامل‌های فعلی خود یکپارچه نمایند.

گام بعدی شما

  • بررسی عملکرد واقعی این لایه در سایت benchmark.ratel.sh
  • جایگزینی لیست‌های استاتیک ابزارها در پروژه‌های فعلی با SDKهای Ratel
  • بررسی مدل‌های رتبه‌بندی ترکیبی برای ابزارهای حساس

اما تأثیر این بهینه‌سازی بر مدل‌های استدلالی جدید حتی عمیق‌تر است؛ به تحلیل ما درباره مدل‌های Reasoning مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با کاهش شدید هزینه استنتاج و حذف نویز در پرامپت، مقیاس‌پذیری عامل‌های هوش مصنوعی را برای سازمان‌ها ممکن می‌کند. اعتبار این ادعا از طریق بنچمارک‌های باز و استفاده از زبان Rust برای بازدهی حداکثری تأیید شده است.

تأثیر برای ایران

به‌دلیل متن‌باز بودن هسته پروژه و ارائه SDK برای پایتون، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به سرویس‌های ابری گران‌قیمت، هزینه استنتاج عامل‌های خود را کاهش دهند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی BM25 به‌جای اتکای مطلق به پایگاه‌داده‌های برداری، بازگشتی به دقت‌های قطعی در بازیابی است. این رویکرد ثابت می‌کند که برای بسیاری از کارهای عامل‌محور، جست‌وجوی معنایی پیچیده ضرورتی ندارد و سادگی در لایه مهندسی زمینه، بر پیچیدگی‌های برداری غلبه می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.