پرش به محتوای اصلی
پرش به محتوای مقاله

Castform و Neon هزینه جست‌وجوی عامل‌های هوشمند را با یادگیری تقویتی کاهش دادند

·۱۴ مرداد ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
کست‌فرم و نئون: پیروزی بر مدل‌های مرزی در قیمت و کارایی
کست‌فرم و نئون: پیروزی بر مدل‌های مرزی در قیمت و کارایی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی APIهای گران‌قیمت مدل‌های پیشرو با مدل‌های کوچک RL-trained در لایه‌ی بازیابی داده؛ این اولین بار است که یک خط لوله کامل برای تبدیل داده‌های خام دیتابیس به پاداش‌های یادگیری تقویتی برای عامل‌ها ارائه می‌شود.

تصور کنید برای هر درخواست جست‌وجوی پیچیده در یک سامانه عامل‌محور، با استفاده از مدلی مثل gpt-5.6-sol، حدود ۰.۰۳ دلار هزینه بپردازید و تأخیری (Latency) بیش از ۱۰ ثانیه را تحمل کنید. این نقطه قیمتی برای مقیاس‌بندی در سطح سازمانی مطلقاً prohibitively expensive (بازدارنده) است و دقیقاً دلیل پیدایش همکاری Castform و Neon برای انتقال بازیابی عامل‌محور از APIهای بسته به مدل‌های بهینه شده با وزن باز (Open-weights) است. این رویکرد در راستای تغییر کلی صنعت است، جایی که بحث بر سر تغییر معیار هزینه از توکن به وظیفه موفق در حال شکل‌گیری است تا مدل‌های اقتصادی‌تری برای سازمان‌ها تعریف شود.

در سال ۲۰۲۲، صنعت بر جست‌وجوی ساده با بردار معنایی (Embedding) متکی بود — جایی که هر ارائه‌دهنده‌ای این قابلیت را اضافه می‌کرد و pgvector به پردانلودترین افزونه Neon تبدیل شد. اما طبق گزارش‌ها، چشم‌انداز تا سال ۲۰۲۵ به سمت «بازیابی عامل‌محور» (Agentic Retrieval) تغییر کرد. در این مدل، مهندسان از خط لوله‌های ساده تولید بازیابی‌افزا (RAG) دست‌ساز و جست‌وجوهای تک‌مرحله‌ای (One-shot) فاصله گرفتند. در عوض، عامل‌ها مسائل بزرگ را به قطعات کوچک‌تر تجزیه و برنامه‌ریزی می‌کنند و در یک حلقه تکرار شونده، چندین بار جست‌وجو را انجام می‌دهند. هر بار تکرار این حلقه، یک فراخوانی به مدل‌های پیشرو (Frontier Models) را تحریک می‌کند که هزینه و تأخیر را برای هر کاربر به‌شدت بالا می‌برد.

Comparison of a traditional RAG pipeline and an agentic search workflow

به همین دلیل، Castform به توسعه‌دهندگان اجازه می‌دهد تا روی مدل‌های زبانی کوچک و با وزن باز — که ۱۰۰ برابر ارزان‌تر از APIهای بسته هستند — فرآیند پس‌آموزش با یادگیری تقویتی (RL Post-training) را اجرا کنند، بدون اینکه نیاز به تخصص عمیق در جزئیات سخت‌افزاری GPU داشته باشند. همان‌طور که می‌دانیم، مدل‌های با وزن باز در حالت پیش‌فرض معمولاً از مدل‌های بسته عقب‌تراند، اما یادگیری تقویتی این شکاف را می‌پرد. در وظایف جست‌وجو، مدل‌های متن‌باز پس از آموزش تقویتی می‌توانند با مدل‌های پیشرو برابری کنند یا حتی از آن‌ها پیشی بگیرند، در حالی که هزینه هر درخواست را چندین مرتبه کاهش می‌دهند. این تلاش برای بهینه‌سازی هزینه‌ها یادآور راهکارهای دیگر است، مانند استفاده از مسیریابی پویا برای کاهش هزینه‌های AI بدون افت کیفیت خروجی.

طبق گزارشی که در ۵ آگوست ۲۰۲۶ در سایت neon.com منتشر شد، این سامانه پایگاه دانش فعلی هر شرکت را به یک مجموعه آموزشی تبدیل می‌کند و حلقه RL را مدیریت می‌کند تا مدل یاد بگیرد چگونه از این داده‌ها به‌طور مؤثر استفاده کند. یینگ هنگ سه، هم‌بنیان‌گذار این پروژه، اشاره می‌کند که بهترین داده‌های آموزشی اکثر تیم‌ها در پایگاه‌های داده آن‌ها نهفته است، اما تبدیل داده‌های خام به مجموعه‌های کاربردی و اجازه دادن به عامل‌ها برای تغییر دادن داده‌ها در مقیاس بالا، نیازمand زیرساخت‌های پیشرفته است. ارجاع Castform به Neon هر دو مانع ذکر شده را از بین می‌برد.

الزامات مدل و زمینه‌ی اجرا

یک «عامل خوب» به قدرت در دو حوزه متمایز نیاز دارد. اول «زمینه» (Context): یعنی توانایی فراهم کردن ابزارهای لازم برای یافتن داده‌های درست. دوم «مدل» (Model): یعنی توانایی مدل در تصمیم‌گیری دقیق درباره اینکه دقیقاً چه چیزی را باید جست‌وجو کند. Neon (Lakebase Postgres) و افزونه‌های جست‌وجوی جدیدش مشکل زمینه را حل می‌کنند، در حالی که Castform مسئله تصمیم‌گیری مدل را برطرف می‌سازد.

جزئیات خط لوله فنی

این فرآیند آموزشی از قابلیت‌های Neon برای مدیریت حجم بالای بازیابی داده‌ها استفاده می‌کند. این گردش کار شامل مراحل مشخص زیر است:

  • ذخیره‌سازی پیکره (Corpus Storage): تمامی اسناد خام در Postgres روی Neon قرار می‌گیرند.
  • تولید داده‌های مصنوعی (Synthetic Data Generation): خط لوله آموزشی Castform از lakebase_text و lakebase_vector برای نوشتن وظایف آموزشی استفاده می‌کند.
  • آموزش RL: در هر مرحله از rollout، فراخوانی ابزار جست‌وجو از Lakebase Search در Neon استفاده می‌کند.
  • استنتاج در تولید (Production Inference): مدل نهایی در مرحله استنتاج — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند — از همان ابزار جست‌وجوی Neon استفاده می‌کند.

Comparison of Castform fine-tune and frontier models by inference cost and mean evaluation reward

مکانیسم‌های پس‌آموزش RL

برای کارکرد یادگیری تقویتی، سیستم به سه جزء حیاتی نیاز دارد: یک وظیفه (مثلاً پاسخ به سؤال کاربر)، یک محیط برای اجرای عامل (مثلاً یک ابزار جست‌وجو برای یک پیکره متنی) و یک تابع پاداش (Reward Function) برای تعیین اینکه آیا پاسخ درست است یا خیر. با این‌ها، RL به حلقه‌ای از آزمون و خطا تبدیل می‌شود که در آن مدل تلاش می‌کند وظیفه را انجام دهد، تابع پاداش آن را امتیازدهی می‌کند و سیگنال بازخورد، مدل را برای رسیدن به عملکرد بهینه به سمت «بالا رفتن از تپه» (Hill-climb) هدایت می‌کند.

سازمان‌ها اغلب داده‌های پاک برای این کار ندارند، اما در مقابل، داده‌های اختصاصی گسترده‌ای در اختیار دارند، از جمله:

  • مستندات داخلی و ویکی‌های شرکتی
  • سوابق محصول و مقالات پشتیبانی فنی
  • تاریخچه تعاملات با مشتریان
  • پایگاه‌های داده عملیاتی

Castform این پیکره را به وظایف آموزشی تبدیل می‌کند. برای مثال، اگر در یک سند آمده باشد که رزرو قطارهای Navan باید در کلاس استاندارد و با مهلت ۱۴ روزه انجام شود، Castform حقیقت زمینه‌ای (Ground Truth) را استنباط کرده و سؤالی مصنوعی می‌سازد: «هنگام رزرو سفر ریلی در Navan، قوانین مربوط به زمان رزرو و سطح صندلی مورد انتظار چیست؟»

توابع پاداش و نظارت

تابع پاداش مشخص می‌کند که مدل باید در چه چیزی استاد شود. در این یکپارچه‌سازی، هدف بازیابی تکه‌های (Chunks) درست متن، ارجاع به منابع صحیح و ارائه پاسخ نهایی درست است. این هدف از طریق توابعی مثل run_tool برای جست‌وجوی ترکیبی (Hybrid Search) بر روی Lakebase (که lakebase_text و lakebase_vector را از طریق RRF ادغام می‌کند) و یک تابع reward که صحت ردپای (Trace) مدل را با داده مرجع می‌سنجد، پیاده‌سازی شده است.

Average reward over training steps

Castform امکان نظارت کامل (Observability) بر اجرای RL را فراهم می‌کند. توسعه‌دهندگان می‌توانند رشد پاداش را رصد کنند و برای بررسی کیفی عملکرد مدل، مستقیماً وارد پرامپت‌های مجزا شوند. این قابلیت به تیم‌ها اجازه می‌دهد مشکلاتی مثل سوءاستفاده از پاداش (Reward Hacking) یا ابزارهای معیوب را عیب‌یابی کنند. این تمرکز بر دقت در اجرای ابزارها، شباهت زیادی به تلاش‌ها برای جلوگیری از انحراف عامل‌ها با استفاده از ابزارهایی نظیر goal-anchor دارد تا از خروج عامل از مسیر هدف جلوگیری شود.

زیرساخت و مقیاس‌پذیری

از آنجایی که آموزش RL شامل هزاران rollout موازی است و هر عامل ممکن است ده‌ها فراخوانی انجام دهد، فشار کاری به‌شدت نوسانی (Bursty) است. مقیاس‌دهی پویا در Neon این اوج‌ها را جذب می‌کند بدون اینکه Castform نیاز داشته باشد به‌صورت ۲۴ ساعته برای حداکثر ظرفیت منابع رزرو کند. این موضوع تأخیر کم در زمان اوج مصرف و کاهش مصرف به صفر در زمان‌های بیکاری را تضمین می‌کند.

برای عامل‌های حالت‌دار (Stateful) که داده‌ها را تغییر می‌دهند، قابلیت Branching در Neon حیاتی است. این ویژگی اجازه می‌دهد هر rollout یک وضعیت ایزوله از پایگاه داده داشته باشد تا اقدامات یک عامل بر دیگران یا داده‌های محیط تولید اثر نگذارد. علاوه بر این، پرس‌وجوهای Time-travel امکان بازسازی و بازرسی دقیق وضعیتی را که عامل در یک گام خاص با آن مواجه شده، فراهم می‌کند.

Neon CPU allocation and usage during a Castform training run

این تغییر یعنی سازمان‌ها دیگر مجبور نیستند بین هزینه بالای مدل‌های پیشرو یا دقت پایین مدل‌های متن‌باز ساده یکی را انتخاب کنند. با تبدیل پس‌آموزش به چیزی به سادگی مهندسی پرامپت، توسعه‌دهندگان می‌توانند عامل‌های تخصصی بسازند که سریع‌تر و ارزان‌تر از مدل‌های همه‌منظوره هستند.

برای کسانی که این سیستم را پیاده می‌کنند، دستاورد اصلی توانایی تبدیل یک پایگاه دانش ایستای شرکت به یک مدل رفتاری است که دقیقاً می‌داند چگونه در داده‌های اختصاصی پیمایش کند. توسعه‌دهندگان اکنون می‌توانند این خط لوله‌ها را در سایت castform.com آزمایش کنند تا مشاهده کنند رشد پاداش در طول یک اجرای آموزشی چگونه به‌صورت کیفی رخ می‌دهد.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار مدل‌های با وزن باز و زیرساخت‌های مقیاس‌پذیر Neon، سد هزینه‌ای استقرار عامل‌های هوشمند در مقیاس سازمانی را می‌شکند. اکنون شرکت‌ها می‌توانند بدون وابستگی به APIهای بسته، تفکر استدلالی را روی داده‌های محرمانه خود پیاده کنند.

تأثیر برای ایران

به‌دلیل هزینه‌های بالای ارزی و تحریم‌های API، استفاده از مدل‌های با وزن باز و آموزش آن‌ها روی سرورهای داخلی، تنها مسیر عملی برای استقرار عامل‌های هوشمند در سازمان‌های ایرانی است.

·نگاه ما
تحریریه دات‌هوش

تاکنون تصور می‌شد برای رسیدن به دقت مدل‌های Frontier در وظایف تخصصی، تنها راه تنظیم دقیق (Fine-tuning) گسترده یا پذیرش هزینه‌های بالای API است. اما این همکاری نشان می‌دهد که یادگیری تقویتی روی داده‌های مصنوعی، مدل‌های کوچک را به جایگزینی اقتصادی تبدیل می‌کند که نه تنها ارزان‌ترند، بلکه به دلیل تخصصی شدن روی یک پیکره داده، در محیط عملیاتی پایدارتر عمل می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.