تصور کنید برای هر درخواست جستوجوی پیچیده در یک سامانه عاملمحور، با استفاده از مدلی مثل gpt-5.6-sol، حدود ۰.۰۳ دلار هزینه بپردازید و تأخیری (Latency) بیش از ۱۰ ثانیه را تحمل کنید. این نقطه قیمتی برای مقیاسبندی در سطح سازمانی مطلقاً prohibitively expensive (بازدارنده) است و دقیقاً دلیل پیدایش همکاری Castform و Neon برای انتقال بازیابی عاملمحور از APIهای بسته به مدلهای بهینه شده با وزن باز (Open-weights) است. این رویکرد در راستای تغییر کلی صنعت است، جایی که بحث بر سر تغییر معیار هزینه از توکن به وظیفه موفق در حال شکلگیری است تا مدلهای اقتصادیتری برای سازمانها تعریف شود.
در سال ۲۰۲۲، صنعت بر جستوجوی ساده با بردار معنایی (Embedding) متکی بود — جایی که هر ارائهدهندهای این قابلیت را اضافه میکرد و pgvector به پردانلودترین افزونه Neon تبدیل شد. اما طبق گزارشها، چشمانداز تا سال ۲۰۲۵ به سمت «بازیابی عاملمحور» (Agentic Retrieval) تغییر کرد. در این مدل، مهندسان از خط لولههای ساده تولید بازیابیافزا (RAG) دستساز و جستوجوهای تکمرحلهای (One-shot) فاصله گرفتند. در عوض، عاملها مسائل بزرگ را به قطعات کوچکتر تجزیه و برنامهریزی میکنند و در یک حلقه تکرار شونده، چندین بار جستوجو را انجام میدهند. هر بار تکرار این حلقه، یک فراخوانی به مدلهای پیشرو (Frontier Models) را تحریک میکند که هزینه و تأخیر را برای هر کاربر بهشدت بالا میبرد.

به همین دلیل، Castform به توسعهدهندگان اجازه میدهد تا روی مدلهای زبانی کوچک و با وزن باز — که ۱۰۰ برابر ارزانتر از APIهای بسته هستند — فرآیند پسآموزش با یادگیری تقویتی (RL Post-training) را اجرا کنند، بدون اینکه نیاز به تخصص عمیق در جزئیات سختافزاری GPU داشته باشند. همانطور که میدانیم، مدلهای با وزن باز در حالت پیشفرض معمولاً از مدلهای بسته عقبتراند، اما یادگیری تقویتی این شکاف را میپرد. در وظایف جستوجو، مدلهای متنباز پس از آموزش تقویتی میتوانند با مدلهای پیشرو برابری کنند یا حتی از آنها پیشی بگیرند، در حالی که هزینه هر درخواست را چندین مرتبه کاهش میدهند. این تلاش برای بهینهسازی هزینهها یادآور راهکارهای دیگر است، مانند استفاده از مسیریابی پویا برای کاهش هزینههای AI بدون افت کیفیت خروجی.
طبق گزارشی که در ۵ آگوست ۲۰۲۶ در سایت neon.com منتشر شد، این سامانه پایگاه دانش فعلی هر شرکت را به یک مجموعه آموزشی تبدیل میکند و حلقه RL را مدیریت میکند تا مدل یاد بگیرد چگونه از این دادهها بهطور مؤثر استفاده کند. یینگ هنگ سه، همبنیانگذار این پروژه، اشاره میکند که بهترین دادههای آموزشی اکثر تیمها در پایگاههای داده آنها نهفته است، اما تبدیل دادههای خام به مجموعههای کاربردی و اجازه دادن به عاملها برای تغییر دادن دادهها در مقیاس بالا، نیازمand زیرساختهای پیشرفته است. ارجاع Castform به Neon هر دو مانع ذکر شده را از بین میبرد.
الزامات مدل و زمینهی اجرا
یک «عامل خوب» به قدرت در دو حوزه متمایز نیاز دارد. اول «زمینه» (Context): یعنی توانایی فراهم کردن ابزارهای لازم برای یافتن دادههای درست. دوم «مدل» (Model): یعنی توانایی مدل در تصمیمگیری دقیق درباره اینکه دقیقاً چه چیزی را باید جستوجو کند. Neon (Lakebase Postgres) و افزونههای جستوجوی جدیدش مشکل زمینه را حل میکنند، در حالی که Castform مسئله تصمیمگیری مدل را برطرف میسازد.
جزئیات خط لوله فنی
این فرآیند آموزشی از قابلیتهای Neon برای مدیریت حجم بالای بازیابی دادهها استفاده میکند. این گردش کار شامل مراحل مشخص زیر است:
- ذخیرهسازی پیکره (Corpus Storage): تمامی اسناد خام در Postgres روی Neon قرار میگیرند.
- تولید دادههای مصنوعی (Synthetic Data Generation): خط لوله آموزشی Castform از
lakebase_textوlakebase_vectorبرای نوشتن وظایف آموزشی استفاده میکند. - آموزش RL: در هر مرحله از rollout، فراخوانی ابزار جستوجو از Lakebase Search در Neon استفاده میکند.
- استنتاج در تولید (Production Inference): مدل نهایی در مرحله استنتاج — یعنی لحظهای که مدل واقعاً جواب تولید میکند — از همان ابزار جستوجوی Neon استفاده میکند.

مکانیسمهای پسآموزش RL
برای کارکرد یادگیری تقویتی، سیستم به سه جزء حیاتی نیاز دارد: یک وظیفه (مثلاً پاسخ به سؤال کاربر)، یک محیط برای اجرای عامل (مثلاً یک ابزار جستوجو برای یک پیکره متنی) و یک تابع پاداش (Reward Function) برای تعیین اینکه آیا پاسخ درست است یا خیر. با اینها، RL به حلقهای از آزمون و خطا تبدیل میشود که در آن مدل تلاش میکند وظیفه را انجام دهد، تابع پاداش آن را امتیازدهی میکند و سیگنال بازخورد، مدل را برای رسیدن به عملکرد بهینه به سمت «بالا رفتن از تپه» (Hill-climb) هدایت میکند.
سازمانها اغلب دادههای پاک برای این کار ندارند، اما در مقابل، دادههای اختصاصی گستردهای در اختیار دارند، از جمله:
- مستندات داخلی و ویکیهای شرکتی
- سوابق محصول و مقالات پشتیبانی فنی
- تاریخچه تعاملات با مشتریان
- پایگاههای داده عملیاتی
Castform این پیکره را به وظایف آموزشی تبدیل میکند. برای مثال، اگر در یک سند آمده باشد که رزرو قطارهای Navan باید در کلاس استاندارد و با مهلت ۱۴ روزه انجام شود، Castform حقیقت زمینهای (Ground Truth) را استنباط کرده و سؤالی مصنوعی میسازد: «هنگام رزرو سفر ریلی در Navan، قوانین مربوط به زمان رزرو و سطح صندلی مورد انتظار چیست؟»
توابع پاداش و نظارت
تابع پاداش مشخص میکند که مدل باید در چه چیزی استاد شود. در این یکپارچهسازی، هدف بازیابی تکههای (Chunks) درست متن، ارجاع به منابع صحیح و ارائه پاسخ نهایی درست است. این هدف از طریق توابعی مثل run_tool برای جستوجوی ترکیبی (Hybrid Search) بر روی Lakebase (که lakebase_text و lakebase_vector را از طریق RRF ادغام میکند) و یک تابع reward که صحت ردپای (Trace) مدل را با داده مرجع میسنجد، پیادهسازی شده است.

Castform امکان نظارت کامل (Observability) بر اجرای RL را فراهم میکند. توسعهدهندگان میتوانند رشد پاداش را رصد کنند و برای بررسی کیفی عملکرد مدل، مستقیماً وارد پرامپتهای مجزا شوند. این قابلیت به تیمها اجازه میدهد مشکلاتی مثل سوءاستفاده از پاداش (Reward Hacking) یا ابزارهای معیوب را عیبیابی کنند. این تمرکز بر دقت در اجرای ابزارها، شباهت زیادی به تلاشها برای جلوگیری از انحراف عاملها با استفاده از ابزارهایی نظیر goal-anchor دارد تا از خروج عامل از مسیر هدف جلوگیری شود.
زیرساخت و مقیاسپذیری
از آنجایی که آموزش RL شامل هزاران rollout موازی است و هر عامل ممکن است دهها فراخوانی انجام دهد، فشار کاری بهشدت نوسانی (Bursty) است. مقیاسدهی پویا در Neon این اوجها را جذب میکند بدون اینکه Castform نیاز داشته باشد بهصورت ۲۴ ساعته برای حداکثر ظرفیت منابع رزرو کند. این موضوع تأخیر کم در زمان اوج مصرف و کاهش مصرف به صفر در زمانهای بیکاری را تضمین میکند.
برای عاملهای حالتدار (Stateful) که دادهها را تغییر میدهند، قابلیت Branching در Neon حیاتی است. این ویژگی اجازه میدهد هر rollout یک وضعیت ایزوله از پایگاه داده داشته باشد تا اقدامات یک عامل بر دیگران یا دادههای محیط تولید اثر نگذارد. علاوه بر این، پرسوجوهای Time-travel امکان بازسازی و بازرسی دقیق وضعیتی را که عامل در یک گام خاص با آن مواجه شده، فراهم میکند.

این تغییر یعنی سازمانها دیگر مجبور نیستند بین هزینه بالای مدلهای پیشرو یا دقت پایین مدلهای متنباز ساده یکی را انتخاب کنند. با تبدیل پسآموزش به چیزی به سادگی مهندسی پرامپت، توسعهدهندگان میتوانند عاملهای تخصصی بسازند که سریعتر و ارزانتر از مدلهای همهمنظوره هستند.
برای کسانی که این سیستم را پیاده میکنند، دستاورد اصلی توانایی تبدیل یک پایگاه دانش ایستای شرکت به یک مدل رفتاری است که دقیقاً میداند چگونه در دادههای اختصاصی پیمایش کند. توسعهدهندگان اکنون میتوانند این خط لولهها را در سایت castform.com آزمایش کنند تا مشاهده کنند رشد پاداش در طول یک اجرای آموزشی چگونه بهصورت کیفی رخ میدهد.




گفتگو