تصور کنید سیستمی را مدیریت میکنید که در روز اول عرضه، یخ زده است؛ مدل بردار معنایی یکبار آموزش دیده و فرمول رتبهبندی یکبار نوشته شده است. این اتکا به توابع رتبهبندی ایستا در خطلولههای تولید بازیابیافزا (RAG) — شبیه دانشآموزی است که فقط یکبار کتاب را خوانده و هرگز از اشتباهاتش در امتحان درس نمیگیرد — یک گلوگاه پنهان ایجاد میکند. در چنین سیستمی، مدل جاسازی (Embedding) و فرمول رتبهبندی در لحظه استقرار ثابت میمانند و دیگر تغییر نمیکنند.
به همین دلیل، هر پرسوجو بدون توجه به اینکه کاربر نتایج را مفید یافته یا کاملاً نادیده گرفته است، به یک شکل امتیازدهی میشود. همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی استنتاج اشاره کردیم، حذف این نقاط کور میتواند کارایی سیستم را بهشدت افزایش دهد. در واقع، سیستمهای ایستا نمیتوانند تشخیص دهند که آیا نتایج ارائه شده واقعاً نیاز کاربر را برطرف کردهاند یا خیر. این چالش با رویکردهای شناختی مانند معماری ACT-R برای اصلاح نتایج قدیمی و تکراری نیز مورد بررسی قرار گرفته است تا دقت بازیابی بهبود یابد.
این نقص طراحی، معدنی از پاداشهای ضمنی را نادیده میگیرد. هر بار که کاربر روی نتیجهای کلیک میکند، تکهای از متن را نادیده میگیرد یا سؤال خود را بازنویسی میکند، در واقع در حال تولید دادههای آموزشی است. به نقل از راهنمای منتشر شده در ۲۶ سپتامبر ۲۰۲۶ در وبسایت dev.to، یک سامانه تطبیقی این سیگنالهای رفتاری را به عنوان یک حلقه برای تنظیم سیاستهای رتبهبندی و افزایش پاداشهای مورد انتظار در نظر میگیرد.
حلقه بازخورد
یک سامانه بازیابی هر بار که با بازگرداندن مجموعهای از نتایج رتبهبندیشده به پرسوجویی پاسخ میدهد، یک «اکشن» انجام میدهد و سپس نتیجه را مشاهده میکند. در این مرحله، سیستم باید به سوالات کلیدی پاسخ دهد: آیا مدل واقعاً از متن بازیابیشده در پاسخ نهایی خود استفاده کرد؟ آیا کاربر از روی اولین نتیجه عبور کرد و به سراغ نتایج پایینتر رفت؟
یک سامانه تطبیقی یک حلقه مداوم را اجرا میکند: ابتدا نتایج را با سیاست فعلی ارائه میدهد، سپس نتیجه را مشاهده میکند، آن نتیجه را به یک پاداش (Reward) تبدیل میکند و در نهایت رتبهبندی را بهگونهای تغییر میدهد که پاداش مورد انتظار در مرتبه بعد افزایش یابد. این فرآیند باعث میشود سیستم بهمرور زمان یاد بگیرد چه نوع نتایجی برای چه نوع پرسوجوهایی مفیدتر هستند.
طراحی توابع پاداش
طراحی این توابع دشوار است زیرا سیگنالهای کاربر اغلب نویزدار، با تأخیر و مبهم هستند. برای مثال، ممکن است کاربر روی نتیجهای کلیک نکند چون تکه متن در همان نگاه اول (در پیشنمایش) پاسخ را داده است، یا ممکن است صرفاً چون موضوع بحثش تغییر کرده، پرسوجو را بازنویسی کند، نه به این دلیل که نتایج قبلی بد بودهاند.
بر اساس مستندات این راهنما، استفاده از پاداشهای ترکیبی بهجای سیگنالهای تکگانه توصیه میشود. سیگنالهای تکگانه بهراحتی قابل فریب یا دستکاری (Game) هستند:
- نرخ کلیک (CTR): این معیار باعث پاداش دادن به محتواهای «کلیکبیت» میشود که شاید جذاب باشند اما پاسخ دقیقی ندهند.
- زمان توقف (Dwell Time): این معیار محتواهای طولانی را بدون توجه به کیفیت یا مفید بودن پاداش میدهد، چون کاربر زمان بیشتری را صرف خواندن آنها میکند.
- نرخ بازنویسی: اگر سیستم فقط به بازنویسی واکنش نشان دهد، ممکن است تلاش کاربر برای اکتشاف در نتایج را به اشتباه به عنوان شکست سیستم تنبیه کند.
پاداشهای ترکیبی که چندین سیگنال را با هم وزندهی میکنند، بسیار پایدارترند. قویترین سیگنال از همه، «تکمیل تکلیف» (Task Completion) است؛ مثلاً وقتی یک باگ نرمافزاری واقعاً رفع شود یا یک تیکت پشتیبانی توسط کاربر بسته شود، این یعنی سیستم بازیابی دقیقاً آنچه لازم بود را فراهم کرده است.
پیادهسازی رتبهبندی تطبیقی
توسعهدهندگان برای شروع نیازی به یک زیرساخت کامل و پیچیده یادگیری تقویتی عمیق (Deep RL) ندارند. این راهنما چندین مکانیزم سبکوزن را پیشنهاد میکند که از هوش مصنوعی بازیها و رباتیک وام گرفته شدهاند:
- Multi-armed Bandits: اینها تعادلی بین بهرهبرداری (Exploiting) از بهترین رتبهبندی شناختهشده و اکتشاف (Exploring) جایگزینها ایجاد میکنند. استراتژیهای epsilon-greedy نسخههای تغییریافته را در درصد کمی از دفعات ارائه میدهند، در حالی که نمونهگیری تامپسون (Thompson sampling) استراتژیها را متناسب با میزان عدم قطعیت کیفیتشان بررسی میکند.
- Contextual Bandits: این مدل یک گام فراتر رفته و استراتژیهای متفاوتی را بر اساس نوع خاص پرسوجو یا پروفایل کاربر یاد میگیرند تا شخصیسازی دقیقتری ارائه دهند.
- Experience Replay: این روش که از عاملهای بازیساز وام گرفته شده، مجموعهای از تاپلهای شامل پرسوجوها، نتایج ارائه شده و رفتار کاربر را ذخیره میکند تا بهصورت دستهای (Batch) پردازش شوند. این کار یادگیری را از سرویسدهی زنده جدا میکند تا تأخیر (Latency) ایجاد نشود و نویز موجود در تعاملات فردی میانگینگیری شود.
بیشتر سامانههای عملیاتی از یک رویکرد ترکیبی سود میبرند: یک لایه آنلاین سریع برای تغییرات فوری و یک لایه دستهای کندتر برای تغییرات بنیادی در فرمولهای رتبهبندی.
حفاظهای عملیاتی
یادگیری از چند اتفاق تصادفی یا همبستگیهای کاذب میتواند منجر به رفتار نامنظم و غیرقابل پیشبینی سیستم شود. برای جلوگیری از این موضوع، مفهوم Evidence Gating معرفی شده است؛ این مکانیزم تا زمانی که یک الگو در چندین تعامل مستقل ظاهر نشود، اجازه تغییر سیاست رتبهبندی را نمیدهد. برای مثال، اگر یک حافظه فقط یکبار کمک کند، ممکن است شانس باشد، اما اگر در ۱۰ پرسوجو از ۵ کاربر مختلف مفید باشد، این یک «شاهد» معتبر است.
سایر حفاظهای ضروری عبارتاند از:
- پایههای راهاندازی سرد (Cold Start Baselines): شروع کاربران و محتواهای جدید با یک پایه قوی (مانند ترکیب شباهت معنایی بهعلاوه تازگی محتوا) تا اولین تعامل شبیه به پرتاب سکه نباشد.
- برگشتپذیری: تغییرات رتبهبندی باید بهصورت تدریجی اعمال شوند و قابلیت بازگشت سریع به حالت قبلی را داشته باشند.
- ردیابی معیارها: ثبت هر تغییر سیاست به همراه شاهد (Evidence) پشت آن و ردیابی معیارهایی مانند Mean Reciprocal Rank (MRR) و Recall@k برای امکان بازگشت (Rollback) در صورت افت کیفیت.
این چرخش، بازیابی را از یک ابزار ایستا به یک جزء زنده از پشتهی هوش مصنوعی تبدیل میکند. برای توسعهدهنده، این یعنی سیستم از یک جعبه سیاه که نیاز به تنظیم دستی و مداوم دارد، به یک دارایی خودبهینهساز تبدیل میشود.
گام بعدی شما
اگر یک سیستم RAG عملیاتی را مدیریت میکنید، گام بعدی این است که لاگهای سیستم خود را برای یافتن سیگنالهای پاداش ضمنی (مانند بازنویسی پرسوجو یا کلیک) بررسی کنید. شناسایی کنید کدام اقدامات کاربر بیشترین همبستگی را با «تکمیل تکلیف» (مثلاً بستن تیکت) دارند و سپس یک حلقه بازخورد ساده بر پایه Multi-armed Bandits را روی بخش کوچکی از ترافیک تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو