پرش به محتوای اصلی
پرش به محتوای مقاله

روش جدید صفحه‌بندی مشارکتی برای مدیریت سرریز پنجره زمینه در مدل‌های زبانی

·۲۸ فروردین ۱۴۰۵۱ دقیقه مطالعه
روش جدید صفحه‌بندی مشارکتی برای مدیریت سرریز پنجره زمینه در مدل‌های زبانی
اشتراک‌گذاری

پژوهشگران روشی نوین با عنوان «صفحه‌بندی مشارکتی» توسعه داده‌اند تا یکی از چالش‌های همیشگی در مدل‌های زبانی بزرگ را برطرف کنند: مدیریت مکالماتی که از حد پنجره زمینه فراتر می‌روند. هنگامی که گفتگوهای طولانی به حد مجاز نزدیک می‌شوند، مدل‌ها به‌طور سنتی ناچارند محتوای قبلی را حذف یا برید کنند و ممکن است اطلاعات مهمی برای پاسخ‌های دقیق از دست برود.

این رویکرد که در مقاله‌ای در arxiv.org منتشر شده، محتوای حذف‌شده را با نشانک‌های کلمات کلیدی (با نام [pN:keywords]، تقریباً ۸ تا ۲۴ توکن) جایگزین می‌کند و ابزاری به نام recall() برای بازیابی محتوای کامل در اختیار مدل قرار می‌دهد. این سیستم مشارکتی به مدل اجازه می‌دهد اطلاعات قبلی حذف‌شده را صریحاً درخواست کند، به‌جای آنکه با زمینه ناقص کار کند.

در آزمون روی معیار LoCoMo که شامل ۱۰ مکالمه واقعی چندجلسه‌ای با بیش از ۳۰۰ دور است، صفحه‌بندی مشارکتی بالاترین کیفیت پاسخ را در میان شش روش آزمایش‌شده به دست آورد. این روش نسبت به بریدن محتوا، بازیابی BM25، بازیابی بر اساس همپوشانی کلمات، روش پایه ابزار جستجو، و حتی زمینه کامل عملکرد بهتری داشت. آزمایش‌ها روی چهار مدل مختلف شامل GPT-4o-mini، DeepSeek-v3.2، Claude Haiku و GLM-5 انجام شد. نتایج از نظر آماری معنادار بودند (p=0.017، بوت‌استرپ جفتی) و توسط چهار داور مستقل LLM تأیید شدند.

بررسی جامع تغییرات با ۵٬۷۷۶ آزمون کلی (شامل ۳٬۱۷۶ مصنوعی و ۱٬۶۰۰ در LoCoMo) نتایج عملی مهمی آشکار کرد. صفحات با اندازه ثابت با استراتژی fixed_20 به دقت ۹۶.۷ درصد رسیدند، در حالی که صفحات آگاه از محتوا با جابه‌جایی موضوع به ۵۶.۷ درصد سقوط کردند. اثربخشی سیاست حذف داده‌محور بود: روش FIFO روی داده‌های مصنوعی بهترین عملکرد را داشت، در حالی که LFU برای معیار LoCoMo مناسب‌تر بود. دو استراتژی تولید نشانک به ترتیب ۴.۴ و ۸.۷ امتیاز نهایی بهتر از روش اکتشافی پایه به دست آوردند.

یافته قابل‌توجه دیگر درباره تشخیص نشانک است. در حالی که مدل‌ها ۹۶ درصد مواقع تابع recall() را فعال کردند وقتی نشانک‌ها محتوای مرتبط را نشان می‌دادند، تنها ۵۷ درصد مواقع صفحه صحیح را انتخاب کردند وقتی نشانک‌ها تمایز کافی نداشتند. اختصاصی بودن کلمات کلیدی به‌تنهایی ۲۵ درصد تفاوت در دقت بازیابی ایجاد کرد.

این پژوهش چارچوبی عملی برای ساخت سیستم‌های مکالمه‌ای فراهم می‌کند که انسجام را در تعاملات طولانی حفظ می‌کنند بدون آنکه به اندازه‌های پنجره زمینه غیرواقعی نیاز داشته باشند. یافته‌ها نشان می‌دهد کیفیت ابرداده‌ها — نه فقط الگوریتم‌های بازیابی — نقش حیاتی در مدیریت مؤثر حافظه مدل‌های زبانی ایفا می‌کند.

·نگاه ما
تحریریه دات‌هوش

این پژوهش توجه جامعه هوش مصنوعی فارسی‌زبان را به خود جلب کرده است. راهکار صفحه‌بندی مشارکتی می‌تواند تحولی در توسعه چت‌بات‌ها و دستیارهای مجازی ایجاد کند، به‌ویژه برای کاربردهایی که به مکالمات بلندمدت نیاز دارند. با وجود این، نیاز به بهبود دقت انتخاب صفحه در مدل‌ها همچنان یک چالش باقی مانده و توسعه‌دهندگان داخلی باید بر دقت طراحی نشانک‌ها تمرکز کنند. انتظار می‌رود این تحقیق الهام‌بخش پروژه‌های مشابه در اکوسیستم فارسی باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.