پرش به محتوای اصلی
پرش به محتوای مقاله

تحقیق جدید: فشرده‌سازی بافت کاهش می‌دهد توهمات عامل‌های هوش مصنوعی را

·۵ مرداد ۱۴۰۵۸ دقیقه مطالعه
راهنما
عامل هوشمند با فشرده‌سازی زمینه: کاهش توهمات با حفظ ظرافت‌ها
عامل هوشمند با فشرده‌سازی زمینه: کاهش توهمات با حفظ ظرافت‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی استراتژی «پنجره متنی بزرگ‌تر» با «سیگنال فیلترشده»؛ استفاده از مدل‌های حفاظ (Guardrail) کوچک برای تأیید صحت خروجی‌های مدل‌های بزرگ.

تصور کنید یک دستیار هوشمند را با هزاران صفحه مستندات بمباران می‌کنید؛ نتیجه‌ای که می‌گیرید احتمالاً پاسخی پراکنده است که جزئیات حیاتی را فراموش کرده است. حقیقت تلخ این است که در بسیاری از سیستم‌های فعلی، هرچه اطلاعات بیشتری به مدل بدهید، احتمال بروز توهم (Hallucination) — شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — بیشتر می‌شود. این پارادوکس عامل‌های هوشمند نشان می‌دهد که تغذیه مدل‌ها با هزاران توکن از داده‌های بازیابی‌شده، اغلب منجر به کاهش قابلیت اطمینان می‌شود.

طبق یک راهنمای فنی که در ۲۷ ژوئیه ۲۰۲۶ توسط tamiz.pro منتشر شد، پدیده‌ای به نام «گم‌شده در میانه» (Lost in the Middle) باعث می‌شود مدل‌ها روی نویزهای بی‌ربط تمرکز کنند یا واقعیت‌های مجزا را با هم ترکیب کنند و این امر مستقیماً نرخ توهمات را افزایش می‌دهد. این شکاف قابلیت اطمینان، بزرگ‌ترین مانع برای استقرار سیستم‌های تولید بازیابی‌افزا (RAG) — مثل دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — در مقیاس صنعتی است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، مشکل اصلی این نیست که پنجرهٔ زمینه (Context Window) — یعنی میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — کوچک است؛ بلکه مشکل در نسبت سیگنال به نویز است. در حالی که توسعه‌دهندگان اغلب تصور می‌کنند پنجره‌های زمینه‌ی بزرگ‌تر مشکل را حل می‌کنند، مکانیسم توجه (Attention) در مدل‌های مبتنی بر ترنسفورمر زمانی که نسبت سیگنال به نویز افت می‌کند، دچار مشکل می‌شود. وقتی شباهت معنایی در جست‌وجوهای برداری با نیاز واقعی کاربر هم‌راستا نباشد، مدل مجبور می‌شود روی پیش‌فرض‌های متناقض یا قدیمی استدلال کند.

برای حل این مشکل، مهندسان اکنون فشرده‌سازی بستر متن را در سه لایه مجزا اجرا می‌کنند: بازیابی، پردازش و مهندسی پرامپت. هدف این است که تراکم معنایی کاهش یابد بدون اینکه اطلاعات باکیفیت و دقیق از دست بروند.

لایه اول: هرس برداری و بازرتبه‌بندی

استفاده از شباهت کسینوسی (Cosine Similarity) ساده روی بردارهای معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی کلمات را می‌گوید — برای پرس‌وجوهای پیچیده کافی نیست. در واقع، این محدودیت‌ها توضیح می‌دهند که چرا جست‌وجوی برداری خالص در محیط‌های صنعتی با داده‌های پیچیده شکست می‌خورد. به نقل از مستندات فنی، توسعه‌دهندگان برای رفع این نقص از یک فرآیند بازیابی دو مرحله‌ای استفاده می‌کنند:

  • بازیابی اولیه: یک مدل سریع bi-encoder مانند text-embedding-3-small، ۵۰ تا ۱۰۰ تکه متن برتر را بازیابی می‌کند.
  • بازرتبه‌بندی (Re-ranking): یک مدل با هزینه محاسباتی بیشتر، مانند BGE-Reranker-v2-m3 یا API بازرتبه‌بندی شرکت Cohere، پرس‌وجو و سند را با هم پردازش می‌کند تا تعاملات ریزدانه (Fine-grained) را شناسایی کند.

با انتخاب تنها ۵ تا ۱۰ نتیجه نهایی پس از بازرتبه‌بندی، پنجره متنی فقط با تکه‌هایی پر می‌شود که بیشترین تقاطع معنایی را با قصد کاربر دارند.

لایه دوم: زنجیره خلاصه‌سازی

در مواجهه با پایگاه‌های دانش عظیم، بازیابی ساده شکست می‌خورد. خلاصه‌سازی بازگشتی به عامل‌ها اجازه می‌دهد داده‌ها را به یک روایت موجز تبدیل کنند؛ این کار با شکستن اسناد به تکه‌های کوچک‌تر و خلاصه‌سازی متوالی آن‌ها انجام می‌شود.

در این فرآیند، مدل یک «خلاصه قبلی» را به عنوان زمینه برای تکه بعدی نگه می‌دارد. این مکانیسم تضمین می‌کند که خروجی نهایی یک روایت متصل باشد، نه مجموعه‌ای از تکه‌های پراکنده و ایزوله، و بدین ترتیب ظرافت‌های معنایی در تاریخچه‌های طولانی حفظ شود.

لایه سوم: گسترش پرس‌وجو

بسیاری از توهمات نه از زیاد بودن نویز، بلکه از کم بودن زمینه مرتبط می‌آیند. تکنیک «پرامپت عقب‌گرد» (Step-back prompting) این مشکل را حل می‌کند؛ در این روش، ابتدا از مدل زبانی (LLM) خواسته می‌شود تا یک نسخه کلی و انتزاعی از پرس‌وجوی کاربر تولید کند.

با بازیابی هم‌زمان زمینه‌های مفهومی کلی و واقعیت‌های خاص، عامل می‌تواند در مرحله نهایی تولید، جزئیات بی‌ربط را بسیار بهتر فیلتر کند.

حافظه پیشرفته و ساختاریافته

برای حافظه بلندمدت عامل، فشرده‌سازی استاتیک کافی نیست. مهندسان اکنون از حافظه «آگاه به اهمیت» بر اساس سه معیار کلیدی استفاده می‌کنند:

۱. تازگی (Recency): اولویت دادن به آخرین تعاملات.
۲. تکرار (Frequency): ردیابی تعداد دفعاتی که یک مفهوم مورد اشاره قرار گرفته است.
۳. غافلگیری (Surprise): شناسایی اطلاعاتی که به‌طور قابل‌توجهی با زمینه موجود متفاوت است.

هم‌چنین تبدیل متن خام به فرمت‌های ساختاریافته مانند JSON یا XML، با حذف کلمات پرکننده و حشوهای محاوره‌ای، تعداد توکن‌ها (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی — را کاهش می‌دهد. برای مثال، یک پاراگراف که پیشینه شغلی کاربر را توصیف می‌کند، به یک طرحواره (Schema) فشرده تبدیل می‌شود که تنها شامل نام، نقش و مکان است.

کنترل‌های تولید و حفاظ‌ها

فشرده‌سازی باید با محدودیت‌های سخت‌گیرانه تولید همراه شود تا توهمات به‌طور کامل حذف شوند. راهنمای مذکور توصیه می‌کند از «تولید مبتنی بر استناد» استفاده شود؛ به این معنا که مدل برای هر ادعایی باید یک شناسه (ID) منبع خاص را ذکر کند یا در صورت عدم دسترسی به اطلاعات، اعتراف کند که پاسخ را نمی‌داند.

برای کارهای با ریسک بالا، «مدل‌های حفاظ» (Guardrail Models) به کار گرفته می‌شوند. این‌ها مدل‌های زبانی کوچک‌تری هستند که پاسخ نهایی را با زمینه فشرده‌شده چک می‌کنند تا از ثبات واقعیات مطمئن شوند. اگر مدل حفاظ تناقضی را شناسایی کند، پاسخ رد می‌شود.

موازنه‌های مهندسی

پیاده‌سازی این روش‌ها نیاز به تعادل بین تأخیر (Latency) و هزینه دارد. هرس برداری تأخیر کم و هزینه پایینی دارد و دقت را حفظ می‌کند. در مقابل، مدل‌های حفاظ و خلاصه‌سازی بازگشتی، هم تأخیر و هم هزینه را به‌شدت افزایش می‌دهند.

بر اساس گزارش tamiz.pro، مؤثرترین مسیر، شروع با بهینه‌سازی بازیابی است. مدل‌های برداری بهتر اغلب نیاز به تکنیک‌های فشرده‌سازی تهاجمی و پرهزینه را کاهش می‌دهند.

این تغییر رویکرد، فرض بنیادی مهندسی AI را عوض می‌کند: تمرکز از «بزرگ‌تر کردن مدل» به سمت «مدیریت پویا و هوشمند زمینه» می‌رود. تفاوت سیستم‌های صنعتی با نمونه‌های ساده در این است که زمینه را نه یک بلوک متنی ایستا، بلکه یک سیگنال فیلترشده می‌بینند.

برای تأیید این سیستم‌ها، مهندسان باید از مجموعه‌داده‌های مرجع (Gold-standard datasets) برای اندازه‌گیری نرخ توهم قبل و بعد از پیاده‌سازی فشرده‌سازی استفاده کنند. در مسیرهای حساس، حضور انسان برای تأیید زمینه فشرده‌شده و تنظیم دقیق الگوریتم‌ها همچنان ضروری است.

باید منتظر ظهور «لایه‌های فشرده‌سازی» بومی در معماری‌های LLM بود که می‌توانند این فرآیندهای هرس را بدون نیاز به خط لوله‌های خارجی، به‌طور خودکار انجام دهند.

برای تأیید این سیستم‌ها، مهندسان باید از مجموعه‌داده‌های مرجع (Gold-standard datasets) برای اندازه‌گیری نرخ توهم قبل و بعد از پیاده‌سازی فشرده‌سازی استفاده کنند. در مسیرهای حساس، حضور انسان برای تأیید زمینه فشرده‌شده و تنظیم دقیق الگوریتم‌ها همچنان ضروری است.

باید منتظر ظهور «لایه‌های فشرده‌سازی» بومی در معماری‌های LLM بود که می‌توانند این فرآیندهای هرس را بدون نیاز به خط لوله‌های خارجی، به‌طور خودکار انجام دهند.

گام بعدی شما

  • اگر از RAG استفاده می‌کنید، به‌جای افزایش پنجره متنی، یک لایه بازرتبه‌بندی (Re-ranking) به خط لوله خود اضافه کنید.
  • برای کاهش توهم، مدل را مجبور کنید برای هر ادعا یک ID منبع از متون بازیابی‌شده ذکر کند.
  • داده‌های تکراری را با تبدیل به فرمت JSON در حافظه عامل فشرده کنید تا هزینه استنتاج (Inference) کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی باعث می‌شود عامل‌های AI در محیط‌های عملیاتی (Production) قابل اعتماد شوند و هزینه‌های پردازشی کاهش یابد. اعتبار این روش از طریق کاهش نرخ توهم در بنچمارک‌های صنعتی تأیید شده است.

تأثیر برای ایران

این تکنیک‌ها برای توسعه‌دهندگان ایرانی که با محدودیت GPU و هزینه بالای توکن‌ها در APIها مواجه‌اند، راهکاری حیاتی برای کاهش هزینه‌های استنتاج و افزایش دقت عامل‌هاست.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از افزایش حجم حافظه به سمت مدیریت کیفیت سیگنال تغییر کرده است. این رویکرد نشان می‌دهد که «بیشتر» لزوماً «بهتر» نیست و هنر مهندسی AI اکنون در حذف هوشمندانه داده‌هاست تا مدل بتواند روی هسته معنایی متمرکز شود. در واقع، فشرده‌سازی زمینه، جایگزینی برای مدل‌های کوچک‌تر و سریع‌تر است که تخصص را بدون از دست دادن دقت حفظ می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.