پرش به محتوای اصلی
پرش به محتوای مقاله

مدل جدید Perplexity بازیابی اطلاعات در RAG را از تکه‌بندی ساده به درک زمینه‌ای

·۹ مهر ۱۴۰۵۵ دقیقه مطالعه
معرفی مدل جاسازی متنی پی‌پلکسیتی برای بازیابی پاسخ و شواهد مرتبط
معرفی مدل جاسازی متنی پی‌پلکسیتی برای بازیابی پاسخ و شواهد مرتبط
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی رویکرد binary (طلایی/غیرطلایی) در آموزش بردارها با یک مدل معلم که توزیع ارتباط هر توکن را محاسبه می‌کند؛ این یعنی مدل حالا می‌فهمد که «شواهد پشتیبان» هم به اندازه «پاسخ نهایی» ارزشمند هستند.

اگر از سیستم‌های بازیابی اطلاعات استفاده می‌کنید، احتمالاً با این واقعیت تلخ رو‌به‌رو شده‌اید که مدل‌ها گاهی پاسخ درست را می‌بینند اما به‌دلیل نبودِ زمینه، نمی‌توانند آن را تأیید کنند. این شکاف میان «یافتن پاسخ» و «درک دلیل پاسخ»، بزرگ‌ترین مانع در مسیر استقرار صنعتی هوش مصنوعی زاینده است. چشم‌انداز تولید بازیابی‌افزا (RAG) در حال تغییر از تطبیق ساده‌ی کلمات کلیدی یا تطبیق معنایی به سمت درک عمیق‌تر از ساختار سند و وابستگی‌های زمینه‌ای است.

Perplexity Research در همکاری با turbopuffer، مدل pplx-embed-v2-context-9b-preview را برای حل این مشکل عرضه کرد. این مدل بردار معنایی (Embedding) زمینه‌ای است که به‌جای تمرکز بر تکه‌های مجزای متن، بر بازیابی هم‌زمان پاسخ و شواهد پشتیبان تمرکز می‌کند. هدف این مدل، عبور از محدودیت‌های آموزش‌های سنتی «گذرگاه طلایی» (gold passage) و حرکت به سمت سیستمی است که اولویت را به بازیابی هم‌زمان پاسخ و شواهد لازم برای تأیید آن پاسخ می‌دهد.

برای درک اهمیت این اتفاق، باید به نقص‌های ذاتی معماری‌های فعلی تولید بازیابی‌افزا (RAG) نگاه کنیم. طبق مستندات فنی این پروژه، اکثر سیستم‌ها اسناد طولانی را به تکه‌های کوچک و مجزا تقسیم می‌کنند. در حالی که این کار اجازه می‌دهد ایندکس‌گذاری به‌صورت بهینه انجام شود، اما یک «خلاء زمینه‌ای» ایجاد می‌کند. یک تکه خاص ممکن است حاوی پاسخ حیاتی باشد، اما آن پاسخ ممکن است به تعریفی، یک سرخط یا موجودیتی وابسته باشد که چندین پاراگراف قبل معرفی شده است. وقتی این تکه‌ها به‌طور مستقل بردارسازی (Embed) می‌شوند، پیوند معنایی با سند گسترده‌تر از بین می‌رود. اگرچه روش «تکه‌بندی دیرهنگام» (late chunking) — که در آن سند در یک گذر رمزگذاری شده و سپس تجمیع می‌شود — سعی کرده این مشکل را حل کند، اما متدولوژی آموزش همچنان ایستا مانده است.

در مدل‌های سنتی، آموزش بر اساس برچسب‌های دوتایی (مثبت/منفی) است: یک تکه «طلایی» مثبت و هر تکه دیگر منفی برچسب می‌خورند. این رویکرد به‌شدت مشکل‌ساز است زیرا تکه‌هایی که حاوی شواهد پشتیبان ضروری هستند را جریمه می‌کند و در واقع به مدل می‌گوید زمینه‌ای که برای تأیید پاسخ لازم است، نامرتبط است.

به نقل از تیم پژوهشی Perplexity، مدل جدید این پارادایم را با تغییر سیگنال آموزش مختل کرده است. به‌جای تقسیم‌بندی دوتایی مثبت/منفی، این مدل از یک «مدل معلم» استفاده می‌کند که در واقع یک مدل فشرده‌ساز زمینه و آگاه از پرس‌وجو (query-aware) است. این معلم، پرس‌وجو و سند را به‌طور هم‌زمان می‌خواند و به هر توکن بر اساس میزان ارتباطش امتیاز می‌دهد. سپس ارتباط یک تکه (chunk) به‌عنوان میانگین امتیازات n توکن برتر در آن بخش خاص محاسبه می‌شود. این فرآیند یک «هدف نرم» (soft target) با استفاده از softmax مقیاس‌بندی شده با دما (temperature-scaled) روی تمام تکه‌های موجود در یک سند مثبت ایجاد می‌کند.

در نتیجه، مدل یاد می‌گیرد که توزیع ارتباطات را بفهمد و تشخیص دهد که چندین تکه از یک سند ممکن است برای پاسخ کامل به یک سؤال ضروری باشند. این فرآیند تقطیر (distillation)، که توسط واگرایی KL پیشرو (forward KL divergence) بین توزیع‌های معلم و شاگرد هدایت می‌شود، تضمین می‌کند که مدل شاگرد رابطه ظریف بین یک پاسخ و زمینه پشتیبان آن را به‌درستی جذب کند. این رویکرد بهینه‌سازی در آموزش، یادآور تلاش‌های مشابه برای ارتقای مدل‌های کوچک است که در پژوهش‌های اخیر گوگل برای بهبود استفاده از ابزارها در مدل‌های کوچک مورد بررسی قرار گرفته است.

جزئیات فنی این معماری عبارت است از:

  • استفاده از distillation (تقطیر) با تکیه بر واگرایی KL برای انتقال دانش از معلم به شاگرد.
  • به‌کارگیری تابع زیان در سطح سند بر اساس InfoNCE، که از MaxSim در مدل ColBERT الهام گرفته شده است. در این ساختار، امتیاز یک سند توسط بهترین تکه آن تعیین می‌شود تا مدل دقت بالا در سطح سند را حفظ کند و در عین حال در سطح تکه، جزئی‌نگر باقی بماند.
  • استراتژی تکه‌بندی تصادفی در هر دسته (Batch) برای جلوگیری از Overfitting (بیش‌برازش). برای اینکه مدل به یک روش خاص از تقسیم متن عادت نکند، در هر دسته آموزشی، یک استراتژی تکه‌بندی تصادفی نمونه‌برداری می‌شود.
  • استفاده از توکن اختصاصی <|chunk_sep|> برای جداسازی تکه‌ها و سپس میانگین‌گیری (mean-pooling) از آن‌ها. این کار به مدل اجازه می‌دهد فارغ از اینکه کاربر نهایی داده‌های خود را چگونه قطعه‌بندی می‌کند، انعطاف‌پذیر باقی بماند.

از نظر استقرار، این مدل در حال حاضر به‌عنوان یک پیش‌نمایش با وزن‌های باز (Open Weights) در Hugging Face تحت لایسنس MIT منتشر شده است تا پژوهشگران و توسعه‌دهندگان بتوانند آن را در زیرساخت‌های خود ادغام کنند. توسعه‌دهندگان برای بارگذاری آن به کتابخانه transformers (نسخه ۵.۴.۰ یا بالاتر) و فعال کردن trust_remote_code=True نیاز دارند. لازم به ذکر است که این مدل فعلاً از طریق API شرکت Perplexity در دسترس نیست و تیم سازنده هشدار داده است که وزن‌ها و رابط‌ها ممکن است در طول دوره پیش‌نمایش و بدون سازگاری با نسخه‌های قبلی (backward compatibility) تغییر کنند.

یکی از نقاط قوت این مدل، کارایی آن در لحظه استنتاج (Inference) است. از آن‌جایی که مدل معلم پیچیده فقط در مرحله آموزش برای ارائه اهداف نرم استفاده شده، هیچ تأخیر یا هزینه اضافی در زمان اجرا یا فضای ذخیره‌سازی به سیستم تحمیل نمی‌شود. این مدل ۹ میلیارد پارامتری، که از یک مدل بازیابی داخلی ColBERT تکامل یافته است، مزایای درک زمینه‌ای و آگاهی از پرس‌وجو را بدون هزینه‌های محاسباتی اجرای یک مدل فشرده‌ساز عظیم در لحظه ارائه می‌دهد. این ویژگی، آن را به گزینه‌ای مناسب برای محیط‌های عملیاتی تبدیل می‌کند که در آن‌ها تأخیر در حد میلی‌ثانیه حیاتی است؛ موضوعی که تکنیک‌های کاهش تأخیر در استنتاج مدل‌های زبانی را به یکی از اولویت‌های اصلی توسعه‌دهندگان تبدیل کرده است.

با عبور از محدودیت صلب «تکه‌های طلایی»، Perplexity بازیابی را به سمتی کل‌نگر می‌برد. وقتی مدل می‌تواند دقیقاً به شواهدی اشاره کند که نتیجه‌گیری‌اش را توجیه می‌کند، قابلیت اطمینان خروجی به‌شدت بالا می‌رود و مشکل توهم (Hallucination) در مدل‌های زبانی بزرگ به‌طور مستقیم هدف قرار می‌گیرد. این رویکرد، اسناد را به‌جای مجموعه‌ای از رشته‌های متنی ایزوله، به‌عنوان شبکه‌های به‌هم‌پیوسته از اطلاعات می‌بیند و استانداردی جدید برای آموزش مدل‌های برداری در وظایف پیچیده بازیابی دانش در دنیای واقعی تعیین می‌کند.

گام بعدی شما

  • اگر از پایگاه‌داده‌های برداری برای RAG استفاده می‌کنید، مدل pplx-embed-v2 را در محیط میزبانی شخصی (Self-hosted) تست کنید تا تفاوت در بازیابی شواهد را ببینید.
  • مستندات Hugging Face این مدل را برای بررسی نحوه پیاده‌سازی توکن‌های جداساز مطالعه کنید.
  • استراتژی تکه‌بندی داده‌های خود را با خروجی‌های این مدل مقایسه کنید تا نقاط کور زمینه‌ای در داده‌هایتان را بیابید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار متدولوژی ColBERT و رویکرد جدید تقطیر دانش، نرخ توهم در سیستم‌های RAG را کاهش می‌دهد. این یک پیشرفت کلیدی برای سازمان‌هایی است که نیاز به بازیابی دقیق مستندات حقوقی یا فنی دارند.

تأثیر برای ایران

به‌دلیل انتشار وزن‌های مدل در Hugging Face تحت لایسنس MIT، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به API و پرداخت ارزی، این مدل را به‌صورت میزبانی شخصی در زیرساخت‌های خود مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

تغییر سیگنال آموزش از برچسب‌های سخت (صفر و یک) به توزیع‌های نرم (Soft Targets)، نقطه پایان عصر تکه‌بندی‌های کورکورانه در RAG است. این مدل ثابت می‌کند که برای افزایش دقت، نیازی به مدل‌های استنتاجی سنگین‌تر نیست، بلکه باید «معنای ارتباط» را در مرحله آموزش بازتعریف کرد. در واقع، Perplexity با این کار، فاصله میان جست‌وجوی معنایی ساده و درک ساختاری اسناد را پر کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.