اگر از سیستمهای بازیابی اطلاعات استفاده میکنید، احتمالاً با این واقعیت تلخ روبهرو شدهاید که مدلها گاهی پاسخ درست را میبینند اما بهدلیل نبودِ زمینه، نمیتوانند آن را تأیید کنند. این شکاف میان «یافتن پاسخ» و «درک دلیل پاسخ»، بزرگترین مانع در مسیر استقرار صنعتی هوش مصنوعی زاینده است. چشمانداز تولید بازیابیافزا (RAG) در حال تغییر از تطبیق سادهی کلمات کلیدی یا تطبیق معنایی به سمت درک عمیقتر از ساختار سند و وابستگیهای زمینهای است.
Perplexity Research در همکاری با turbopuffer، مدل pplx-embed-v2-context-9b-preview را برای حل این مشکل عرضه کرد. این مدل بردار معنایی (Embedding) زمینهای است که بهجای تمرکز بر تکههای مجزای متن، بر بازیابی همزمان پاسخ و شواهد پشتیبان تمرکز میکند. هدف این مدل، عبور از محدودیتهای آموزشهای سنتی «گذرگاه طلایی» (gold passage) و حرکت به سمت سیستمی است که اولویت را به بازیابی همزمان پاسخ و شواهد لازم برای تأیید آن پاسخ میدهد.
برای درک اهمیت این اتفاق، باید به نقصهای ذاتی معماریهای فعلی تولید بازیابیافزا (RAG) نگاه کنیم. طبق مستندات فنی این پروژه، اکثر سیستمها اسناد طولانی را به تکههای کوچک و مجزا تقسیم میکنند. در حالی که این کار اجازه میدهد ایندکسگذاری بهصورت بهینه انجام شود، اما یک «خلاء زمینهای» ایجاد میکند. یک تکه خاص ممکن است حاوی پاسخ حیاتی باشد، اما آن پاسخ ممکن است به تعریفی، یک سرخط یا موجودیتی وابسته باشد که چندین پاراگراف قبل معرفی شده است. وقتی این تکهها بهطور مستقل بردارسازی (Embed) میشوند، پیوند معنایی با سند گستردهتر از بین میرود. اگرچه روش «تکهبندی دیرهنگام» (late chunking) — که در آن سند در یک گذر رمزگذاری شده و سپس تجمیع میشود — سعی کرده این مشکل را حل کند، اما متدولوژی آموزش همچنان ایستا مانده است.
در مدلهای سنتی، آموزش بر اساس برچسبهای دوتایی (مثبت/منفی) است: یک تکه «طلایی» مثبت و هر تکه دیگر منفی برچسب میخورند. این رویکرد بهشدت مشکلساز است زیرا تکههایی که حاوی شواهد پشتیبان ضروری هستند را جریمه میکند و در واقع به مدل میگوید زمینهای که برای تأیید پاسخ لازم است، نامرتبط است.
به نقل از تیم پژوهشی Perplexity، مدل جدید این پارادایم را با تغییر سیگنال آموزش مختل کرده است. بهجای تقسیمبندی دوتایی مثبت/منفی، این مدل از یک «مدل معلم» استفاده میکند که در واقع یک مدل فشردهساز زمینه و آگاه از پرسوجو (query-aware) است. این معلم، پرسوجو و سند را بهطور همزمان میخواند و به هر توکن بر اساس میزان ارتباطش امتیاز میدهد. سپس ارتباط یک تکه (chunk) بهعنوان میانگین امتیازات n توکن برتر در آن بخش خاص محاسبه میشود. این فرآیند یک «هدف نرم» (soft target) با استفاده از softmax مقیاسبندی شده با دما (temperature-scaled) روی تمام تکههای موجود در یک سند مثبت ایجاد میکند.
در نتیجه، مدل یاد میگیرد که توزیع ارتباطات را بفهمد و تشخیص دهد که چندین تکه از یک سند ممکن است برای پاسخ کامل به یک سؤال ضروری باشند. این فرآیند تقطیر (distillation)، که توسط واگرایی KL پیشرو (forward KL divergence) بین توزیعهای معلم و شاگرد هدایت میشود، تضمین میکند که مدل شاگرد رابطه ظریف بین یک پاسخ و زمینه پشتیبان آن را بهدرستی جذب کند. این رویکرد بهینهسازی در آموزش، یادآور تلاشهای مشابه برای ارتقای مدلهای کوچک است که در پژوهشهای اخیر گوگل برای بهبود استفاده از ابزارها در مدلهای کوچک مورد بررسی قرار گرفته است.
جزئیات فنی این معماری عبارت است از:
- استفاده از distillation (تقطیر) با تکیه بر واگرایی KL برای انتقال دانش از معلم به شاگرد.
- بهکارگیری تابع زیان در سطح سند بر اساس InfoNCE، که از MaxSim در مدل ColBERT الهام گرفته شده است. در این ساختار، امتیاز یک سند توسط بهترین تکه آن تعیین میشود تا مدل دقت بالا در سطح سند را حفظ کند و در عین حال در سطح تکه، جزئینگر باقی بماند.
- استراتژی تکهبندی تصادفی در هر دسته (Batch) برای جلوگیری از Overfitting (بیشبرازش). برای اینکه مدل به یک روش خاص از تقسیم متن عادت نکند، در هر دسته آموزشی، یک استراتژی تکهبندی تصادفی نمونهبرداری میشود.
- استفاده از توکن اختصاصی <|chunk_sep|> برای جداسازی تکهها و سپس میانگینگیری (mean-pooling) از آنها. این کار به مدل اجازه میدهد فارغ از اینکه کاربر نهایی دادههای خود را چگونه قطعهبندی میکند، انعطافپذیر باقی بماند.
از نظر استقرار، این مدل در حال حاضر بهعنوان یک پیشنمایش با وزنهای باز (Open Weights) در Hugging Face تحت لایسنس MIT منتشر شده است تا پژوهشگران و توسعهدهندگان بتوانند آن را در زیرساختهای خود ادغام کنند. توسعهدهندگان برای بارگذاری آن به کتابخانه transformers (نسخه ۵.۴.۰ یا بالاتر) و فعال کردن trust_remote_code=True نیاز دارند. لازم به ذکر است که این مدل فعلاً از طریق API شرکت Perplexity در دسترس نیست و تیم سازنده هشدار داده است که وزنها و رابطها ممکن است در طول دوره پیشنمایش و بدون سازگاری با نسخههای قبلی (backward compatibility) تغییر کنند.
یکی از نقاط قوت این مدل، کارایی آن در لحظه استنتاج (Inference) است. از آنجایی که مدل معلم پیچیده فقط در مرحله آموزش برای ارائه اهداف نرم استفاده شده، هیچ تأخیر یا هزینه اضافی در زمان اجرا یا فضای ذخیرهسازی به سیستم تحمیل نمیشود. این مدل ۹ میلیارد پارامتری، که از یک مدل بازیابی داخلی ColBERT تکامل یافته است، مزایای درک زمینهای و آگاهی از پرسوجو را بدون هزینههای محاسباتی اجرای یک مدل فشردهساز عظیم در لحظه ارائه میدهد. این ویژگی، آن را به گزینهای مناسب برای محیطهای عملیاتی تبدیل میکند که در آنها تأخیر در حد میلیثانیه حیاتی است؛ موضوعی که تکنیکهای کاهش تأخیر در استنتاج مدلهای زبانی را به یکی از اولویتهای اصلی توسعهدهندگان تبدیل کرده است.
با عبور از محدودیت صلب «تکههای طلایی»، Perplexity بازیابی را به سمتی کلنگر میبرد. وقتی مدل میتواند دقیقاً به شواهدی اشاره کند که نتیجهگیریاش را توجیه میکند، قابلیت اطمینان خروجی بهشدت بالا میرود و مشکل توهم (Hallucination) در مدلهای زبانی بزرگ بهطور مستقیم هدف قرار میگیرد. این رویکرد، اسناد را بهجای مجموعهای از رشتههای متنی ایزوله، بهعنوان شبکههای بههمپیوسته از اطلاعات میبیند و استانداردی جدید برای آموزش مدلهای برداری در وظایف پیچیده بازیابی دانش در دنیای واقعی تعیین میکند.
گام بعدی شما
- اگر از پایگاهدادههای برداری برای RAG استفاده میکنید، مدل pplx-embed-v2 را در محیط میزبانی شخصی (Self-hosted) تست کنید تا تفاوت در بازیابی شواهد را ببینید.
- مستندات Hugging Face این مدل را برای بررسی نحوه پیادهسازی توکنهای جداساز مطالعه کنید.
- استراتژی تکهبندی دادههای خود را با خروجیهای این مدل مقایسه کنید تا نقاط کور زمینهای در دادههایتان را بیابید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو