پرش به محتوای اصلی
پرش به محتوای مقاله

Perplexity: دقت بازیابی اسناد در MADQA به ۹۲.۴٪ رسید

·۱۶ مهر ۱۴۰۵۴ دقیقه مطالعه
پرپلکسیتی مدل‌های جدید pplx-embed-v2 را معرفی کرد: نسخه ۰.۶ میلیارد پارامتری برای لبه و نسخه ۹ میلیارد پارامتری با دقت ۹۲.۴٪
پرپلکسیتی مدل‌های جدید pplx-embed-v2 را معرفی کرد: نسخه ۰.۶ میلیارد پارامتری برای لبه و نسخه ۹ میلیارد پارامتری با دقت ۹۲.۴٪
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از بردارهای ۱۲۸-بعدی (۱۶ تا ۳۲ برابر باریک‌تر از رقبا) برای هر توکن، در حالی که دقت بازیابی در اسناد چندوجهی افزایش یافته است.

دقت بازیابی اطلاعات از اسناد حجیم و پیچیده، نقطه ضعف همیشگی عامل‌های هوش مصنوعی بوده است. حالا مدل جدید Perplexity با ثبت صحت ۹۲.۴ درصدی در محک MADQA، استانداردهای بازیابی عامل‌محور (Agentic Retrieval) را جابه‌جا کرد. طبق اعلام این شرکت در ۸ اکتبر ۲۰۲۶، سری مدل‌های pplx-embed-v2-late با رویکردی دوگانه عرضه شده‌اند تا متن، تصاویر و صفحات رندر شده PDF را در یک فضای مشترک پردازش کنند.

بسیاری از مدل‌های فعلی، کل یک سند را در یک بردار معنایی (Embedding) فشرده می‌کنند و در این مسیر، جزئیات ریز سند از دست می‌رود. Perplexity برای حل این مشکل از معماری ColBERT استفاده کرده است؛ سیستمی که برای هر توکن (Token) یک بردار ۱۲۸-بعدی مجزا نگه می‌دارد. این ساختار اجازه می‌دهد تا مکانیزم امتیازدهی MaxSim، بهترین تطابق هر توکن پرس‌وجو را در سند پیدا کرده و مجموع آن‌ها را محاسبه کند که نتیجه آن، افزایش چشمگیر دقت در محتواهای طولانی است.

برای دستیابی به این سطح از عملکرد، Perplexity هر دو مدل را از یک مدل معلم ۱۸ میلیاردی و با استفاده از آموزش سطح توکن به سبک LEAF استخراج (Distillation) کرده است. این فرآیند آموزشی خاص است که باعث ایجاد یک فضای جاسازی مشترک بین مودالیته‌های مختلف و اندازه‌های متفاوت مدل می‌شود. این تلاش برای بهینه‌سازی مدل‌ها در راستای کاهش هزینه‌های پردازشی است، مشابه آنچه در بهینه‌سازی حجم توکن‌های استدلال در مدل ThinkingCap شاهد بودیم.

Meet Together Link: ابزار خط فرمان رایگان برای اجرای مدل‌های باز مانند Kimi K3 و GLM 5.3 در Claude Code، Codex و OpenCode

بر اساس مستندات منتشر شده در Hugging Face، این مدل‌ها تحت لایسنس MIT و برای استفاده تجاری در دسترس هستند. این عرضه شامل دو وزن مجزا است:

  • pplx-embed-v2-late-0.6b: مدلی سبک بر پایه Qwen3.5-0.8B که هرس (Pruning) شده است (به ۱۲ لایه متنی کاهش یافته). این مدل تقریباً از ۲۴۰ میلیون پارامتر فعال برای متن و ۳۴۰ میلیون پارامتر برای تصاویر استفاده می‌کند. با تخمین bf16، این مدل به حدود ۱.۲ گیگابایت حافظه نیاز دارد و برای استقرار روی لپ‌تاپ‌ها، دستگاه‌های لبه (Edge Devices) یا پردازنده‌های گرافیکی کوچک طراحی شده است.
  • pplx-embed-v2-late-9b: مدلی با ظرفیت بالا بر پایه Qwen3.5 با ۷.۴ میلیارد پارامتر فعال. این مدل به ۱۶ تا ۱۸ گیگابایت حافظه (تخمین bf16) نیاز دارد و برای استفاده در مراکز داده (Data Center) یا GPUهای با حافظه بالا جهت ساخت شاخص‌های اسنادی با کیفیت بالا در نظر گرفته شده است.

به گزارش Marktechpost، مدل ۹ میلیاردی در ۷۲ تکلیف متنی تخصصی (با معیار nDCG@10) با امتیاز ۸۱.۳٪، تمام مدل‌های تست شده را با اختلاف ۱.۶ درصد پشت سر گذاشت. همچنین در محک BrowseComp+، با امتیاز ۶۴.۰٪، فاصله ۸.۷ درصدی با بهترین مدل متراکم (Dense Model) ایجاد کرد که برتری قابل توجهی است.

سایر نتایج بنچمارک‌ها حاکی از برتری این مدل‌هاست:

  • Q2D-Web (Recall@1000): هر دو مدل توانستند رکورد قبلی ۶۹.۳٪ را بشکنند؛ مدل ۹ میلیاردی به ۷۴.۸٪ و مدل ۰.۶ میلیاردی به ۷۳.۶٪ رسیدند.
  • ViDoRe v3 Markdown (nDCG@10): مدل ۹ میلیاردی با امتیاز ۶۴.۷٪، تمام مدل‌های خارجی تست شده را شکست. مدل ۰.۶ میلیاردی امتیاز ۶۱.۲٪ را کسب کرد که اگرچه کمترین امتیاز در این مجموعه بود، اما همچنان دومین نتیجه برتر در کل این بنچمارک محسوب می‌شود.
  • MADQA: صحت ۹۲.۴ درصدی مدل ۹ میلیاردی، مدل بازیاب Mixedbread (۸۸.۹٪) را شکست، هرچند هنوز از جست‌وجوی عامل‌محور Mixedbread (۹۳.۴٪) عقب‌تر است.

نکته فنی جالب این است که Perplexity سیستم را به‌گونه‌ای طراحی کرده که مدل ۰.۶ میلیاردی بتواند روی شاخص‌های (Index) مدل ۹ میلیاردی پرس‌وجو کند. در بازیابی تصاویر ViDoRe v3، این رویکرد ترکیبی امتیاز ۶۳.۵٪ را کسب کرد که حدود نیمی از شکاف کیفی بین دو مدل را پر می‌کند، در حالی که هزینه استنتاج (Inference) را در سطح مدل کوچک نگه می‌دارد.

از نظر مهندسی، این مدل‌ها بر خلاف رقبایی مثل Nemotron-colembed-vl-8b-v2 انویدیا یا Gemini Embedding 2 گوگل که از بردارهای ۲۰۴۸ تا ۴۰۹۶ بعدی استفاده می‌کنند، تنها از ۱۲۸ بعد برای هر توکن استفاده می‌کنند. این یعنی بردارها ۱۶ تا ۳۲ برابر باریک‌تر شده‌اند.

البته این معماری یک سبک-سنگین (Trade-off) در ذخیره‌سازی ایجاد می‌کند. چون برای هر توکن یک بردار ذخیره می‌شود، حجم شاخص‌ها با افزایش طول سند به‌صورت خطی رشد می‌کند. برای مدیریت چنین حجم‌های عظیم از داده در مقیاس صنعتی، زیرساخت‌های ذخیره‌سازی پیشرفته‌ای مانند خوشه OceanStor M900 هواوی که حافظه‌های پتابایتی را برای استنتاج فراهم می‌کند، حیاتی هستند. علاوه بر این، مدل‌ها در حال حاضر نمی‌توانند متن و تصویر را در یک ورودی واحد ترکیب کنند و در امتیازات بازیابی تصاویر ViDoRe v3 از مدل EVIE شرکت تنسنت (که مدل ۹ میلیاردی در آن ۶۵.۲٪ گرفت) عقب‌تر هستند. همچنین اشاره شده است که Gemini Embedding 2 در MIRACL-Vision و با اختلاف ۲ درصد در PPLX-Q2I بر مدل ۹ میلیاردی برتری دارد.

این عرضه، تمرکز جامعه فنی را از «مدل بزرگ‌تر، بهتر است» به «کارایی ساختاری» تغییر می‌دهد. این رویکرد به‌ویژه برای جست‌وجوی اسناد بصری (مانند اسلایدهای ارائه و گزارش‌های اسکن شده) قدرتمند است، زیرا صفحات را به‌عنوان تصویر کدگذاری می‌کند و نیاز به مرحله نویسه‌خوانی نوری (OCR) را حذف می‌کند. این امر امکان ایجاد یک معماری ترکیبی ابر-لبه (Cloud-Edge) را فراهم می‌کند: شاخص‌گذاری مجموعه‌داده‌های عظیم در ابر با مدل ۹ میلیاردی و اجرای پرس‌وجوهای زنده به‌صورت محلی روی دستگاه با مدل ۰.۶ میلیاردی.

توسعه‌دهندگان می‌توانند هم‌اکنون این مدل‌ها را با کتابخانه‌های sentence-transformers >= 6.0.0 و transformers >= 5.4.0 پیاده‌سازی کنند. در حالی که وزن‌ها برای میزبانی شخصی (در قالب F32) منتشر شده‌اند، یک نقطه اتصال (API) میزبانی شده توسط Perplexity برنامه‌ریزی شده اما هنوز فعال نشده است.

گام بعدی شما

  • اگر با اسناد PDF حجیم سر و کار دارید، مدل ۹ میلیاردی را برای ساخت Index و مدل ۰.۶ میلیاردی را برای Querying تست کنید.
  • برای کاهش هزینه‌های حافظه در محیط‌های لبه، معماری ۱۲۸-بعدی این مدل را با مدل‌های متراکم مقایسه کنید.
  • بررسی کنید که آیا حذف مرحله OCR در گردش‌کار شما، سرعت پردازش اسناد بصری را افزایش می‌دهد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل‌ها با تکیه بر تخصص در معماری ColBERT، هزینه عملیاتی سیستم‌های RAG را به‌شدت کاهش می‌دهند. اعتبار این رویکرد با ثبت رکوردهای جدید در MADQA به اثبات رسیده و مسیر را برای عامل‌های هوش مصنوعی سریع‌تر و دقیق‌تر هموار می‌کند.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights) و لایسنس MIT، توسعه‌دهندگان ایرانی می‌توانند این مدل‌ها را به‌صورت میزبانی شخصی (Self-hosting) روی سرورهای داخلی اجرا کنند و محدودیت‌های API را دور بزنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی بردارهای پهن با بردارهای باریک اما توکن-محور، نشان می‌دهد که آینده بازیابی اطلاعات در «دقت تفکیک» است نه «حجم فشرده‌سازی». این استراتژی Perplexity عملاً هزینه استنتاج را در لبه کاهش می‌دهد بدون اینکه دقت را فدای سرعت کند. در واقع، ما شاهد گذار از مدل‌های General-purpose به مدل‌های Structural-efficient هستیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.