پرش به محتوای اصلی
پرش به محتوای مقاله

روابط ساختاریافته دقت استدلال در RAG را به ۹۸٪ رساند

·۲۶ شهریور ۱۴۰۵۱۰ دقیقه مطالعه۱ بازدید
آیا RAG به بازیابی بهتر نیاز دارد — یا روابط بهتر؟
آیا RAG به بازیابی بهتر نیاز دارد — یا روابط بهتر؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات اینکه ساختار بصری و تایپ‌شده‌ی روابط (Typed Relations) به‌طور معناداری مؤثرتر از بیان همان روابط به صورت متن عادی است و دقت را تا ۲۱٪ افزایش می‌دهد.

دقت استدلال ۹۸٪؛ این رقمی است که مدل GPT-4o-mini با دریافت سرنخ‌های رابطه‌ای ساختاریافته به آن دست یافت. طبق یک آزمایش فنی که در ۱۷ سپتامبر ۲۰۲۶ منتشر شد، مدل‌های زبانی حتی وقتی تمام شواهد لازم در پنجره زمینه (Context Window) — مثل میز کاری که جا برای چند ورق دارد، نه برای کل کتابخانه — موجود است، در بازسازی «بافت ارتباطی» بین اسناد دچار مشکل می‌شوند. این مطالعه ثابت می‌کند که مدل‌های زبانی بزرگ (LLM) در بازسازی «بافت پیونددهنده» بین اسناد دست‌وپا می‌زنند، حتی اگر تمام شواهد لازم در دسترس آن‌ها باشد.

بیشتر سامانه‌های تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — بر بهبود بازیابی یا یافتن تکه‌های درست متن تمرکز می‌کنند. این رویکرد در واقع اساس اتصال هوش مصنوعی به داده‌های خصوصی بدون نیاز به بازآموزی مدل است. اما گلوگاه واقعی، یافتن داده‌ها نیست، بلکه درک نحوه تعامل دو تکه داده با یکدیگر است. برای مثال، اگر یک سند بگوید تیمی در سال ۲۰۲۲ PostgreSQL را انتخاب کرده و سند دیگر بگوید در سال ۲۰۲۴ به DynamoDB مهاجرت کرده‌اند، مدل باید رابطه «جایگزینی» را استنتاج کند تا توضیح دهد چرا تصمیم تغییر کرده است. در این حالت، هیچ‌کدام از این دو سند به تنهایی حاوی پاسخ به سؤال «چرا تصمیم تغییر کرد؟» نیستند. پاسخ در واقع در رابطه بین این دو سند زندگی می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های بازمتن اشاره کردیم، ساختار داده‌ها همواره بر خروجی اثر می‌گذارد. تصور کنید هوش مصنوعی شما پژوهشگری است که توده‌ای از کتاب‌های باز پیش رو دارد. RAG استاندارد فقط صفحات درست را به او می‌دهد، اما RAG رابطه‌ای، نقشه‌ای ارائه می‌کند که دقیقاً نشان می‌دهد کدام صفحه، صفحه دیگر را نقض یا به‌روزرسانی کرده است. این تمایز برای منطق‌های پیچیده تجاری که اسنادشان در طول زمان تکامل می‌یابند، حیاتی است.

جزئیات چیدمان آزمایش

پژوهشگر برای این کار یک مجموعه داده مصنوعی شامل ۲۵۴ سند تجاری در حوزه‌های منابع انسانی، DevOps و صورت‌حساب ساخت. برای جداسازی اثر روابط از اثر بازیابی، اسناد بازیابی‌شده در تمام شرایط یکسان نگه داشته شدند. هیچ بازرتبه‌بندی (Re-ranking)، هیچ سند اضافی و هیچ بهبود بازیابی‌ای اعمال نشد. تنها متغیر این بود که آیا مدل روابط صریح بین آن اسناد را دریافت می‌کند یا خیر.

این مجموعه داده شامل ۶۰ مورد چندگامی (multi-hop) با داده‌های مرجع (Ground Truth) دستی بود:

  • ۴۲ مورد جایگزینی (جایی که یک سند جایگزین سند دیگر شده است)
  • ۶ مورد تناقض
  • ۸ مورد پیوند
  • ۴ مورد منفی (که در آن هیچ رابطه‌ای وجود ندارد)

برخی موارد نیاز به استدلال بین چندین سند داشتند. به‌طور خاص، شش مورد از موارد جایگزینی شامل چهار تا شش سند بودند که با عوامل مزاحم نامرتبط مخلوط شده بودند. پژوهشگر عمداً روابط را به‌گونه‌ای طراحی کرد که بازیابی آن‌ها از متن هر سند به تنهایی سخت باشد. برای مثال، دو سند می‌توانستند هر دو کاملاً معتبر باشند اما وضعیت‌های متفاوتی از یک تصمیم واحد را نشان دهند. اطلاعات حیاتی در داخل اسناد نبود، بلکه در پیوند بود: A ← جایگزین شده توسط ← B، یا A ↔ در تناقض است با ↔ B، یا A ← متعلق است به ← خوشه B.

محدودیت‌های بازیابی پایه

برای تضمین عدالت در آزمایش، از یک سیستم بازیابی لکسیکال ضعیف به سبک BM25 استفاده شد. این یک پیاده‌سازی در سطح تولید نبود، بلکه یک خط پایه لکسیکال ساده بود. این تنظیمات محدودیت‌های خاصی ایجاد کرد:

  • میانگین بازیابی (Recall) اسناد هدف (Oracle documents) در ۵ نتیجه اول ۰.۶۷ بود.
  • ۲۷ مورد از ۶۰ مورد بازیابی کامل داشتند.
  • ۱۷ مورد بازیابی جزئی و ۱۰ مورد بازیابی پایین داشتند.
  • ۶ مورد بازیابی صفر داشتند (که همگی موارد منفی بودند).

این محدودیت بسیار مهم است. اگر بازیابی شواهدی را از دست بدهد، یک سرنخ رابطه‌ای می‌تواند به‌طور بالقوه این ضعف را جبران کند. در نتیجه، این آزمایش ادعا نمی‌کند که در یک سیستم تولیدی با بازیابی با کارایی بالا چه رخ می‌دهد، بلکه محیطی کنترل‌شده ایجاد کرد که در آن اسناد C و D متن‌های بازیابی‌شده‌ای کاملاً یکسان (byte-identical) دریافت کردند. در همین راستا، برخی توسعه‌دهندگان معتقدند بازیابی ترکیبی می‌تواند شکاف‌های دقت در RAG را پر کند تا احتمال از دست رفتن شواهد کاهش یابد.

جهش در عملکرد

وقتی مدل‌ها فقط اسناد بازیابی‌شده را دریافت کردند، صحت (Accuracy) روی ۷۷٪ بود. اما افزودن روابط تایپ‌شده و صریح — که در قالب بلوک‌های ساختاریافته ارائه شده بودند — باعث جهشی عظیم در عملکرد شد.

  • DeepSeek: از ۷۷٪ به ۹۴٪ رسید (۱۷٪ افزایش)
  • GPT-4o-mini: از ۷۷٪ به ۹۸٪ رسید (۲۱٪ افزایش)

این روابط در فیلدهای ساختاریافته ارائه شدند: kind: superseded, from: database-choice-2022.md, to: database-choice-2024.md, و reason: migration failure. به مدل دستور داده شد که یک موتور پایگاه دانش این رابطه را شناسایی کرده است و مدل باید در صورتی که این سرنخ با اسناد سازگار است، از آن استفاده کند.

آزمون فرضیات توکن و ساختار

پژوهشگر احتمال داد که مدل‌ها صرفاً به دلیل افزایش تعداد توکن (Token) — تکه‌های کوچکی از متن شبیه برش‌های کیک — یا ساختار بصری پرامپت واکنش نشان دهند. برای بررسی این موضوع، چندین گروه کنترلی ایجاد شد:

  • متن نامرتبط: افزودن تعداد توکن‌های مشابه (حدود ۱۷ کلمه) درباره سلف‌سرویس، پارکینگ و اتاق‌های جلسه، صحت را به ۵۳٪ کاهش داد.
  • قالب متنی: تبدیل داده‌های رابطه‌ای به جملات عادی (مثلاً: «توجه: سند B وضعیت فعلی این تصمیم را منعکس می‌کند. A نسخه قبلی است») نیز منجر به افت صحت به ۵۳٪ شد.
  • روابط جابه‌جا شده: دادن رابطه‌ای از یک مورد دیگر (از همان نوع) به هر مورد، نمرات را به حدود ۵۲-۵۳٪ رساند. یک بررسی ضد-نشت (anti-leakage) تأیید کرد که هیچ‌کدام از ۶۰ سرنخ جابه‌جا شده درست نبودند.
  • متن درون‌سندی: قرار دادن همان رابطه معنایی در متن عادی سند نیز نتیجه‌ای حدود ۵۲-۵۳٪ داشت.

این نتایج نشان می‌دهد مدل بر اساس کلمات کلیدی یا طول متن حدس نمی‌زند، بلکه دقیقاً به نقشه‌برداری ساختاریافته و درست بین اسناد نیاز دارد تا بتواند به‌طور مؤثر استدلال کند.

شکنندگی سرنخ‌های رابطه‌ای

یکی از تکان‌دهنده‌ترین یافته‌ها، سرعت شکست سیستم در مواجهه با داده‌های نویزی بود. پژوهشگر فیلدهای شناسایی را در سرنخ‌های رابطه‌ای تخریب کرد تا ببیند در چه نقطه‌ای مزیت این سیستم از بین می‌رود.

در ۲۰٪ تخریب، صحت از ۹۸٪ به ۵۳٪ سقوط کرد و در ۴۰٪ تخریب به ۵۲٪ رسید. این یعنی سرنخ‌های رابطه‌ای قدرتمند اما پرریسک هستند؛ مقدار کمی متادیتای رابطه‌ای غلط می‌تواند تقریباً توانایی استدلال مدل را به‌طور کامل نابود کند. با این حال، پژوهشگر اشاره کرد که تمام سطوح (مانند ۵٪ یا ۱۰٪) را آزمایش نکرده است، بنابراین نمی‌توان ادعا کرد که ۸۰٪ روابط درست بی‌فایده هستند، بلکه فقط این مکانیسم تخریب خاص ویرانگر بود.

شباهت در برابر روابط تایپ‌شده

آزمایش همچنین «لبه‌های شباهت» (صرفاً ذکر اینکه دو سند مرتبط هستند) را با «روابط تایپ‌شده» (ذکر نحوه ارتباط) مقایسه کرد.

  • شباهت: عملکرد را به‌طور قابل‌توجهی بهبود داد و DeepSeek را به ۸۸٪ و GPT-4o-mini را به ۹۳٪ رساند.
  • روابط تایپ‌شده: برتر باقی ماندند، به‌ویژه در موارد منفی. در حالی که شباهت اغلب مدل را فریب می‌داد تا تصور کند رابطه‌ای وجود دارد (چون اسناد شبیه به هم بودند)، یک رابطه تایپ‌شده می‌توانست صراحتاً اعلام کند kind: none.

جالب است که برای DeepSeek، شباهت در موارد «پیوند» بهتر از روابط تایپ‌شده عمل کرد (۷۹٪ در برابر ۷۱٪). فرضیه این است که فیلد «دلیل» (reason) در سرنخ تایپ‌شده ممکن است در این موارد خاص باعث حواس‌پرتی مدل شده باشد. این موضوع یک تفاوت کلیدی را برجسته می‌کند: شباهت می‌گوید «این‌ها شبیه هم به نظر می‌رسند»، در حالی که یک رابطه تایپ‌شده می‌تواند ماهیت دقیق پیوند را مشخص کند یا صراحتاً آن را تکذیب کند.

مسئله متادیتای مورد اعتماد

با وجود پیشرفت‌ها، یک نگرانی باقی است: «اثر اقتدار». چون در پرامپت ذکر شده بود که یک «موتور پایگاه دانش» روابط را تولید کرده، مدل ممکن است بلوک ساختاریافته را به عنوان متادیتای ممتاز تلقی کند — در واقع فکر کند: «سیستم می‌گوید پاسخ این است، پس من به آن اعتماد می‌کنم».

این موضوع با این واقعیت تأیید می‌شود که همان اطلاعات در قالب متن عادی شکست خورد، در حالی که بلوک ساختاریافته موفق بود. مدل ممکن است به فرمت متاداتا بیشتر از محتوای رابطه اعتماد کند. پژوهشگر در حال حاضر نمی‌تواند استدلال رابطه‌ای را از اثرات اقتدار یا برجستگی (salience) ناشی از نحوه نمایش جدا کند.

میان‌بر بازیابی

یک متغیر بزرگ دیگر وجود دارد: ضعف سیستم بازیابی پایه. چون بازیابی اغلب اسناد را از دست می‌داد (میانگین بازیابی ۵ نتیجه اول ۰.۶۷ بود)، سرنخ رابطه‌ای (مثلاً A ← مرتبط با ← C) ممکن است به عنوان یک میان‌بر عمل کرده باشد. اگر مدل به اسناد A، B و C نیاز دارد اما بازیابی فقط A و B را برمی‌گرداند، سرنخ به مدل می‌گوید C مهم است، حتی اگر در متن غایب باشد.

این یعنی سرنخ رابطه‌ای ممکن است ضعف بازیابی را جبران کند، نه اینکه لزوماً استدلال را تقویت کند. پژوهشگر قصد دارد با تغییر عمق بازیابی (کم‌عمق در برابر عمیق) در حالی که شرط رابطه‌ای ثابت است، این موضوع را آزمایش کند. اگر با بهبود کیفیت بازیابی، فاصله بین حالت «بدون رابطه» و «با رابطه» کم شود (مثلاً از ۲۱٪ به ۲٪ برسد)، ثابت می‌شود که سرنخ صرفاً میان‌بری برای شواهد گمشده بوده است. برای جلوگیری از وارد کردن متغیرهای جدید، پژوهشگر قصد دارد دسترسی به شواهد را از مقدار کل متن در پرامپت جدا کند.

پیامدها برای معماری RAG

این مطالعه نشان می‌دهد مرز بعدی RAG، جست‌وجوی برداری بهتر نیست، بلکه نقشه‌برداری صریح از وضعیت اسناد است. برای سازمان‌هایی با مستندات نسخه‌بندی شده یا سیاست‌های متناقض، رویکرد GraphRAG که صراحتاً «جایگزینی» یا «تناقض» را برچسب‌گذاری می‌کند، تفاوت بین یک توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد — و یک پاسخ درست است. در این زمینه، بررسی تأثیر میزبانی محلی داده‌ها بر کاهش توهمات می‌تواند دیدگاه‌های تکمیلی درباره مدیریت شواهد ارائه دهد.

با این حال، حساسیت شدید به تخریب (نرخ شکست ۲۰٪) یعنی هر سیستمی که این روابط را تولید می‌کند باید تقریباً بی‌نقص باشد. استخراج خودکار روابط که «بیشتر اوقات درست» است، ممکن است در واقع مضرتر از ارائه هیچ رابطه‌ای باشد.

مسیرهای آینده

این آزمایش ابتدا به عنوان ایده‌ای برای استفاده از سیستم‌های بازسازی زمینه جهت ایجاد داده‌های آموزشی ساختاریافته آغاز شد تا روابط را به عنوان supersedes (جایگزین)، contradicts (متناقض)، belongs_to (متعلق به)، references (ارجاع) یا none (هیچ) طبقه‌بندی کند. اما پژوهشگر برای جلوگیری از یک مشکل دوری (circular problem) این کار را متوقف کرد: استفاده از یک سیستم برای تولید برچسب‌ها و سپس استفاده از همان برچسب‌ها برای اثبات اینکه سیستم کار می‌کند.

آزمایش‌های آتی بر این تمرکز خواهند بود که با استفاده از بازیابی بهتر، مدل‌های مختلف و نمایش‌هایی که اثر «متادیتای مورد اعتماد» را حذف می‌کنند، نتایج را به چالش بکشند. سؤال اصلی باقی می‌ماند: وقتی یک LLM در حال حاضر اسناد مرتبط را در اختیار دارد، آیا نمایش صریح روابط، اطلاعاتی به آن می‌دهد که نمی‌تواند به‌طور قابل‌اعتمادی خودش بازسازی کند؟

گام بعدی شما

  • اگر از RAG برای اسناد فنی یا قانونی استفاده می‌کنید، به جای تکیه بر شباهت برداری، لایه‌ای برای تعریف روابط (مانند Supersedes) اضافه کنید.
  • در طراحی پرامپت‌ها، متادیتای ساختاریافته (JSON-like) را به متن عادی ترجیح دهید تا مدل سریع‌تر روابط را درک کند.
  • دقت کنید که کیفیت متادیتای رابطه‌ای باید بسیار بالا باشد؛ داده‌های نویزی در این لایه، استدلال مدل را به‌طور کامل مختل می‌کند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی کنترل‌شده، نشان می‌دهد که GraphRAG می‌تواند دقت استدلال را در محیط‌های سازمانی به نزدیکی ۱۰۰٪ برساند. اعتبار این یافته در جداسازی اثر بازیابی از اثر استدلال است که گلوگاه واقعی RAG را شناسایی می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که روی سامانه‌های مدیریت دانش سازمانی کار می‌کنند، پیاده‌سازی لایه روابط صریح جایگزین مناسبی برای ارتقای مدل‌های ارزان‌تر (مانند مدل‌های کوچک‌تر) است تا به دقت مدل‌های بزرگ برسند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «یافتن سند» به «درک پیوند» تغییر می‌کند. این یافته ثابت می‌کند که مدل‌های زبانی در بازسازی ساختار منطقی داده‌های پراکنده ناتوان‌اند و نیاز به یک لایه هدایتگر (Guidance Layer) دارند. خطر اصلی در اینجا، وابستگی مدل به فرمت متاداتا به جای محتوای آن است که می‌تواند منجر به اعتماد کورکورانه به داده‌های غلط ساختاریافته شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.