پرش به محتوای اصلی
پرش به محتوای مقاله

چارچوب PicNet برای حذف توهم در دستیارهای سازمانی RAG

·۲۳ شهریور ۱۴۰۵۶ دقیقه مطالعه
راهنما
دستیار هوشمند سیاست‌ها و رویه‌ها: پاسخگویی بر اساس اسناد سازمانی
دستیار هوشمند سیاست‌ها و رویه‌ها: پاسخگویی بر اساس اسناد سازمانی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهوم «قرارداد پرامپت» و استفاده از مجموعه‌های ارزیابی منفی برای اندازه‌گیری نرخ پاسخ‌های غلط در RAG سازمانی، به جای تکیه بر بنچمارک‌های عمومی.

تصور کنید یک دستیار هوش مصنوعی در شرکت شما، سیاست‌های تعدیل نیرو را از روی حدس و گمان پاسخ دهد؛ این ابزار در چنین حالتی خطرناک‌تر از آن است که اصلاً وجود نداشته باشد. این پیش‌فرض اصلی شرکت PicNet، سازنده سامانه‌های هوش مصنوعی در استرالیا است که معتقد است بیشترین بازگشت سرمایه (ROI) مدل‌های زبانی نه در کارهای خلاقانه، بلکه در حل مشکل «صندوق ورودی پر از سؤالات تکراری HR» از طریق محدود کردن پاسخ‌ها به مستندات واقعی شرکت است.

بسیاری از دانش سازمانی در فایل‌های PDF قدیمی محبوس شده است که سال‌ها پیش در SharePoint آپلود شده‌اند. برای مثال، یک سیاست مرخصی ممکن است توضیح دهد که وقتی یک تعطیلی رسمی با مرخصی سالانه همزمان می‌شود چه اتفاقی می‌افتد، یا یک دفترچه راهنمای نصب ممکن است مشخص کند که کدام بست برای سقف‌های سفالی مناسب است. اغلب، پاسخ دقیق در صفحه ۳۴ یک فایل PDF مربوط به سال ۲۰۱۹ نهفته است. به دلیل دشواری در یافتن این اطلاعات، کارکنان معمولاً از همکاران خود می‌پرسند و آن‌ها هم اغلب پاسخ را حدس می‌زنند. این وضعیت یک شکاف اعتمادی سیستماتیک در عملیات شرکت‌ها ایجاد می‌کند.

مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — اگرچه لحنی حرفه‌ای دارند، اما اغلب بر اساس دانش عمومی خود سیاست‌های شرکت را توهم می‌زنند. یک مدل عمومی با اطمینان کامل پاراگرافی درباره فرآیند تعدیل نیرو می‌نویسد که شبیه به استانداردهای جهانی است، اما لزوماً با قوانین داخلی شرکت شما همخوانی ندارد. این خطرناک است چون پاسخ کاملاً رسمی به نظر می‌رسد و کاربر تصور می‌کند این پاسخ مستقیماً از سیاست‌های رسمی شرکت استخراج شده است.

به نقل از راهنمای منتشر شده توسط PicNet در ۱۴ سپتامبر ۲۰۲۶، راهکار این مشکل، معماری تخصصی تولید بازیابی‌افزا (RAG) است که برای محیط‌های «تولرانس صفر» طراحی شده است. این سامانه «چت» نمی‌کند؛ بلکه تکه‌های خاصی از متن را بازیابی کرده و از مدل می‌خواهد فقط و فقط با استفاده از آن متن ارائه شده پاسخ دهد. پاسخ نهایی همراه با لینک به مستندات منبع و بخش‌های مورد استفاده است. اگر پاراگراف‌های بازیابی شده حاوی پاسخ نباشند، سیستم صراحتاً اعلام می‌کند که پاسخ را نمی‌داند. همین رفتار صریح و دقیق است که تعیین می‌کند آیا کارکنان به این ابزار اعتماد می‌کنند یا خیر.

همان‌طور که در تحلیل‌های پیشین ما درباره امنیت مدل‌های بازمتن اشاره کردیم، کنترل خروجی مدل در محیط‌های سازمانی حیاتی است. برای ساخت یک دستیار آماده تولید، باید از جست‌وجوی برداری ساده فراتر رفت. PicNet یک خط لوله ورود داده چندلایه را پیشنهاد می‌کند که سیاست‌های HR، دفترچه‌های عملیاتی، مستندات محصول، قراردادهای تأمین‌کنندگان و دستورالعمل‌های ایمنی را مدیریت می‌کند.

جزئیات فنی این معماری شامل موارد زیر است:

  • ورود ساختاریافته: مستندات به صورت زمان‌بندی شده از SharePoint, Confluence, فایل‌شیرها یا سیستم‌های مدیریت سند (DMS) استخراج می‌شوند. آن‌ها به متن تبدیل می‌شوند در حالی که سرفصل‌ها و شماره صفحات حفظ می‌شوند تا یک ارجاع بتواند به یک بخش خاص اشاره کند، نه اینکه کاربر را به یک فایل ۹۰ صفحه‌ای ارجاع دهد.
  • استراتژی تکه‌بندی (Chunking): سیستم متن‌ها را به جای تعداد کاراکتر ثابت، بر اساس ساختار سند تکه‌تکه‌ می‌کند. یک بند (Clause) که به همراه عنوان اصلی و عنوان والد خود بازیابی شود، بسیار مؤثرتر از ۸۰۰ کاراکتر تصادفی است که ممکن است از وسط یک جمله شروع شود.
  • غنی‌سازی متادیتا: هر تکه متن با برچسب‌هایی مثل عنوان سند، مالک، تاریخ اجرا، نسخه‌ای که جایگزین آن شده و موجودیت یا ایالت مربوطه علامت‌گذاری می‌شود. این کار اجازه می‌دهد سیستم سؤالات مربوط به ایالت کوئینزلند را از سیاست‌های ایالت ویکتوریا تفکیک کند و به کاربر بگوید که پاسخ تا یک تاریخ خاص به‌روز است.
  • نمایه‌سازی ترکیبی: سیستم از ترکیبی از بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی معنایی‌اش را مشخص می‌کند — و جست‌وجوی کلیدواژه‌ای استفاده می‌کند. جست‌وجوی برداری خالص اغلب اصطلاحات دقیق مثل کدهای طبقه‌بندی دستمزد (Award Classification Codes) یا شماره قطعات را گم می‌کند، در حالی که جست‌وجوی کلیدواژه‌ای به تنهایی مفاهیم کلی مثل «آیا می‌توانم مرخصی را با نصف حقوق بگیرم» را نمی‌فهمد. ادغام هر دو، دقت را تضمین می‌کند.
  • زیرساخت: برای شرکت‌های متوسط (SMEs) با مجموعه‌ای از داده‌ها در حد ده‌ها هزار تکه متن، استفاده از Postgres به همراه pgvector پیشنهاد می‌شود. این کار باعث می‌شود محتوای مستندات در زیرساختی بماند که پیش‌تر تحت قوانین حریم خصوصی (Privacy Act) مدیریت شده و از اضافه کردن یک تامین‌کننده جدید جلوگیری می‌کند.

قلب این سیستم، یک «قرارداد پرامپت» غیرقابل مذاکره است. دستور به مدل کوتاه و صریح است: فقط با استفاده از پاراگراف‌های شماره‌گذاری شده ارائه شده پاسخ بده، برای هر جمله حداقل به یک شناسه پاراگراف ارجاع بده و اگر اطلاعات موجود نبود، عبارت not_in_corpus را برگردان. مدل صراحتاً منع شده است که از دانش عمومی خود درباره اینکه سیاست‌ها معمولاً چگونه عمل می‌کنند استفاده کند.

مدل به جای متن آزاد، یک ساختار داده‌ای (Schema) برمی‌گرداند تا اپلیکیشن بتواند پیش از نمایش به کاربر، آن را تأیید کند:

{ "status": "answered", "answer": "Annual leave accrues progressively...", "citations": [ { "passage_id": 3, "document": "Leave Policy v4.2", "section": "5.1 Annual leave", "effective": "2025-07-01", "url": "https://.../leave-policy-v4-2.pdf#page=12" } ] }

برای جلوگیری از «خطاهای شرم‌آور»، اپلیکیشن یک بررسی تأیید انجام می‌دهد. اگر وضعیت «پاسخ داده شد» باشد اما لیست ارجاعات خالی باشد، سیستم پاسخ را حذف کرده و به جای آن، پاراگراف‌های بازیابی شده را نشان می‌دهد. اگر شناسه ارجاع داده شده در مجموعه اصلی که به مدل ارسال شده بود وجود نداشته باشد، این مورد به عنوان یک شکست (Failure) تلقی می‌شود. ارجاعات به صورت لینک مستقیم به صفحه دقیق سند منبع نمایش داده می‌شوند. این کار کارکنان را تشویق می‌کند تا روی لینک کلیک کنند، که به نوبه خود کمک می‌کند تا متوجه شوند چه زمانی یک سیاست قدیمی شده و نیاز به به‌روزرسانی دارد.

PicNet هشدار می‌دهد که هرگز نباید یک دستیار AI را بر اساس یک دموی موفق عرضه کرد. در عوض، آن‌ها یک مجموعه ارزیابی «استاندارد طلایی» را پیشنهاد می‌کنند که از داده‌های واقعی ساخته شده است:

۱. مجموعه داده مرجع (Ground Truth): جمع‌آوری ۱۰۰ تا ۲۰۰ سؤال واقعی از صندوق ورودی HR، تیکت‌های میز خدمت یا کانال‌های عملیاتی. شخصی که در حال حاضر به این سؤالات پاسخ می‌دهد باید پاسخ صحیح را بنویسد و دقیقاً به سند و بخش مربوطه ارجاع دهد. این کار شاید یک روز کاری زمان ببرد، اما ارزشمندترین روز کل پروژه است.
۲. مجموعه منفی: ایجاد ۳۰ سؤال که صراحتاً در مستندات پوشش داده نشده‌اند، از جمله سؤالاتی که به نظر می‌رسد باید پاسخشان در مستندات باشد. این کار «نرخ پاسخ‌های غلط» (False Answer Rate) را اندازه‌گیری می‌کند.
۳. تست مستمر: سیستم بر اساس این معیارها نمره می‌گیرد: آیا پاسخ درست است؟ آیا ارجاع به بخش صحیح اشاره می‌کند؟ و آیا سیستم در جای درست، پاسخ دادن را رد کرده است؟ این مجموعه‌ها هر بار که پرامپت تغییر می‌کند، نسخه مدل عوض می‌شود یا مجموعه مستندات جدیدی اضافه می‌شود، دوباره اجرا می‌شوند.

از نظر هزینه، استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند — کمترین بخش بودجه است. برای محاسبه این هزینه، تعداد توکن‌های ارسالی برای هر سؤال (پاراگراف‌های بازیابی شده، سؤال و پاسخ که معمولاً چند هزار توکن است) را در حجم ماهانه پیش‌بینی شده ضرب کنید. برای استقرار در سطح یک دپارتمان با چند هزار سؤال، این هزینه معمولاً با هزینه یک اشتراک نرم‌افزاری ساده برابر است. تبدیل بدنه مستندات به بردار (Embedding) یک هزینه یک‌باره است و برای مستندات جدید، هزینه اندکی دارد.

هزینه‌های واقعی مربوط به نیروی انسانی و مالکیت است:

  • آماده‌سازی بدنه مستندات (Corpus): این بخش بیشترین تلاش را می‌طلبد. کارکنان داخلی باید تصمیم بگیرند کدام مستندات معتبر هستند، نسخه‌های قدیمی را بازنشسته کنند و متادیتاها را پیوست کنند. این کار فارغ از اینکه هوش مصنوعی ساخته شود یا خیر، برای سازمان ارزش دارد.
  • مالکیت مستمر: مجموعه‌ای از مستندات که نگهداری نشوند، تحلیل می‌روند. یک پاسخ با اطمینان کامل که به یک سیاست منسوخ ارجاع دهد، یک ریسک بزرگ است. باید ماهانه چند ساعت زمان برای شخصی در نظر بگیرید تا پاسخ‌های علامت‌گذاری شده را بررسی کرده و بدنه مستندات را به‌روز کند.

برای محیط‌های کلینیکی، PicNet توصیه می‌کند دستیار AI فقط در امور اداری مثل برنامه‌ریزی شیفت‌ها، احراز صلاحیت‌ها (Credentialling)، تدارکات یا گردش کارهای گزارش حوادث استفاده شود. هر پاسخی که بتواند بر مراقبت از بیمار اثر بگذارد، باید لزوماً توسط یک پزشک نام‌برده تأیید و ثبت شود (به عنوان یک گام اجباری در گردش کار با رکورد تأیید)، نه اینکه فقط به یک سلب مسئولیت (Disclaimer) ساده اکتفا شود. این رویکرد با استانداردهای سخت‌گیرانه برای جلوگیری از توهمات در AI سلامت همسو است که بر اولویت امنیت بیمار تأکید دارد.

این رویکرد، نقش هوش مصنوعی را از یک عامل خلاق به یک ابزار بازیابی دقیق تغییر می‌دهد. اولویت دادن به «عدم پاسخ» نسبت به «حدس‌های مطمئن»، تنها راه ساخت اعتماد واقعی در سازمان‌ها است.

اینکه آیا یک سیستم RAG پیچیده لازم است یا خیر، به بدنه مستندات بستگی دارد. اگر یک اینترانت با ساختار خوب، سرفصل‌های مناسب و فهرست مطالب واضح برای نیازهای کم‌حجم کافی باشد، جست‌وجوی ساده کارآمدتر است. الگوی هوش مصنوعی زمانی سودآور است که مستندات طولانی باشند، ساختار بدی داشته باشند، در سیستم‌های مختلف پراکنده باشند یا وقتی سؤالات مشابه ده‌ها بار در هفته تکرار شوند. اما هوش مصنوعی زمانی که مستندات با یکدیگر در تضاد باشند کمکی نمی‌کند؛ این تضادها باید ابتدا برطرف شوند، زیرا سیستم بازیابی هر دو نسخه را پیدا می‌کند و مدل صرفاً یکی از آن‌ها را انتخاب خواهد کرد. در واقع، مدیریت دسترسی‌ها و مجوزهای هر سند در این مرحله کلیدی است، چرا که مشکلات مجوزدهی پراکنده می‌تواند منجر به دسترسی مدل به اطلاعات حساس یا متناقض شود.

گام بعدی شما

  • اگر از RAG استفاده می‌کنید، یک «مجموعه منفی» (سؤالاتی که پاسخشان در داده‌ها نیست) بسازید تا نرخ توهم مدل را بسنجید.
  • استراتژی تکه‌بندی خود را از تعداد کاراکتر ثابت به تکه‌بندی ساختاریافته (بر اساس سرفصل‌ها) تغییر دهید.
  • برای هر پاسخ مدل، اجبار کنید که لینک مستقیم به صفحه سند منبع ارائه دهد.

اما چالش اصلی در مقیاس‌های بزرگتر، مدیریت حافظه برای هزاران سند است — به تحلیل ما درباره بهینه‌سازی KV Cache در مدل‌های جدید مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی با تکیه بر تجربه استقرار در محیط‌های حساس، استانداردی برای کاهش ریسک حقوقی شرکت‌ها در استفاده از AI ایجاد می‌کند. اعتماد سازمانی تنها زمانی شکل می‌گیرد که مدل بتواند با دلیل و مدرک، «ندانستن» خود را ثابت کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال پیاده‌سازی RAG برای سازمان‌های داخلی هستند، استفاده از Postgres و pgvector مسیری کم‌هزینه و مستقل از سرویس‌های ابری تحریمی برای مدیریت داده‌های حساس است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «روانی متن» با «صحت ارجاع»، نقطه عطف تبدیل AI از یک اسباب‌بازی اداری به ابزار عملیاتی است. این رویکرد نشان می‌دهد که در محیط‌های سازمانی، ارزش مدل در آنچه «نمی‌گوید» (پرهیز از توهم) بسیار بیشتر از آنچه «می‌گوید» است. در واقع، سخت‌گیرانه کردن قراردادهای پرامپت، تنها راه خروج از بن‌بست دموی‌های موفق اما نامعتبر است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.