پرش به محتوای اصلی
پرش به محتوای مقاله

تطبیق دو مدل زبانی برای حذف توهمات در بررسی قراردادهای حقوقی

·۱۸ تیر ۱۴۰۵۳ دقیقه مطالعه
راهنما
معماری یک بازبین قرارداد مبتنی بر هوش مصنوعی با استناددهی به منابع
معماری یک بازبین قرارداد مبتنی بر هوش مصنوعی با استناددهی به منابع
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی «اعتماد به تک‌مدل» با «سیستم نظارت متقاطع»؛ در این مدل، هرگونه عدم توافق بین دو LLM به‌عنوان سیگنال هشدار برای بازبینی انسانی تعریف شده است.

تصور کنید یک اشتباه کوچک در خلاصهٔ حقوقی، کل اعتبار یک قرارداد میلیاردی را زیر سؤال ببرد. در این شرایط، شما نمی‌توانید به «احتمالاً درست بودن» جواب مدل تکیه کنید و باید مکانیزمی داشته باشید که هر ادعایی را با سند ثابت کند.

ClauseShift در ۹ جولای ۲۰۲۶ ابزاری را معرفی کرد که در آن قانون مطلق این است: «اگر مدل نتواند بند دقیق را به‌صورت کلمه به کلمه نقل کند، اجازه ندارد درباره ریسک آن اظهارنظر کند». طبق گزارش این شرکت، یک توهم (Hallucination) — شبیه دوستی که خاطره‌ای را با اطمینان اما اشتباه تعریف می‌کند — می‌تواند یک ابزار حقوقی را کاملاً بی‌فایده کند.

بسیاری از ابزارهای فعلی کاربر را مجبور می‌کنند یا کورکورانه به مدل اعتماد کند یا کل سند را دوباره بخواند؛ اتفاقی که تمام بهره‌وری را می‌گیرد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی «مبنی‌سازی» (Grounding) در مدل‌های زبانی اشاره کردیم، کلید حل این مشکل، تغییر نقش هوش مصنوعی از یک «قاضی» به یک «راهنما» است که مستقیماً به شواهد اشاره می‌کند.

به نقل از مستندات فنی توسعه‌دهنده در وب‌سایت dev.to، معماری «پریمیوم پس» (Premium Pass) از دو مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — به‌صورت موازی استفاده می‌کند: Gemini 3.1 Pro و DeepSeek V4. این دو مدل به‌طور مستقل قرارداد را بررسی کرده و سپس یافته‌های آن‌ها در یک مرحله ادغام می‌شود تا نمره ریسک ترکیبی محاسبه گردد. این رویکرد تداعی‌کننده چالش‌های پیشین در مورد جایگزینی اعتبارسنجی‌های مستقل با تکرار بررسی‌های AI است که نشان می‌دهد حتی بررسیات موازی هم ممکن است با خطاهای ریز روبرو شوند.

نکته کلیدی این است که سیستم اختلافات را پنهان نمی‌کند. اگر تنها یکی از مدل‌ها یک بند را ریسک‌دار تشخیص دهد، گزارش آن را به‌عنوان «خودتان بخوانید» علامت می‌زند. در واقع، واگرایی مدل‌ها به‌جای اینکه نویز تلقی شود، به‌عنوان یک سیگنال حیاتی برای دخالت انسان به کار می‌رود.

جزئیات پیاده‌سازی فنی

  • پشته فناوری: استفاده از Next.js روی Railway برای وب و Flutter برای نسخه‌های اندروید.
  • داده‌ها و حریم خصوصی: مدیریت کاربران توسط Supabase؛ گزارش‌ها به‌طور پیش‌فرض روی دستگاه ذخیره می‌شوند.
  • حفاظ‌ها (Guardrails): عدم آموزش مدل‌ها روی قراردادهای کاربران و حذف فوری فایل‌های آپلودشده پس از بررسی.
  • زیرساخت پرداخت: استفاده از Paystack در وب و سیستم پرداخت داخلی استورها در موبایل.

بر اساس بررسی‌های فنی، این پروژه یک شکست جدی را در مدل‌های «استدلالی» (Reasoning Model) — مدلی که قبل از جواب درنگ می‌کند، شبیه شطرنج‌بازی که چند حرکت جلوتر را می‌بیند — آشکار کرد. نویسنده اشاره کرد که مدل‌های Gemini 2.5+ گاهی تمام بودجه خروجی را صرف توکن‌های تفکری می‌کنند و پاسخی نمی‌دهند، مگر اینکه محدودیت thinkingBudget اعمال شود. همچنین برای جلوگیری از به‌هم‌ریختگی داده‌ها در زبان‌های مختلف، کلیدهای JSON در خروجی ساختاریافته همیشه انگلیسی می‌مانند.

برای کاربران، مهم‌ترین تغییر، سیاست «حاشیه انصاف» است. اگر یکی از دو مدل پریمیوم در حین اجرا شکست بخورد، کاربر گزارش مدل باقی‌مانده را دریافت می‌کند اما هزینه‌ای از اعتبار او کسر نمی‌شود تا اعتماد به محصولات پولی تقویت شود.

گام بعدی شما

  • اگر در بررسی اسناد حجیم با توهمات مدل‌ها دست‌وپنج نرم می‌کنید، معماری «بررسی متقاطع» (Cross-check) را در جریان‌های کاری خود پیاده کنید.
  • برای ارزیابی دقت این روش، از سطح رایگان ClauseShift (۳ بررسی در ماه) استفاده کنید.
  • بررسی کنید که آیا مدل‌های استدلالی شما با مشکل «تخلیه بودجه توکن» روبرو هستند یا خیر.

اما داستان مدیریت حافظه در این مدل‌ها حتی پیچیده‌تر است — به تحلیل ما درباره‌ی پنجره‌های متنی بلند در مدل‌های جدید مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با تکیه بر اعتبار (Authority) متقاطع دو مدل پیشرو، استانداردهای ایمنی در تحلیل اسناد حقوقی را جابه‌جا می‌کند. این تغییر باعث می‌شود خروجی AI از یک پیشنهاد احتمالی به یک سند مستند و قابل پیگیری تبدیل شود.

تأثیر برای ایران

به دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به ترکیب Gemini و DeepSeek برای توسعه‌دهندگان ایرانی دشوار است، اما این معماری یک الگو برای پیاده‌سازی با مدل‌های بازمتن در محیط‌های محلی است.

·نگاه ما
تحریریه دات‌هوش

رویکرد ClauseShift نشان می‌دهد که آینده‌ی کاربردهای حساس AI نه در مدل‌های بزرگ‌تر، بلکه در «تیم‌های نظارتی» از مدل‌های مختلف است. پذیرش «اختلاف‌نظر مدل‌ها» به‌عنوان یک ویژگی (Feature) به‌جای یک خطا، پارادایم جدیدی در طراحی رابط کاربری برای ابزارهای تخصصی ایجاد می‌کند؛ جایی که هوش مصنوعی به‌جای ادعای قطعیت، مناطق خاکستری را برای انسان مشخص می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.