تصور کنید یک مدل هوش مصنوعی حقوقی وجود دارد که نتایج را با دقت ۱۰۰٪ پیشبینی میکند، اما در واقع فقط دارد جواب را از متن میخواند و به شما پس میدهد. در ۱۱ سپتامبر ۲۰۲۶، شرکت Rechtssysteem AI از فرآیند پاکسازی دادههایی پرده برداشت که این نشت داده را در ۶۰۹,۷۱۵ پرونده دادگاه هلند از ۹۲٪ به ۰.۱٪ کاهش داد.
بسیاری از مجموعهدادههای حقوقی آلوده هستند چون متنهای خام معمولاً شامل حکم نهایی هستند. اگر مدل عباراتی مثل «دادگاه ادعا را رد میکند» را ببیند، بهجای درک منطق حقوقی، فقط یاد میگیرد کلمات کلیدی را شناسایی کند. برای حل این مشکل، تیم توسعهدهنده یک برش پیشآموزش (Pre-training) سختگیرانه اجرا کرد تا جملات نتیجهگیری و خلاصهها را از متن حذف کند.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت دادههای آموزشی اشاره کردیم، کیفیت دادهها همیشه بر پیچیدگی مدل اولویت دارد. این موضوع یادآور ریسکهای امنیتی شدید در مهندسی معکوس دستورات هوش مصنوعی است که نشان میدهد چگونه پاسخهای مدل میتواند اطلاعات حساس آموزشی را لو دهد. به همین دلیل، توسعهدهندگان بهجای استفاده از یک مدل زبانی بزرگ (LLM) — که مثل کتابخانهداری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — از مدل LightGBM استفاده کردند تا سرعت و شفافیت را افزایش دهند.
طبق گزارش وبسایت dev.to، این رویکرد اجازه میدهد استنتاج (Inference) — یعنی همان لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — در کمتر از ۱۰ میلیثانیه و بدون نیاز به واحد پردازش گرافیکی (GPU) انجام شود. این بهینهسازی در هزینهها و سرعت، مشابه استراتژیهای مهندسی سیستم برای کاهش هزینههای استنتاج LLM است که بر بهرهوری عملیاتی تمرکز دارد. همچنین این مدل کالیبراسیون قطعی دارد؛ یعنی اگر اطمینان مدل به زیر ۵۵٪ برسد، پاسخ «اطمینان ناکافی» را برمیگرداند.
بنچمارکهای عملکرد
بر اساس مستندات منتشر شده، این مدل در اعتبارسنجی متقابل ۵-لایه به صحت (Accuracy) کلی ۷۸.۲٪ رسید، در حالی که خط پایه (Baseline) تنها ۴۳.۷٪ بود. عملکرد در حوزههای مختلف به این شرح است:
- حقوق کیفری: ۸۲.۶٪ صحت (بالاترین عملکرد).
- حقوق اداری: ۸۱.۰٪ صحت.
- حقوق مدنی: ۷۱.۰٪ صحت (به دلیل پیچیدگیهای واقعگرایانه).
این تغییر متدولوژی ثابت میکند که در پیشبینیهای حساس حقوقی، بهداشت دادهها بسیار حیاتیتر از اندازه مدل است. تیم با اولویت دادن به ساختار درختی قابل ردیابی بهجای شبکه عصبی (Neural Network) — که شبکهای از سلولهای کوچک، شبیه نقشه مترو است که سیگنال را به جواب میرساند — ابزاری ساخت که از توهم (Hallucination) رایج در هوش مصنوعی زاینده (Generative AI) جلوگیری میکند.
برای دسترسپذیر کردن این ابزار، این خط لوله اکنون به عنوان یک سرور پروتکل زمینه مدل (MCP) با هسته باز منتشر شده و رتبه Triple-A را از Glama دریافت کرده است. توسعهدهندگان اکنون میتوانند از ابزار lekkage_check برای تست نشت نتایج در متون حقوقی خود پیش از آموزش استفاده کنند.
گام بعدی شما
- اگر روی مجموعهدادههای طبقهبندی کار میکنید، ابتدا متون خود را با ابزار
lekkage_checkبرای یافتن کلمات کلیدیِ پاسخ بررسی کنید. - برای پروژههایی با حساسیت بالا، بهجای مدلهای جعبهسیاه، مدلهای درختی مثل LightGBM را برای تفسیرپذیری بیشتر امتحان کنید.
- استراتژی حذف جملات نتیجهگیری (Dictum) را در مرحله پیشپردازش دادههای خود پیاده کنید.
اما چالش اصلی در مدلهای حقوقی، تطبیق با قوانین متغیر هر کشور است — به بررسی ما دربارهی مدلهای هوش مصنوعی حاکمیتی مراجعه کنید.




گفتگو