پرش به محتوای اصلی
پرش به محتوای مقاله

«ناکارآمد برای حقوق»؛ ارزیابی جدید از مدل‌های زبانی کوچک

·۱۳ مهر ۱۴۰۵۳ دقیقه مطالعه
نمودار مقایسه دقت مدل‌های زبانی در درک قراردادهای حقوقی
نمودار مقایسه دقت مدل‌های زبانی در درک قراردادهای حقوقی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات اینکه افزایش پارامترها در مقیاس مدل‌های بسیار کوچک (۱ تا ۲ میلیارد)، تأثیری بر صحت استخراج داده‌های حقوقی ندارد و هر دو مدل در سطح ۵۰٪ متوقف شده‌اند.

اگر امروز برای بازبینی قراردادهای حساس روی مدل‌های کوچک و محلی حساب می‌کنید، باید بدانید که احتمال خطای آن‌ها با یک پرتاب سکه برابری می‌کند. داده‌های جدید نشان می‌دهد که مدل‌های زبانی کوچک (SLM) — شبیه به دستیاران تازه‌کاری که سریع هستند اما جزئیات حیاتی را نادیده می‌گیرند — هنوز توانایی استخراج دقیق حقایق در حوزه‌های تخصصی را ندارند.

این یافته‌ها در حالی منتشر می‌شود که شرکت‌ها برای حفظ حریم خصوصی، به دنبال استقرار هوش مصنوعی در محیط‌های بسته هستند. همان‌طور که در تحلیل قبلی ما درباره‌ی جایگزینی مدل‌های تصمیم‌گیر محدود با LLMها در حلقه‌های عامل اشاره کردیم، دقت در حوزه‌های حرفه‌ای اولویت دارد و مدل‌های عمومی کوچک در این زمینه شکست می‌خورند. در همین راستا، برای مدیریت بهینه این مدل‌ها در محیط‌های محلی، ۱۱ چارچوب متن‌باز برای مدیریت عامل‌های هوش مصنوعی معرفی شده‌اند که می‌توانند در سازماندهی این ابزارها کمک کنند.

طبق گزارش وب‌سایت dev.to، محک ContractClarity در ۵ اکتبر ۲۰۲۶ دو مدل با وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پخت آن‌ها علناً منتشر شده — را روی پلتفرم Kaggle مورد آزمایش قرار داد: Qwen2.5-1.5B-Instruct و TinyLlama-1.1B-Chat-v1.0. این ارزیابی بر دو مهارت کلیدی تمرکز داشت:

  • استخراج ساختاریافته حقایق: استخراج ۶ فیلد مشخص (نام مشتری، ارائه‌دهنده، تاریخ اجرا، قانون حاکم، اخطار فسخ و سقف مسئولیت) در یک قالب سخت‌گیرانه.
  • صحت پرسش‌وپاسخ قرارداد: پاسخ به ۶ سؤال درباره شرایط پرداخت، محرمانگی و بندهای تمدید از طریق تطبیق دقیق متنی.

بر اساس مستندات این محک، هر دو مدل دقیقاً با نرخ صحت ۵۰.۰٪ (۳ از ۶) در بخش پرسش‌وپاسخ برابر شدند. در این ارزیابی هیچ امتیازی برای پاسخ‌های «نزدیک» در نظر گرفته نشد؛ زیرا در دنیای حقوقی، یک اشتباه کوچک در تاریخ یا مبلغ قرارداد می‌تواند منجر به خسارات مالی سنگین شود.

این نتیجه به‌ویژه برای مدل Qwen2.5-1.5B غافلگیرکننده است، چون معماری جدیدتر و پارامترهای بیشتری نسبت به TinyLlama-1.1B دارد. این تساوی ثابت می‌کند که در حوزه‌هایی با نیاز به دقت بالا، افزایش اندک مقیاس مدل لزوماً به بهبود عملکرد منجر نمی‌شود.

برای یک کاربر عملی، این یعنی دستیاری حقوقی که به مدل ۱.۵ میلیارد پارامتری تکیه کند، نیمی از جزئیات حیاتی سند را از دست می‌دهد. این مدل‌ها در حال حاضر پایین‌تر از آستانه توانمندی لازم برای بازبینی بدون نظارت قرار دارند.

در این حوزه، تفاوت‌های معماری و آموزش‌های تخصصی بسیار مهم‌تر از تعداد خام پارامترها (Parameters) است. پیشرفت‌های مدل‌های پیشرو هنوز به شکلی که قابلیت اطمینان حقوقی را تضمین کند، به مدل‌های بسیار کوچک منتقل نشده است. این چالش باعث می‌شود سازمان‌ها برای انتخاب مدل بهینه، به جای تکیه بر اندازه، از معیار «مرز ارزش» برای انتخاب مدل بر اساس بودجه استفاده کنند تا تعادلی میان هزینه و دقت برقرار سازند.

گام بعدی شما

  • برای کارهای حساس حقوقی، از مدل‌های کوچک به عنوان ابزار اول استفاده نکنید و حتماً خروجی را بازبینی کنید.
  • اگر به دنبال استقرار محلی هستید، مدل‌های ۷ میلیارد پارامتری به بالا را تست کنید.
  • منتظر نتایج مقایسه‌ای مدل‌های ۷۰ میلیارد پارامتری در برابر APIهای پیشرو باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این داده‌ها اعتبار تکیه بر مدل‌های SLM برای کارهای حساس را زیر سؤال می‌برد. تخصص در استخراج داده‌های حقوقی نیازمند معماری‌های خاص است، نه فقط مدل‌های کوچک‌تر و سریع‌تر.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که به دلیل محدودیت‌های API به دنبال مدل‌های محلی و کوچک هستند، این خبر هشدار می‌دهد که این مدل‌ها برای اتوماسیون اسناد حقوقی فارسی یا انگلیسی قابل اعتماد نیستند.

·نگاه ما
تحریریه دات‌هوش

تساوی عملکرد مدل‌های ۱.۱ و ۱.۵ میلیارد پارامتری نشان می‌دهد که در حوزه‌های تخصصی، ما با یک «دیوار مقیاس» روبرو هستیم. افزایش خطی پارامترها در مدل‌های کوچک، جهشی در دقت ایجاد نمی‌کند و تنها راه عبور از این بن‌بست، آموزش روی داده‌های تخصصی (Domain-specific) است، نه تکیه بر توانمندی‌های عمومی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.