اگر امروز برای بازبینی قراردادهای حساس روی مدلهای کوچک و محلی حساب میکنید، باید بدانید که احتمال خطای آنها با یک پرتاب سکه برابری میکند. دادههای جدید نشان میدهد که مدلهای زبانی کوچک (SLM) — شبیه به دستیاران تازهکاری که سریع هستند اما جزئیات حیاتی را نادیده میگیرند — هنوز توانایی استخراج دقیق حقایق در حوزههای تخصصی را ندارند.
این یافتهها در حالی منتشر میشود که شرکتها برای حفظ حریم خصوصی، به دنبال استقرار هوش مصنوعی در محیطهای بسته هستند. همانطور که در تحلیل قبلی ما دربارهی جایگزینی مدلهای تصمیمگیر محدود با LLMها در حلقههای عامل اشاره کردیم، دقت در حوزههای حرفهای اولویت دارد و مدلهای عمومی کوچک در این زمینه شکست میخورند. در همین راستا، برای مدیریت بهینه این مدلها در محیطهای محلی، ۱۱ چارچوب متنباز برای مدیریت عاملهای هوش مصنوعی معرفی شدهاند که میتوانند در سازماندهی این ابزارها کمک کنند.
طبق گزارش وبسایت dev.to، محک ContractClarity در ۵ اکتبر ۲۰۲۶ دو مدل با وزنهای باز (Open Weights) — یعنی مدلهایی که دستور پخت آنها علناً منتشر شده — را روی پلتفرم Kaggle مورد آزمایش قرار داد: Qwen2.5-1.5B-Instruct و TinyLlama-1.1B-Chat-v1.0. این ارزیابی بر دو مهارت کلیدی تمرکز داشت:
- استخراج ساختاریافته حقایق: استخراج ۶ فیلد مشخص (نام مشتری، ارائهدهنده، تاریخ اجرا، قانون حاکم، اخطار فسخ و سقف مسئولیت) در یک قالب سختگیرانه.
- صحت پرسشوپاسخ قرارداد: پاسخ به ۶ سؤال درباره شرایط پرداخت، محرمانگی و بندهای تمدید از طریق تطبیق دقیق متنی.
بر اساس مستندات این محک، هر دو مدل دقیقاً با نرخ صحت ۵۰.۰٪ (۳ از ۶) در بخش پرسشوپاسخ برابر شدند. در این ارزیابی هیچ امتیازی برای پاسخهای «نزدیک» در نظر گرفته نشد؛ زیرا در دنیای حقوقی، یک اشتباه کوچک در تاریخ یا مبلغ قرارداد میتواند منجر به خسارات مالی سنگین شود.
این نتیجه بهویژه برای مدل Qwen2.5-1.5B غافلگیرکننده است، چون معماری جدیدتر و پارامترهای بیشتری نسبت به TinyLlama-1.1B دارد. این تساوی ثابت میکند که در حوزههایی با نیاز به دقت بالا، افزایش اندک مقیاس مدل لزوماً به بهبود عملکرد منجر نمیشود.
برای یک کاربر عملی، این یعنی دستیاری حقوقی که به مدل ۱.۵ میلیارد پارامتری تکیه کند، نیمی از جزئیات حیاتی سند را از دست میدهد. این مدلها در حال حاضر پایینتر از آستانه توانمندی لازم برای بازبینی بدون نظارت قرار دارند.
در این حوزه، تفاوتهای معماری و آموزشهای تخصصی بسیار مهمتر از تعداد خام پارامترها (Parameters) است. پیشرفتهای مدلهای پیشرو هنوز به شکلی که قابلیت اطمینان حقوقی را تضمین کند، به مدلهای بسیار کوچک منتقل نشده است. این چالش باعث میشود سازمانها برای انتخاب مدل بهینه، به جای تکیه بر اندازه، از معیار «مرز ارزش» برای انتخاب مدل بر اساس بودجه استفاده کنند تا تعادلی میان هزینه و دقت برقرار سازند.
گام بعدی شما
- برای کارهای حساس حقوقی، از مدلهای کوچک به عنوان ابزار اول استفاده نکنید و حتماً خروجی را بازبینی کنید.
- اگر به دنبال استقرار محلی هستید، مدلهای ۷ میلیارد پارامتری به بالا را تست کنید.
- منتظر نتایج مقایسهای مدلهای ۷۰ میلیارد پارامتری در برابر APIهای پیشرو باشید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو