پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Tenet نرخ تکمیل وظایف حقوقی را در بنچمارک LAB دو برابر کرد

·۱ شهریور ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
هاروی تنت: مدل کیمی K3 پس‌آموزش‌شده با فایروورکز برای کارهای پیچیده حقوقی
هاروی تنت: مدل کیمی K3 پس‌آموزش‌شده با فایروورکز برای کارهای پیچیده حقوقی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از یادگیری تقویتی (RL) برای آموزش «رفتار عامل» به‌جای «تولید پاسخ» در حوزه حقوقی؛ به‌طوری که بدون نیاز به داده‌های خارجی، توانایی مدل در حل مسائل جدید حقوقی افزایش یافته است.

تصور کنید یک دستیار حقوقی بتواند هزاران صفحه سند ادغام و تملک را بررسی کند و بدون خطای منطقی، تمام معیارهای سخت‌گیرانه یک شریک ارشد را برآورده سازد. مدل Tenet دقیقاً برای همین هدف طراحی شده تا فاصله میان چت‌بات‌های ساده و عامل‌های خودمختار در محیط‌های حساس حقوقی را پر کند.

به نقل از مستندات منتشر شده در ۲۰ اوت ۲۰۲۶، این مدل در بنچمارک داخلی Legal Agent Benchmark (LAB) توانسته است نرخ تکمیل وظایف را تقریباً دو برابر مدل پایه کند. این مدل جدید از شرکت Harvey، نقطه عطفی در خودمختاری عامل‌های هوش مصنوعی برای تحلیل‌های حقوقی محسوب می‌شود. این پیشرفت در حالی رخ می‌دهد که شرکت‌های حقوقی برای عبور از رابط‌های ساده‌ی چت به سمت عامل‌های خودمختاری که قادر به مدیریت جریان‌های کاری پیچیده و چندمرحله‌ای باشند، در تکاپو هستند. در حالی که مدل‌های عمومی اغلب در استدلال‌های سخت‌گیرانه و طولانی‌مدت (Long-horizon reasoning) مورد نیاز برای عملیات ادغام و تملک (M&A) یا بازبینی قراردادها (Redlining) شکست می‌خورند، Tenet به‌طور خاص برای این مسیرهای حساس طراحی شده است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، توازن میان قدرت استدلال و حفظ دانش پایه همواره یک چالش بوده است. Tenet یک مدل ساخته شده از صفر نیست، بلکه یک چک‌پوینت پس‌آموزش‌دیده (Post-trained checkpoint) از مدل پایه Kimi K3 است. طبق گزارش Marktechpost، شرکت Harvey از یادگیری تقویتی (RL) ناهمگام از طریق Fireworks استفاده کرد تا رفتار مدل را در محیط‌های شبیه‌سازی شده (Sandboxed) حقوقی اصلاح کند. این رویکرد یادآوری‌کننده‌ی توسعه‌ی مدل GLM-5.3 است که در آن مقیاس‌پذیری پس‌آموزش منجر به ظهور توانایی‌های غیرمنتظره در زنجیره‌سازی اکسپلویت‌های سایبری شد.

فرآیند آموزش این مدل از نظر محاسباتی بسیار متمرکز و سنگین بوده است؛ به‌طوری که حدود ۱۵۰ واحد پردازش گرافیکی NVIDIA B300 طی یک دوره دو ماهه به کار گرفته شدند. تیم توسعه از متد GSPO با یک لایه لورا (LoRA) با رتبه ۶۴ روی کل شبکه K3 استفاده کردند تا سیاست‌های مدل را بهینه کنند. ساختار آموزشی شامل هشت گروه وظیفه بود که در هر گام بهینه‌ساز، هشت اجرای مجدد (Rollout) داشتند. این فرآیند حدود ۱۷۵۰ محیط مختلف و بیش از ۱۰,۰۰۰ اجرای مجدد در هر اپوک (Epoch) را در بر می‌گرفت.

برای جلوگیری از حفظ طوطی‌وار پاسخ‌ها و اطمینان از اینکه مدل صرفاً جواب‌ها را به خاطر نمی‌سپارد، مجموعه‌ای از داده‌های مصنوعی، داده‌های عمومی حقوقی و نظرات خبرگان انسانی ترکیب شد. شرکت Harvey صراحتاً اعلام کرده است که در این مرحله از پس‌آموزش، هیچ‌گونه داده‌ای از مشتریان استفاده نشده است. شرکت Fireworks در سطح کرنل (Kernel level)، توسعه‌دهنده Trainer و استقرار Rolloutها بود و از تکنیک‌های token-in-token-out و router replay استفاده کرد تا مدل بزرگ Mixture-of-Experts (MoE) را از نظر عددی در مراحل آموزش و استنتاج هم‌راستا نگه دارد.

ساختار آموزش Tenet بر اساس محیط‌های ایزوله‌ای طراحی شده که وظایف واقعی حقوقی را شبیه‌سازی می‌کنند. هر وظیفه معمولاً شامل یک دستورالعمل در سطح شریک ارشد (به طور متوسط ۵۰ کلمه)، یک پرونده مشتری حاوی اسناد کلیدی و حاشیه‌ای، و یک دفترچه ارزیابی (Rubric) تخصصی است. این دفترچه شامل حدود ۵۰ معیار اتمی «پذیرش یا رد» است که در موارد بسیار پیچیده به صدها معیار می‌رسد. به دلیل ماهیت طولانی‌مدت این وظایف، یک اجرای واحد می‌تواند بیش از ۱۰۰۰ نوبت تعامل (Turn) داشته باشد. برای امتیازدهی به این نتایج، از یک مدل زبانی به‌مثابه داور (LLM-as-a-judge) استفاده شده است که پس از بررسی‌های مختلف، مدل Kimi 2.6 برای این نقش انتخاب شد. تابع پاداش (Reward function) ترکیبی از سه عامل است:
۱. کسری از معیارهای دفترچه ارزیابی که برآورده شده‌اند.
۲. شمارش کلی مسائل حقوقی حل شده.
۳. یک پاداش ویژه (Bonus) برای تکمیل تمامی معیارها (All-pass).

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

نتایج به‌دست‌آمده در بنچمارک داخلی LAB نشان‌دهنده جهشی قابل‌توجه است:

  • وظایف عمومی LAB: نرخ تکمیل تقریباً ۲ برابر مدل پایه Kimi K3.
  • بخش قراردادها (LAB: Contracts): ۲۰٪ افزایش در تکمیل وظایف و رشد ۲ درصدی در نرخ پذیرش کامل (All-pass rate).
  • نرخ کلی پذیرش: افزایش ۹ درصدی در تمامی دسته‌ها.

گزارش‌های Harvey نشان می‌دهد که این مدل در بخش قراردادهای LAB به عملکرد پیشرو (SOTA) رسیده و در بخش عمومی LAB رتبه دوم را دارد. یکی از حیاتی‌ترین یافته‌ها، اثر «انتقال» (Transfer) است. Tenet توانست عملکرد خود را در Mercor’s APEX Agents (حقوق شرکتی) و Crosby’s Redline Bench بهبود بخشد، در حالی که در زمان آموزش هرگز این مجموعه‌داده‌ها را ندیده بود. این امر نشان می‌دهد مدل به جای برازش روی یک بنچمارک خاص، «رفتارهای عامل‌محور» کلی در حوزه حقوق را آموخته است.

نکته بسیار مهم این است که این آموزش‌های عامل‌محور باعث تخریب دانش حقوقی پایه مدل نشده است. عملکرد مدل در بنچمارک‌های متنی استاندارد از جمله LegalBench، CUAD، MAUD و PRBench شرکت Scale ثابت مانده است. در یک تست خاص روی زیرمجموعه سخت PRBench، امتیاز مدل از ۳۶.۰٪ به ۳۶.۸٪ تغییر کرد که Harvey این تغییر را از نظر آماری غیرمعنی‌دار دانست و آن را دلیلی بر عدم وقوع «فراموشی فاجعه‌بار» (Catastrophic Forgetting) معرفی کرد. در این راستا، بررسی دقیق متدولوژی‌های استخراج تاریخ قطع دانش در مدل‌های بزرگ می‌تواند درک بهتری از نحوه حفظ و بازیابی دانش پایه در مدل‌های تخصصی ارائه دهد.

علاوه بر مدل اصلی، Harvey سه قابلیت تخصصی را توسعه داده است که Tenet می‌تواند به عنوان ابزار یا زیر-عامل به آن‌ها ارجاع دهد:

۱. بررسی‌های Due Diligence در M&A:
این قابلیت از یک مدل زبانی بازگشتی (RLM) استفاده می‌کند که در آن یک عامل ریشه (Root Agent)، اتاق داده‌ها (Dataroom) را در یک محیط REPL نگه می‌دارد و وظایف را از طریق Baseten به زیر-عامل‌ها تفویض می‌کند. در بنچمارک LAB: Diligence، جایی که یک وظیفه می‌تواند تا ۸۰ میلیون توکن را پیمایش کند، نرخ پذیرش معیارها پس از پس‌آموزش از طریق خود-تقطیری (Self-distillation)، از ۴۳.۸٪ (پایه) به ۶۰.۱٪ رسید. در حالی که یک ارکستراتور GLM-5.2 به تنهایی تنها به ۴۶.۱٪ رسیده بود.

۲. جدول بازبینی (Review Table):
این ابزار یک مدل GLM-5.2 پس‌آموزش‌دیده است که با همکاری Applied Compute توسعه یافته است. این مدل کیفیت پاسخ‌ها را ۳.۶ امتیاز و کیفیت استنادها را ۱۲.۱ امتیاز بهبود بخشید. همچنین یاد گرفت در صورتی که سوالی کاربرد نداشته باشد، از پاسخ دادن خودداری کند (Abstain) و با هزینه‌ای تقریباً یک‌دهم مدل پایه در هر سلول عمل کند.

۳. دانش شرکت (Firm Knowledge):
با بهره‌گیری از Engram و مدل Qwen3.8-27B، این سیستم حدود ۱۰۰ میلیون توکن از پرونده‌های مشتریان را مطالعه می‌کند تا ۱ میلیون توکن دانش ساختاریافته به همراه حافظه پارامتریک ایجاد کند. در نتیجه، نرخ پذیرش معیارها بیش از ۱۵٪ افزایش یافت، در حالی که تعداد توکن‌های مصرف شده در مسیرهای تکمیل شده ۵۸٪ کاهش یافت. هزینه هر پرس‌وجو نیز تقریباً ۹۰٪ افت کرد.

در لایه بهینه‌سازی، Harvey از تضاد معمول بین کیفیت و هزینه اجتناب کرد. با استفاده از شکل‌دهی پاداش (Reward shaping) که مسیرهای کوتاه‌تر را برای کیفیت برابر ترجیح می‌دهد، مدل توکن‌های کمتری مصرف می‌کند. این رویکرد، در کنار استفاده از مدل‌های پایه با وزن‌های باز برای کاهش قیمت هر توکن، اجازه داد تا کیفیت به طور قابل توجهی افزایش یابد در حالی که هزینه ثابت ماند.

در ماژول دانش شرکت، شاخص «هوش در هر توکن» به ۱۹۰.۸ رسید، در حالی که این مقدار برای بهترین پیکربندی‌های پیشرو (Frontier) برابر با ۱۲۹.۳ بود. در شبکه‌های اجتماعی، Harvey ادعا کرد که هزینه این مدل کمتر از یک‌چهارم مدل‌های بنیادین پیشرو است، هرچند نام رقبای خاصی ذکر نشد.

با وجود این پیشرفت‌های فنی، Tenet فعلاً در مرحله پیش‌نمایش پژوهشی است. Harvey هنوز وزن‌های مدل، کارت مدل (Model Card) یا یک نقطه اتصال API عمومی را منتشر نکرده است. در حالی که مدل پایه Kimi K3 بازمتن است، Tenet خود یک چک‌پوینت اختصاصی و تجاری است. شرکت قصد دارد این دستاوردها را از محیط پژوهشی به تولید در پلتفرم موجود خود منتقل کند. این پلتفرم به لایه‌های سازمانی شامل موارد زیر فروخته می‌شود:

  • شرکت‌های حقوقی بزرگ و متوسط.
  • تیم‌های حقوقی داخلی (In-house).
  • شرکت‌های سهام خصوصی و بانک‌های سرمایه‌گذاری (به‌ویژه برای بررسی‌های M&A).
  • بخش‌های تحت نظارت با حجم بالای قرارداد مانند بیمه، خدمات مالی، بهداشت و انرژی.

کاربردهای عملی این سیستم شامل تدوین یادداشت‌های بررسی (Due Diligence) روی اتاق‌های داده، پیش‌نویس قراردادها، بازبینی و اصلاح (Redlining)، استخراج ساختاریافته از حداکثر ۱۰,۰۰۰ سند و جستجوی سوابق (Precedent search) در دانش انباشته شده شرکت است.

تحلیل تحریریه

برای جامعه فنی، Tenet نشان‌دهنده تغییری در نحوه ساخت هوش مصنوعی تخصصی است. به جای تکیه بر مجموعه‌های عظیم Fine-tuning، شرکت Harvey از RL در محیط‌های ایزوله استفاده می‌کند تا به مدل «چگونگی» پیشبرد یک پرونده حقوقی را بیاموزد، نه اینکه صرفاً «چه» پاسخی درست است.

مهم‌ترین دستاورد، جداسازی مهارت‌های عامل‌محور از دانش است. با اثبات اینکه RL برای وظایف طولانی‌مدت باعث تخریب استدلال‌های کتابخانه‌ای نمی‌شود، Harvey نقشه‌ای برای سایر صنایع تحت نظارت (مانند بهداشت یا مالی) ارائه داد تا عامل‌های تخصصی بسازند بدون اینکه ریسک «فراموشی فاجعه‌بار» را بپذیرند.

با این حال، تکیه بر بنچمارک‌های داخلی (LAB) به این معناست که صنعت باید منتظر تایید شخص ثالث بماند. تحلیل Marktechpost به چندین «بازی با مخرج» (Denominator games) اشاره کرد و خاطرنشان کرد که افزایش ۹ درصدی در LAB، در شبکه X به صورت افزایش ۸۲٪ بازنمایی شده تا تاثیرگذارتر به نظر برسد. علاوه بر این، ادعای SOTA در بخش قراردادهای LAB بر اساس بنچمارکی است که توسط خود Harvey مالکیت و نمره‌گذاری شده است.

تاییدیه و پرچم‌های هشدار

سایت Marktechpost یک تست مستقل از ادعاها انجام داد که در آن ۱۰ مورد تایید و ۶ مورد به عنوان غیرقابل تایید یا گمراه‌کننده علامت‌گذاری شد. پرچم‌های کلیدی عبارتند از:

  • بازی با مخرج: افزایش‌های ۹ و ۲ درصدی در LAB به صورت ۸۲٪ و ۲۲٪ در X گزارش شدند تا چشم‌گیرتر باشند.
  • گزارش‌دهی داخلی: ادعای SOTA در LAB: Contracts بر اساس بنچمارکی است که توسط خود Harvey اداره می‌شود و بدون لیدربورد عمومی عرضه شده است.
  • عدم تطابق تنظیمات: در APEX Agents، مدل Tenet از یک محیط Bash اختصاصی استفاده کرد که مدل پایه K3 را حتی قبل از آموزش از ۵۸.۸٪ به ۶۷.۵٪ رساند، که مقایسه با رقبایی که از محیط Mercor استفاده کردند را دشوار می‌کند.
  • قابلیت دسترسی: در حالی که Kimi K3 بازمتن است، Tenet اختصاصی است. برخی رسانه‌ها به اشتباه Tenet را به عنوان یک مدل بازمتن معرفی کردند.

با وجود این هشدارها، Harvey با سفارش یک اجرای کور (Blind run) از Mercor برای APEX v1 و اعلام داوطلبانه یک نتیجه خنثی در زیرمجموعه سخت PRBench، مقداری شفافیت ایجاد کرد.

باید منتظر انتقال این چک‌پوینت‌های پژوهشی به API تولیدی بود، زیرا این امر تعیین می‌کند که آیا نرخ تکمیل وظایف ۲ برابری در مواجهه با داده‌های واقعی و نامنظم حقوقی نیز پابرجا می‌ماند یا خیر.

گام بعدی شما

  • اگر در حوزه حقوقی فعالیت می‌کنید، روی قابلیت‌های «عامل‌محور» (Agentic) به‌جای چت‌بات‌های ساده تمرکز کنید.
  • بررسی کنید که آیا جریان‌های کاری شما قابلیت تبدیل به «معیارهای پذیرش» (Rubrics) برای آموزش مدل‌های تخصصی را دارد یا خیر.
  • منتظر انتشار نتایج شخص ثالث برای بنچمارک LAB باشید تا واقع‌بینانه از توانایی‌های این مدل ارزیابی کنید.

اما تأثیر این رویکرد بر کاهش هزینه‌های استنتاج در مقیاس سازمانی حتی جذاب‌تر است — به تحلیل ما درباره‌ی بهینه‌سازی‌های لایه Kernel در مدل‌های MoE مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار متدولوژی RL در محیط‌های ایزوله، استانداردی جدید برای خودمختاری در کارهای حقوقی تعریف می‌کند. انتقال مهارت از یک بنچمارک به بنچمارک دیگر، نشان می‌دهد که ما از عصر «تولید متن» به عصر «اجرای وظیفه» در دامنه‌های تخصصی حرکت کرده‌ایم.

تأثیر برای ایران

به‌دلیل ماهیت تخصصی و بسته بودن APIهای Harvey، دسترسی مستقیم برای کاربران ایرانی محدود است؛ اما متدولوژی آموزش آن برای توسعه‌دهندگان مدل‌های تخصصی در ایران الگوبرداری‌پذیر است.

·نگاه ما
تحریریه دات‌هوش

جداسازی مهارت‌های عامل‌محور از دانش پایه، مهم‌ترین دستاورد Tenet است. این مدل ثابت کرد می‌توان بدون ریسک تخریب استدلال‌های کتابی، به مدل آموزش داد که «چگونه» یک پرونده را پیش ببرد. این الگو می‌تواند نقشه راهی برای صنایع تنظیم‌شده دیگر مثل پزشکی یا مالی باشد تا عامل‌های تخصصی بسازند بدون اینکه مدل در مفاهیم بنیادین دچار خطا شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.