پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Decider: کالیبراسیون اطمینان نرخ خطای داوری را به صفر نزدیک می‌کند

·۳۰ شهریور ۱۴۰۵۲ دقیقه مطالعه
۲۷ اجرای ثبت‌شده قضاوت LLM، منتشرشده به صورت JSON
۲۷ اجرای ثبت‌شده قضاوت LLM، منتشرشده به صورت JSON
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی معیار «نرخ انتخاب» با «کالیبراسیون اطمینان»؛ TuringCorp ثابت کرد که شفافیت در میزان تردید مدل، کاربردی‌تر از افزایش اندکِ دقت کلی است.

تصور کنید یک برنامه‌نویس در حال بررسی هزاران پاسخ مدل‌های زبانی است و نمی‌داند کدام جواب‌ها قطعی هستند و کدام‌ها صرفاً حدس مدل‌اند. اینجاست که تفاوت بین «پاسخ دادن» و «دانستنِ اینکه چه زمانی حدس می‌زنیم» اهمیت پیدا می‌کند.

طبق اعلام TuringCorp در ۲۱ سپتامبر ۲۰۲۶، مدل داور Decider توانسته است به یک نقطه عطف در ارزیابی مدل‌ها برسد. یافته‌های این شرکت نشان می‌دهد وقتی این مدل زبانی به‌مثابه داور (LLM-as-a-judge) — شبیه داوری که نه تنها برنده را می‌شناسد، بلکه می‌داند چقدر به تصمیمش مطمئن است — امتیاز اطمینان کالیبره‌شده‌ای بالای ۹۰٪ ثبت می‌کند، صحت (Accuracy) پاسخ‌ها به ۹۹.۶٪ می‌رسد. این رویکرد در ادامه تلاش‌های صنعت برای استانداردسازی ارزیابی‌هاست، مشابه آنچه گوگل برای ایجاد روب‌ریک‌های بولی در ارزیابی عامل‌های هوش مصنوعی به کار گرفت.

بسیاری از خط لوله‌های ارزیابی فعلی، قضاوت‌های هوش مصنوعی را به‌صورت صفر و یک (برد یا باخت) می‌بینند. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی ساختار مدل‌ها و هرس کردن (Pruning) مدل‌های زبانی اشاره کردیم، صنعت اکنون به سمت ایجاد «درگاه‌های کیفی» دقیق‌تر حرکت می‌کند تا از توقف سیستم در برابر دو پاسخِ به‌طور مشابه خوب، جلوگیری شود. این نیاز به دقت بیشتر، به‌ویژه در مواجهه با شکاف قضاوت در عامل‌های اتوماسیون مرورگر که منجر به شکست در تشخیص صحت دستورات می‌شود، بیش از پیش احساس می‌شود.

به گزارش وب‌سایت dev.to، شرکت TuringCorp برای اثبات ادعاهای خود، ۲۷ اجرای کامل در قالب فایل‌های JSON را به‌صورت عمومی منتشر کرده است. جزئیات فنی این گزارش عبارت است از:

  • عملکرد خام: مدل Decider در محک JudgeBench با نرخ انتخاب ۹۲.۵٪، تقریباً با مدل‌های پایه (۹۲.۷٪) برابر است.
  • باند اطمینان: در بازه اطمینان ۸۰ تا ۹۰ درصد، مدل در ۹۴٪ موارد درست عمل می‌کند.
  • شفافیت داده‌ها: مجموعه داده شامل نوع تکلیف، پاسخ‌های کاندید، انتخاب نهایی، میزان اطمینان کالیبره‌شده و دلیل ذکر شده است.

این رویکرد، معیار ارزیابی هوش مصنوعی زاینده (Generative AI) — مثل نویسنده‌ای که حالا یاد گرفته است هر کجا شک دارد، علامت بزند — را تغییر می‌دهد. توسعه‌دهندگان به‌جای تلاش برای افزایش ۱ درصدی صحت کلی، می‌توانند سیستم‌های مسیریابی بسازند که پاسخ‌های کم‌اطمینان را به‌طور خودکار برای بازبینی به انسان ارجاع دهند. این شفافیت در بنچمارک‌ها برای جلوگیری از تکرار جدل‌های مربوط به داده‌های جعلی در مقایسه‌ی مدل‌هایی نظیر ChatGPT و Grok حیاتی است.

گام بعدی شما

  • مخزن گیت‌هاب TuringCorp را برای بررسی ۲۷ اجرای JSON تحلیل کنید تا متوجه شوید مدل در چه نقاطی دچار تردید می‌شود.
  • در سیستم‌های ارزیابی خود، به‌جای خروجی binary، فیلدی برای «میزان اطمینان» (Confidence Score) تعریف کنید.
  • بررسی کنید آیا این کالیبراسیون در حوزه‌های تخصصی‌تر مثل کدنویسی نیز تکرارپذیر است یا خیر.

اما چالش اصلی اینجاست که آیا این دقت در مدل‌های کوچک‌تر نیز حفظ می‌شود یا خیر؛ تحلیل ما درباره‌ی مدل‌های زبانی کوچک (SLM) این موضوع را بررسی می‌کند.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار داده‌های منتشرشده در گیت‌هاب، امکان ساخت سیستم‌های اتوماسیون با ریسک پایین را فراهم می‌کند. در نتیجه، مدل‌های زبانی از ابزارهای تجربی به ابزارهای قابل‌اعتماد صنعتی تبدیل می‌شوند.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که از مدل‌های بازمتن برای اتوماسیون استفاده می‌کنند، می‌توانند با پیاده‌سازی لایه‌ی کالیبراسیون، نرخ خطای سیستم‌های خود را بدون نیاز به مدل‌های بزرگ‌تر کاهش دهند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر کالیبراسیون به‌جای صحت خام، پارادایم ارزیابی را از «جایگزینی انسان» به «همکاری بهینه با انسان» تغییر می‌دهد. این یعنی پذیرش این واقعیت که مدل‌ها همیشه درست نمی‌گویند، اما می‌توانند به‌طور دقیق تشخیص دهند که چه زمانی احتمال خطا دارند. این رویکرد، هزینه نظارت انسانی را به‌شدت کاهش می‌دهد چون انسان فقط روی نقاط کور مدل متمرکز می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.