تصور کنید یک برنامهنویس در حال بررسی هزاران پاسخ مدلهای زبانی است و نمیداند کدام جوابها قطعی هستند و کدامها صرفاً حدس مدلاند. اینجاست که تفاوت بین «پاسخ دادن» و «دانستنِ اینکه چه زمانی حدس میزنیم» اهمیت پیدا میکند.
طبق اعلام TuringCorp در ۲۱ سپتامبر ۲۰۲۶، مدل داور Decider توانسته است به یک نقطه عطف در ارزیابی مدلها برسد. یافتههای این شرکت نشان میدهد وقتی این مدل زبانی بهمثابه داور (LLM-as-a-judge) — شبیه داوری که نه تنها برنده را میشناسد، بلکه میداند چقدر به تصمیمش مطمئن است — امتیاز اطمینان کالیبرهشدهای بالای ۹۰٪ ثبت میکند، صحت (Accuracy) پاسخها به ۹۹.۶٪ میرسد. این رویکرد در ادامه تلاشهای صنعت برای استانداردسازی ارزیابیهاست، مشابه آنچه گوگل برای ایجاد روبریکهای بولی در ارزیابی عاملهای هوش مصنوعی به کار گرفت.
بسیاری از خط لولههای ارزیابی فعلی، قضاوتهای هوش مصنوعی را بهصورت صفر و یک (برد یا باخت) میبینند. همانطور که در تحلیل قبلی ما دربارهی بهینهسازی ساختار مدلها و هرس کردن (Pruning) مدلهای زبانی اشاره کردیم، صنعت اکنون به سمت ایجاد «درگاههای کیفی» دقیقتر حرکت میکند تا از توقف سیستم در برابر دو پاسخِ بهطور مشابه خوب، جلوگیری شود. این نیاز به دقت بیشتر، بهویژه در مواجهه با شکاف قضاوت در عاملهای اتوماسیون مرورگر که منجر به شکست در تشخیص صحت دستورات میشود، بیش از پیش احساس میشود.
به گزارش وبسایت dev.to، شرکت TuringCorp برای اثبات ادعاهای خود، ۲۷ اجرای کامل در قالب فایلهای JSON را بهصورت عمومی منتشر کرده است. جزئیات فنی این گزارش عبارت است از:
- عملکرد خام: مدل Decider در محک JudgeBench با نرخ انتخاب ۹۲.۵٪، تقریباً با مدلهای پایه (۹۲.۷٪) برابر است.
- باند اطمینان: در بازه اطمینان ۸۰ تا ۹۰ درصد، مدل در ۹۴٪ موارد درست عمل میکند.
- شفافیت دادهها: مجموعه داده شامل نوع تکلیف، پاسخهای کاندید، انتخاب نهایی، میزان اطمینان کالیبرهشده و دلیل ذکر شده است.
این رویکرد، معیار ارزیابی هوش مصنوعی زاینده (Generative AI) — مثل نویسندهای که حالا یاد گرفته است هر کجا شک دارد، علامت بزند — را تغییر میدهد. توسعهدهندگان بهجای تلاش برای افزایش ۱ درصدی صحت کلی، میتوانند سیستمهای مسیریابی بسازند که پاسخهای کماطمینان را بهطور خودکار برای بازبینی به انسان ارجاع دهند. این شفافیت در بنچمارکها برای جلوگیری از تکرار جدلهای مربوط به دادههای جعلی در مقایسهی مدلهایی نظیر ChatGPT و Grok حیاتی است.
گام بعدی شما
- مخزن گیتهاب TuringCorp را برای بررسی ۲۷ اجرای JSON تحلیل کنید تا متوجه شوید مدل در چه نقاطی دچار تردید میشود.
- در سیستمهای ارزیابی خود، بهجای خروجی binary، فیلدی برای «میزان اطمینان» (Confidence Score) تعریف کنید.
- بررسی کنید آیا این کالیبراسیون در حوزههای تخصصیتر مثل کدنویسی نیز تکرارپذیر است یا خیر.
اما چالش اصلی اینجاست که آیا این دقت در مدلهای کوچکتر نیز حفظ میشود یا خیر؛ تحلیل ما دربارهی مدلهای زبانی کوچک (SLM) این موضوع را بررسی میکند.




گفتگو