تصور کنید میخواهید یک ترازوی صنعتی را کالیبره کنید؛ اولین قدم این است که مطمئن شوید ترازو وقتی خالی است، عدد صفر را نشان میدهد. p28-zero-diff دقیقاً همین نقطه صفر را برای مدلهای استدلالی (Reasoning Model) — مدلهایی که قبل از جواب، یک قدم درنگ میکنند و فکر میکنند، شبیه شطرنجبازی که چند حرکت جلوتر را میبیند — فراهم میکند.
در حالی که اکثر محکهای فعلی بر روی دشواری افراطی تمرکز دارند، این ابزار که در ۲۶ سپتامبر ۲۰۲۶ منتشر شد، ثابت میکند که یک تست برای ارزشمند بودن لزوماً نباید سخت باشد. هدف این است که بررسی شود آیا مدل میتواند در پاسخ به یک درخواست مستقیم، یک گزاره اثباتی معتبر اما بدیهی تولید کند یا خیر.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت و پایداری مدلهای بازمتن اشاره کردیم، بسیاری از شکستهای مدلها نه به دلیل پیچیدگی منطق، بلکه به دلیل نقص در ساختار ارزیابی رخ میدهد. این چالشها یادآور نقاط ضعفی است که در بررسی دقت مدلهای زبانی در مواجهه با ابزارهای مسموم مشاهده شد، جایی که دادههای نادرست میتوانند استدلال مدل را مختل کنند. به گزارش dev.to، این بنچمارک برای تست ساختار تسکها به Kaggle Benchmarking Challenge ارسال شده است.
جزئیات فنی این ابزار عبارت است از:
- هدف: اندازهگیری توانایی تولید یک گزاره اثباتی با درجه دشواری صفر.
- امتیاز: این محک توانست امتیاز ۱.۰ را در پلتفرم Kaggle کسب کند.
- اجرا: فرآیند امتیازدهی بدون نیاز به API خارجی یا حلکنندههای پیچیده انجام میشود.

این تغییر رویکرد نشان میدهد که وسواس صنعت بر روی بنچمارکهای «سخت»، اهمیت تأیید ساختاری را نادیده گرفته است. با رسمی کردن موارد بدیهی، توسعهدهندگان میتوانند تشخیص دهند که شکست مدل ناشی از دشواری منطق است یا نقص در مکانیزم امتیازدهی بنچمارک. در این راستا، بسیاری از متخصصان همچنان معتقدند که ارزیابی انسانی تنها معیار قابلاتکا برای همراستاسازی نهایی مدلهاست و نباید صرفاً به معیارهای خودکار اکتفا کرد.
برای متخصصان، این یعنی باید از این الگو برای شناسایی تمام سناریوهای با دشواری صفر در بازه p1 تا p50 استفاده کرد. نسخههای آینده احتمالاً داور دومی را برای ارزیابی کیفیت واقعی اثبات، فراتر از موفقیت در تولید متن، اضافه خواهند کرد.
گام بعدی شما
- اگر از چارچوبهای ارزیابی شخصی استفاده میکنید، ابتدا یک تست «دشواری صفر» برای کالیبراسیون سیستم خود طراحی کنید.
- نتایج مدلهای مختلف را در مواجهه با گزارههای بدیهی مقایسه کنید تا نرخ خطای ساختاری آنها را بسنجید.
- منتظر بهروزرسانیهای p28 برای اضافه شدن معیارهای کیفی به جای معیارهای باینری باشید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو