تصور کنید یک توسعهدهنده ادعا کند عامل (Agent) او ۶۰٪ از یک وبسایت را پیمایش کرده است، اما در واقعیت تنها ۲۰.۸٪ از دادهها استخراج شده باشد. این شکاف عمیق میان ادعا و واقعیت، دلیل اصلی پیدایش Nautilus برای ایجاد سیستمی است که در آن عاملهای هوش مصنوعی در نقشهای رسمی، عملکرد یکدیگر را تأیید میکنند.
به نقل از اعلامیه این سازمان در ۵ اکتبر ۲۰۲۶، قابلیت داوری مستقل آنها اکنون برای تمامی چارچوبهای خارجی باز شده است تا بنچمارکهای «شهودی» (Vibes-based) — یعنی ارزیابیهایی که بیشتر بر اساس حس کلی توسعهدهنده است تا عدد دقیق — حذف شوند.
بسیاری از برنامهنویسان در حال حاضر به معیارهای خوداظهاری تکیه میکنند که بیشتر شبیه به یک نمایش است تا اثبات پیشرفت. همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، نبود یک داور ثالث باعث میشود اثبات قدرت واقعی یک مدل پس از تغییر پرامپت یا تعویض مدل پایه، تقریباً غیرممکن باشد. Nautilus با ایفای نقش یک دفتر مستقل، حسابها را میان عاملها بدون دخالت انسان تسویه میکند. این رویکرد در واقع پاسخی به چالشهای نظارت استاتیک در کنترل عاملهای هوش مصنوعی است که پیشتر بررسی کردیم و نشان داد چرا سیستمهای صلب در برابر ماهیت پویای عاملها ناکارآمد هستند.
برای جلوگیری از «لغزش معیارها»، این سیستم از یک چارچوب فنی سختگیرانه استفاده میکند:
- روباریکهای متصل به SHA: هر معیار داوری پیش از شروع اجرا، منجمد شده و با هش (Hash) رمزنگاری میشود تا تغییر نکند.
- محکهای استاندارد: سیستم از معیارهای شناختهشدهای چون SWE-bench Verified، GAIA و Terminal-Bench بهره میبرد.
- تکرارپذیری: گزارشها همراه با دستورات اجرای مجدد ارسال میشوند تا هر شخص ثالثی بتواند اعداد را تأیید کند.
- اصلاحات سختگیرانه: طبق مستندات، معیارها تنها میتوانند در طول زمان سختگیرتر شوند و هرگز اجازه تسهیل ندارند.
این چرخش راهبردی، صنعت را از «سوگیری اجراکننده» دور میکند؛ وضعیتی که در آن کسی که عامل را ساخته، تکالیف آن را هم تصحیح میکند. با اجبار عاملها به عبور از یک آزمون منجمد و ثالث، Nautilus استانداردی قابل تأیید برای قابلیت اطمینان عاملمحور (Agentic) ایجاد میکند و ارزیابی را از موفقیتهای پراکنده به یک حسابرسی رسمی تبدیل میکند.
در حال حاضر توسعهدهندگان میتوانند از یک lượt داوری رایگان برای دریافت گزارش تکرارپذیر استفاده کنند. همچنین قرار است در اواسط اکتبر، یک جدول ردهبندی (Leaderboard) عمومی منتشر شود تا چارچوبهای مختلف در برابر معیارهای یکسان به رقابت بپردازند.
گام بعدی شما
- اگر در حال توسعه عاملهای عملیاتی هستید، از lượt رایگان Nautilus برای سنجش فاصله ادعای خود با واقعیت استفاده کنید.
- در اواسط اکتبر، جدول ردهبندی جدید را برای شناسایی بهینهترین چارچوبهای موجود رصد کنید.
- معیارهای SHA-anchored را در گردشکار تست خود بگنجانید تا از تغییر ناخواسته استانداردهای کیفیت جلوگیری کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو