تصور کنید یک تغییر کوچک در یک خط کد درخواست میکنید، اما مدل هوش مصنوعی تصمیم میگیرد کل تابع را بازنویسی کند، باگهای بیربط را «اصلاح» کند یا حتی استایل نوشتاری شما را بدون اجازه تغییر دهد. این رفتار که «تجاوز از دستور» (Overreach) نامیده میشود، در محیطهای عملیاتی میتواند منجر به بروز رگرسیون (Regression) یا شکست وابستگیهای حساس در کدبیس شود.
به گزارش توسعهدهندگان این ابزار، برای کمیسازی این رفتار، محک جدیدی به نام Only What I Asked طراحی شده است تا توانایی مدل در پایبندی سختگیرانه به یک دستور واحد را، در حالی که محیط اطراف پر از «وسوسههای» اصلاحی است، بسنجد.
این بنچمارک از ۲۲ مورد آزمایشی خاص تشکیل شده است. در هر مورد، یک دستور واحد در کنار قطعهکدی قرار میگیرد که حاوی موارد وسوسهانگیز است؛ مواردی مثل یک باگ بیربط، تگهای تصویر قدیمی، نقلقولهای نامنظم یا تبهای اشتباه در Makefile. برای کسب امتیاز، مدل باید متن اصلی را دقیقاً با همان یک تغییر درخواستی بازگرداند؛ هرگونه تغییر اضافی، حتی اگر مفید به نظر برسد، به معنای شکست مدل است.
طبق مستندات این پروژه، شکستها به دو دسته تقسیم میشوند: «خطای نادیده» (Miss) که در آن دستور اصلی اجرا نشده، و «تجاوز» (Overreach) که در آن دستور اجرا شده اما بخشهای دیگر کد بهطور غیرضروری تغییر کردهاند. این چالشها در واقع نسخهای از مدیریت محدوده (Scope) هستند که سیستمهای چهارخطی برای حذف توهم و خطاهای عاملهای هوشمند نیز سعی در حل آنها دارند.
همانطور که در تحلیلهای قبلی ما دربارهی همراستاسازی مدلهای زبانی اشاره کردیم، کنترل خروجی مدلها در محیطهای تخصصی دشوارتر از چتهای عمومی است. برای بررسی اثر هشدارها، دو نوع پرامپت استفاده شد: یک پرامپت «ساده» که فقط شامل دستور بود و یک پرامپت «هشداردهنده» که صراحتاً ذکر میکرد: «هیچ چیز دیگری، حتی باگهایی که میبینی را تغییر نده».
در این آزمایش، طیف گستردهای از مدلها شامل نسخههای مختلف Claude، GPT، Gemini، Gemma و DeepSeek مورد ارزیابی قرار گرفتند. نتایج یک شکاف عمیق را نشان داد: مدلهای تراز اول مانند Claude Opus 5، GPT-6 Astra و Gemini 3.8 Flash در هر دو حالت پرامپت، امتیاز کامل ۲۲ از ۲۲ را کسب کردند که نشاندهنده سطح بالایی از پیروی از دستورات و خویشتنداری است.
با این حال، مدلهای کوچکتر یا تخصصیتر دچار مشکل شدند. GPT-5.4 nano و gpt-oss-120b نوساناتی داشتند، اما تکاندهندهترین نتیجه مربوط به DeepSeek-R1 بود. این مدل در حالت پرامپت ساده تنها ۴ امتیاز از ۲۲ گرفت و بهشدت قربانی «تجاوز از دستور» شد. جالب اینجاست که با استفاده از پرامپت هشداردهنده، امتیاز آن به ۱۶ رسید.
این یافتهها نشان میدهد در حالی که برخی مدلها دارای یک سوگیری ذاتی برای «کمکرسانی بیش از حد» هستند، برخی دیگر را میتوان با محدودیتهای منفی صریح مهار کرد. این رویکرد یادآور راهکارهای Rulestack برای کنترل عاملهای هوشمند است که بر جلوگیری از پاسخهای یکسان و مدیریت دقیق رفتار مدلها تمرکز دارد.
در نهایت، چالش Only What I Asked یک نکته حیاتی در ارزیابی مدلهای زبانی بزرگ (LLM) را برجسته میکند. در حالی که بنچمارکهای عمومی معمولاً مدلها را برای یافتن و رفع باگها پاداش میدهند، در مهندسی نرمافزار حرفهای، ارزشمندترین مدل آن است که دقیقاً همان چیزی را انجام دهد که از او خواسته شده و نه هیچ چیز بیشتر.
توانایی مقاومت در برابر وسوسهی «تمیزکاری» کد، جزئی حیاتی از قابلیت اطمینان است تا توسعهدهندگان کنترل کامل تاریخچه نسخهها (Version History) را حفظ کنند و از اثرات جانبی غیرمنتظره در نگهداری روتین جلوگیری شود. این سطح از دقت، جایگزینی برای رویکردهای غیررسمی است، مشابه آنچه در چارچوب Four-Leaf Tree برای جایگزینی لاگهای فنی با حسِ خوب در کدنویسی AI بررسی کردیم.
گام بعدی شما
- اگر از مدلهای کدنویسی برای تغییرات کوچک در پروژههای حساس استفاده میکنید، از «پرامپتهای منفی» (Negative Constraints) برای جلوگیری از تغییرات ناخواسته استفاده کنید.
- در هنگام پذیرش (Accept) تغییرات پیشنهادی AI، بهجای بررسی کلی، روی Diffهای کوچک تمرکز کنید تا تغییرات پنهان در بخشهای بیربط را شناسایی کنید.
- مدلهای کوچکتر را برای کارهای حساس کدنویسی بدون نظارت دقیق به کار نگیرید، زیرا احتمال Overreach در آنها بهمراتب بیشتر است.
اما تأثیر این دقت در مدلهای استدلالی بر کاهش هزینههای استنتاج حتی پیچیدهتر است — به تحلیل ما دربارهی بهینهسازی توکنها در مدلهای Reasoning مراجعه کنید.




گفتگو