پرش به محتوای اصلی
پرش به محتوای مقاله

شکست مدل‌های کدنویسی AI در رعایت محدودیت‌های منفی

·۳ مهر ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
تحلیل
هوش مصنوعی درست می‌گفت، اما پاسخ باز هم اشتباه بود.
هوش مصنوعی درست می‌گفت، اما پاسخ باز هم اشتباه بود.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تفکیک معیار «صحت فنی» از «پایبندی به دستورات» در یک محک واحد؛ این اولین بار است که ثابت می‌شود حل درست مسئله لزوماً به معنای پیروی از محدودیت‌های منفی نیست.

تصور کنید از یک برنامه‌نویس ارشد می‌خواهید باگی را رفع کند اما تأکید می‌کنید که از یک کتابخانه خاص استفاده نکند؛ او کد را درست می‌نویسد اما دقیقاً از همان کتابخانه ممنوعه استفاده می‌کند. این دقیقاً همان نقطه‌ای است که مدل‌های پیشرفته‌ی کدنویسی امروز شکست می‌خورند.

طبق گزارشی که در ۲۵ سپتامبر ۲۰۲۶ منتشر شد، مدل‌های هوش مصنوعی زاینده (Generative AI) — شبیه به دستیاری که دستورات کلی را می‌فهمد اما جزئیات سخت‌گیرانه را فراموش می‌کند — در مدیریت «محدودیت‌های منفی» دچار ضعف شدید هستند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی توهمات مدل‌های زبانی اشاره کردیم، مشکل این بار نبودِ دانش فنی نیست، بلکه عدم انطباق با چارچوب‌های عملیاتی است. این ناتوانی در درک دقیق جزئیات، یادآور چالش‌های شناسایی موارد لبه‌ای در جریان کاری توسعه‌دهندگان است که پیش‌تر بررسی کردیم.

به گزارش dev.to، در این محک جدید برای جداسازی توانایی فنی از توانایی پیروی از دستورات، دو معیار مجزا تعریف شده است:

  • صحت وظیفه (Task Correctness): آیا مسئله‌ی کدنویسی در نهایت حل شده است یا خیر.
  • پایبندی به دستورات (Instruction Compliance): درصد رعایت محدودیت‌های خاص (مثلاً اگر از ۴ محدودیت، ۳ مورد رعایت شده باشد، نرخ پایبندی ۷۵٪ است).

در این متدولوژی، یک پرامپت یکسان به مدل‌های مختلف داده شد تا مشخص شود آیا با افزایش تعداد محدودیت‌ها، نرخ خطا بالا می‌رود یا اینکه حل درستِ کد باعث می‌شود مدل قوانین را نادیده بگیرد.

این یافته‌ها معیار ارزیابی دستیارهای کدنویسی را تغییر می‌دهد. تا امروز صنعت بر این باور بود که اگر کد «کار کند» یعنی مدل موفق است، اما مرز جدید، توانایی مدل در فعالیت درون مرزهای سخت‌گیرانه‌ی یک کدبیس حرفه‌ای است، بدون آنکه نیاز به بازبینی دستی داشته باشد. این رویکرد سطحی به موفقیت، مشابه توهم پوشش کد بالا در تست‌های AI است که می‌تواند باگ‌های واقعی را در لایه‌های زیرین پنهان کند.

وقتی مدلی از نظر فنی درست اما از نظر عملی غلط عمل می‌کند، بار ذهنی برنامه‌نویس افزایش می‌یابد؛ زیرا او حالا باید تمام کد را برای یافتن متدهای ممنوعه بازبینی کند. این موضوع نشان می‌دهد که قابلیت‌های مدل استدلالی (Reasoning Model) — مثل شطرنج‌بازی که چند حرکت جلوتر را می‌بیند — هنوز با پیروی سخت‌گیرانه از دستورات در ویرایش‌های پیچیده همراستا نشده است. این شکاف استدلالی را می‌توان در شکست دو عامل هوش مصنوعی در برابر یک باگ بحرانی مشاهده کرد، جایی که دقت انسانی همچنان برتری دارد.

در نسخه‌های آینده این محک، محققان قصد دارند دستورات چندمرحله‌ای و محدودیت‌های متضاد را بررسی کنند تا ببینند آیا قابلیت خوداصلاحی مدل‌ها پس از اشاره به اشتباهات، بهبود می‌یابد یا خیر.

گام بعدی شما

  • هنگام استفاده از AI برای کدنویسی، محدودیت‌های منفی (مثلاً «از X استفاده نکن») را در انتهای پرامپت تکرار کنید.
  • برای پروژه‌های حساس، از مدل‌های مختلف برای بازبینی (Audit) محدودیت‌های یکدیگر استفاده کنید.
  • در پرامپت‌های خود، دلیل ممنوعیت یک متد را ذکر کنید تا احتمال رعایت آن افزایش یابد.

اما تأثیر این ضعف در مدل‌های بازمتن حتی پیچیده‌تر است؛ در گزارش بعدی بررسی می‌کنیم که چگونه Llama 3 با این چالش دست‌وپنجه نرم می‌کند.

چرا این موضوع مهم است؟

این یافته بر اساس اعتبار متدولوژی تفکیک‌شده‌ی dev.to، نشان می‌دهد که اعتماد کامل به AI در محیط‌های Enterprise ریسک امنیتی و فنی دارد. توسعه‌دهندگان باید بدانند که صحت خروجی به معنای رعایت استانداردهای پروژه نیست.

تأثیر برای ایران

برای برنامه‌نویسان ایرانی که در پروژه‌های Legacy یا با محدودیت‌های سخت‌افزاری خاص کار می‌کنند، این هشدار یعنی بازبینی دستی کدهای AI همچنان ضروری است و جایگزینی کامل نیروی انسانی با AI در این سطح ریسک بالایی دارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت بر بنچمارک‌های «صحت» (Correctness) باعث ایجاد یک توهم از بلوغ مدل‌ها شده است. در دنیای واقعی، کدنویسی یعنی مدیریت محدودیت‌ها، نه فقط رسیدن به جواب. این شکاف نشان می‌دهد که ما از عصر «تولید کد» به عصر «کنترل کد» وارد شده‌ایم و مدل‌هایی برنده خواهند بود که نرخ پایبندی بالاتری دارند، حتی اگر دقت فنی‌شان کمی کمتر باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.