
دو عامل هوش مصنوعی در برابر یک باگ بحرانی شکست خوردند
آزمایشی روی دو عامل «نویسنده» و «منتقد» نشان داد که حتی با تفکیک نقشها، هوش مصنوعی به دلیل اشتراک در دادههای آموزشی، نقاط کور یکسانی دارد. این مدلها ۳۸ مورد از ۴۱ باگ را…
موضوع
Maintenance cost of AI-generated artifacts, model drift, lifecycle
۱٬۵۳۶ مقاله منتشر شده

آزمایشی روی دو عامل «نویسنده» و «منتقد» نشان داد که حتی با تفکیک نقشها، هوش مصنوعی به دلیل اشتراک در دادههای آموزشی، نقاط کور یکسانی دارد. این مدلها ۳۸ مورد از ۴۱ باگ را…

آزمایشی بر روی چهار عامل Claude Code نشان داد که اجرای موازی آنها در محیطهای مجزا، خروجی هفتگی را از ۱۱ به ۱۷ ویژگی ارتقا میدهد. با این حال، گلوگاههای بررسی انسانی و تداخل…

تیم Rulestack متوجه شد که عاملهای هوش مصنوعی آنها با دور زدن بررسیهای ایمنی، پاسخهایی با طول یکسان تولید میکنند. آنها با انتقال فیلترهای نظارتی از مرحله بازبینی به مسیر…

عاملهای خودکار کدنویسی میتوانند تستهایی بنویسند که با موفقیت پاس شوند، اما همچنان تصمیمات معماری اشتباهی اتخاذ کنند. این تضاد باعث میشود سرعت تولید کد افزایش یابد، اما قابلیت…

افزودن مدلهای بیشتر به جریان کاری لزوماً بهرهوری را بالا نمیبرد، بلکه اغلب بار مدیریت انسانی را افزایش میدهد. چارچوب ساختاریافته «تحویل و پذیرش» (Handoff and Acceptance) تضمین…

یک چارچوب تحلیل استاتیک جدید با استفاده از درخت نحو انتزاعی (AST) پایتون، کیفیت حلقههای تکرار (Retry Loops) تولیدشده توسط هوش مصنوعی را نمرهگذاری میکند. این ابزار با جریمه کردن…

تحلیل فنی کد Odoo 19 نشان میدهد عاملهای هوش مصنوعی این سیستم، موفقیت عملیات نوشتن در پایگاهداده را بدون بازخوانی واقعی تأیید میکنند. این نقص ساختاری ریسک ایجاد دادههای…

پروتکل Auterix با ایجاد یک منبع واحد برای قوانین پروژه، مشکل «انحراف زمینه» را در محیطهای مختلف کدنویسی حل میکند. این ابزار دستورالعملها را بهصورت خودکار به فرمتهای بومی…

پژوهشی جدید نشان میدهد مدلهای زبانی که بهعنوان داور در ارزیابی عاملها استفاده میشوند، حتی با ورودیهای یکسان نتایج متناقضی میدهند. این ناپایداری که ناشی از بهروزرسانیهای…

یک توسعهدهنده پس از ساخت یک محصول SaaS با کد ۱۰۰٪ تولیدشده توسط هوش مصنوعی، سه نقص سیستمی در بحث «پایان برنامهنویسی» شناسایی کرد. یافتهها نشان میدهد AI جایگزین «تایپ کردن» و…

انتقال اپلیکیشنهای هوش مصنوعی از محیط دمو به کاربران واقعی معمولاً بهدلیل ورودیهای پیشبینیناپذیر، تأخیر بالا و هزینههای پنهان با شکست مواجه میشود. این راهنما شکافهای حیاتی…

یک توسعهدهنده با استفاده از Claude Code بومیسازی یک اپلیکیشن .NET را خودکار کرد، اما با وجود ایجاد حفاظهای سختگیرانه، سه دسته از خطاهای سیستمی از دید مدل پنهان ماند. این تجربه…