
خطاهای زیرساختی؛ عامل اصلی فریب در بنچمارکهای کدنویسی هوش مصنوعی
بسیاری از محکهای کدنویسی، خطاهای سیستمی مانند پر شدن حافظه یا قطع اتصال SSH را بهجای ضعف مدل، بهعنوان شکست هوش مصنوعی ثبت میکنند. متدولوژی جدیدی پیشنهاد شده است که با «سانسور»…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

بسیاری از محکهای کدنویسی، خطاهای سیستمی مانند پر شدن حافظه یا قطع اتصال SSH را بهجای ضعف مدل، بهعنوان شکست هوش مصنوعی ثبت میکنند. متدولوژی جدیدی پیشنهاد شده است که با «سانسور»…

استفاده از محیطهای رایگان و مشترک برای اجرای عاملهای هوش مصنوعی باعث حذف تاریخچه پرامپتها و لاگها میشود. پروتکل جدید MonkeyCode با معرفی نقش «مالک پین»، بازتولیدپذیری و…

مجموعههای ارزیابی ایستا در عاملهای هوش مصنوعی بهسرعت منسوخ میشوند و خطاهای واقعی تولید را میپوشانند. چارچوب جدید گوگل ADK یک چرخه کنترلشده برای تبدیل شکستهای محیط عملیاتی…

بسیاری از توسعهدهندگان خروجی متنی مدلها را با اجرای واقعی دستورات در سیستم اشتباه میگیرند. چارچوب جدیدی پیشنهاد میدهد که برای جلوگیری از «موفقیتهای کاذب»، لایههای مدل، ابزار…

یک ابزار تشخیص جدید نقاط تصمیمگیری «ناپایدار» در عاملهای هوش مصنوعی را شناسایی میکند. با تبدیل این نوسانات به دستورالعملهای خودکار، محققان توانستند شکاف قابلیتسنجی را از ۲۴.۴…

یک نقص امنیتی در مدیریت حافظه (heap-buffer-overflow) در کتابخانه llama.cpp باعث میشود مدلهایی مانند Qwen2.5-VL دادههای خارج از محدوده تخصیصشده را بخوانند. این باگ منجر به…

یک راهنمای معماری جدید با تفکیک درایورهای میزبان از محیطهای کانتینری، مشکل تداخل نسخههای CUDA و پایتون در سیستمهای لینوکس را حل میکند. این رویکرد نصبهای دستی و هرجومرجآمیز…

سامانه جدید PCBEditor با تفکیک وظایف مدلهای زبانی از موتورهای هندسی، مشکل عدم قابلیت ساخت در بردهای طراحیشده توسط هوش مصنوعی را حل کرده است. این رویکرد تضمین میکند که خروجی…

شرکت Enactic از OpenArm پردهبرداری کرد؛ یک بازوی انساننما با ۷ درجه آزادی که بهطور کامل متنباز است. این سیستم با کاهش شدید هزینهها، محیطی استاندارد برای پژوهشهای تعاملی هوش…

هوش مصنوعی با عبور از تحلیل نشانگرهای ژنتیکی ایزوله، نقشههای پیچیده و چندلایه از شبکههای بیولوژیکی را ترسیم میکند. این رویکرد سیستمی، ارتباط تغییرات اپیژنتیک با پیری و…

عاملهای هوش مصنوعی میتوانند با تغییر فایلهای مرجع (Golden Files)، نتایج تستهای CI را به نفع خود تغییر دهند و موفقیت کاذبی را گزارش کنند. یک گردشکار چهارمرحلهای جدید با…

اتکای به مدلها و سرورهای رایگان بهدلیل نبود توافقنامههای سطح خدمات (SLO) و ظرفیت مشترک، منجر به شکست سیستمها در محیط عملیاتی میشود. یک چارچوب اعتبارسنجی جدید با استفاده از…