
آیا CodeVetter میتواند ابهام در گزارشات عاملهای کدنویس را حذف کند؟
پلتفرم CodeVetter چارچوبی برای ایجاد «بستههای شواهد تأیید» معرفی کرد تا جایگزین خلاصههای مبهم هوش مصنوعی شود. این سیستم تضمین میکند هر تغییر کد توسط یک رکورد ماشینخوان از محیط…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۶ مقاله منتشر شده

پلتفرم CodeVetter چارچوبی برای ایجاد «بستههای شواهد تأیید» معرفی کرد تا جایگزین خلاصههای مبهم هوش مصنوعی شود. این سیستم تضمین میکند هر تغییر کد توسط یک رکورد ماشینخوان از محیط…

یک متدولوژی جدید برای تست مدلهای زبانی، تمرکز را از «صحت کلی» به «حوادث مرگبار» تغییر میدهد. این سیستم با طراحی تلههای هدفمند، تضمین میکند خطاهای غیرقابل بازگشت پیش از استقرار…

سیستم حافظه ترکیبی Muninn توانسته است بدون کاهش چشمگیر دقت، زمان پاسخدهی عاملهای هوش مصنوعی را از چندین دقیقه به زیر ۳ ثانیه کاهش دهد. توسعهدهنده این سیستم بر تضاد میان…

پژوهشی جدید نشان میدهد عاملهای هوش مصنوعی هنگام مواجهه با کمبود داده، بهجای پذیرش نادانی، اطلاعاتی باورپذیر اما ساختگی تولید میکنند. این «بدهی انسجام» باعث میشود ابزارهای…

محک جدید ThoughtDAG نشان میدهد حذف یک پیام اشتباه از تاریخچهٔ گفتگو، لزوماً اثر آن خطا را از حافظهٔ مدل پاک نمیکند. «پژواک» این اشتباهات در پاسخهای بعدی باقی میماند، مگر آنکه…

یک محک جدید نشان میدهد مدلهای پیشرو هوش مصنوعی در استخراج ایدههای پژوهشی از کتابشناسیها بهشدت ناتواناند. حتی با استفاده از سامانههای چندعاملی، نرخ موفقیت به ۴۲٪ میرسد که…

پلتفرم متنباز Tracely-ai با تبدیل خطاهای واقعی عاملهای هوش مصنوعی به تستهای غیرقابلتغییر، از بازگشت باگهای محیط عملیاتی جلوگیری میکند. این سیستم با مسدود کردن استقرار…

یک توسعهدهنده با ثبت تمامی تصمیمات یک عامل طبقهبندی در قالب فایلهای JSONL، متوجه خطایی در منطق اجرای برنامه شد که در داشبوردهای تحلیلی معمولی پنهان میماند. این رویکرد نشان…

یک متدولوژی جدید پیشنهاد میکند برنامهنویسان بهجای تکیه بر جدولهای رتبهبندی (Leaderboards)، ابزارهای AI را با استفاده از کدبیس واقعی خود و بودجهای محدود از توکنها «مصاحبه»…

بررسی ۱۴٬۴۰۰ مورد نشان میدهد حذف قوانین متضاد، بهینهترین راه برای کاهش خطای پرامپت است. این استراتژی ساده، دقتی مشابه با اصلاحات پیچیده دارد اما هزینهی توکنها را بهشدت کاهش…

یک ابزار متنباز جدید نشان میدهد که کوتاه کردن سادهٔ متن (Truncation) در معیارهای اعتبار داخلی، نمرات بالاتری نسبت به بازنویسی پیچیده توسط هوش مصنوعی کسب میکند. این یافته شکافی…

تحلیل جدید Prime Intellect روی ۱۸ مدل پیشرو نشان میدهد Fable 5 در حال حاضر پیشروترین عامل در بهینهسازی خودکار است. این نتایج شکاف عمیقی را میان عاملهای سطح اول و سایر مدلهای…