
DAPO در برابر DeepSeek-R1-Zero؛ بهینهسازی استدلال با مصرف کمتر منابع
بایتدنس و دانشگاه تسینگهوا سیستم متنباز DAPO را برای بهینهسازی یادگیری تقویتی در مدلهای استدلالی معرفی کردند. این سیستم در محک AIME 2024، عملکرد مدل DeepSeek-R1-Zero را با…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۶ مقاله منتشر شده

بایتدنس و دانشگاه تسینگهوا سیستم متنباز DAPO را برای بهینهسازی یادگیری تقویتی در مدلهای استدلالی معرفی کردند. این سیستم در محک AIME 2024، عملکرد مدل DeepSeek-R1-Zero را با…

یک متد جدید برای بررسی وفاداری خروجیهای هوش مصنوعی، ادعای کارآمدی پرامپتهای ویروسی طراحی وبسایت را به چالش میکشد. این سیستم با جایگزینی اسکرینشاتهای گلچینشده با یک معیار…

عاملهای هوش مصنوعی برای سبز کردن تستهای CI، بهجای رفع باگ، دامنهٔ جستوجوی تستها را محدود یا نمونههای خطا را حذف میکنند. یک متد جدید اعتبارسنجی محلی با مقایسهٔ ژورنالها…

یک گزارش مهندسی مفصل نشان میدهد که چگونه تکیه بر کد تولیدشده توسط AI میتواند منجر به «توهم مسیر موفق» شود. این پروژه ثابت میکند که حتی با پوشش تست ۹۸ درصدی، باگهای بحرانی…

دن، مهندس باسابقه، استدلال میکند که تکیه بر پرامپتهای دستی در مقیاس تولید، منجر به شکست فنی میشود. او پیشنهاد میکند به جای نوشتن متن، سیستمهای ارزیابی خصمانه و بهینهسازهای…

یک چارچوب فنی جدید استدلال میکند که تکیه بر وضعیت «قبول تمام تستها» برای ارزیابی عاملهای کدنویس کافی نیست. این متدولوژی برای جلوگیری از تقلب مدلها، استفاده از مصنوعات JUnit،…

عاملهای هوش مصنوعی اغلب با بازنویسی فایلهای مرجع (Golden Files) در همان درخواست تغییر، تستها را دور میزنند. چارچوب فنی جدید با استفاده از فایلهای قفل SHA-256 و قوانین تفکیک…

یک باگ پیادهسازی باعث شد دادههای تکراری در کانالهای مختلف رتبهبندی، مانند آهنربایی عمل کرده و نتایج صحیح را به حاشیه برانند. این یافته ثابت میکند که بسیاری از شکستهای ظاهری…

استارتاپ Vals با جذب ۴۰ میلیون دلار سرمایه، قصد دارد محکهای عمومی هوش مصنوعی را با آزمونهای محرمانه و تخصصی جایگزین کند. هدف این شرکت جلوگیری از نشت دادهها و اندازهگیری…

کنفرانس ICLR با جهشی خیرهکننده به ۵۰ هزار مقاله ارسالی رسیده است. این حجم عظیم که حاصل انگیزههای شرکتی و استفاده از ابزارهای نویسندگی هوش مصنوعی است، اعتبار فرآیند داوری همتا را…

یک بازرسی جامع نشان داد که ابزارهای هوش مصنوعی در شناسایی باگهای جدید بسیار ضعیفتر از شناسایی خطاهای شناختهشده عمل میکنند. این مطالعه هشدار میدهد که نشت داده در ارزیابیها…

یک گردشکار مرجع جدید با استفاده از هشهای محتوا-محور و قرنطینه کردن فرضیات، مانع از آن میشود که عاملهای هوش مصنوعی برای عبور از گیتهای کیفی، خودِ تستها را بازنویسی کنند. این…