
یک پاسخ موفق هوش مصنوعی دلیل کافی برای تأیید یکپارچگی سیستم نیست
بسیاری از توسعهدهندگان یک پاسخ صحیح از مدل را به اشتباه بهعنوان تأیید نهایی گردشکار میپذیرند. یک آزمون معتبر نیازمند ثبت هش پرامپت، لاگ دستورات و مستندسازی متغیرهای سختافزاری…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

بسیاری از توسعهدهندگان یک پاسخ صحیح از مدل را به اشتباه بهعنوان تأیید نهایی گردشکار میپذیرند. یک آزمون معتبر نیازمند ثبت هش پرامپت، لاگ دستورات و مستندسازی متغیرهای سختافزاری…

محک جدید SWE-Serve نشان میدهد ۳۳٪ از کدهایی که در آزمونهای استاندارد پذیرفته شدهاند، هنگام استقرار در محیط واقعی با خطا مواجه میشوند. این یافته نشان میدهد ارزیابیهای فعلی از…

محک جدید AgentDojo نشان میدهد تشخیصدهندههای متنباز در برابر حملات تزریق پرامپت که در خروجی ابزارها پنهان شدهاند، تقریباً ناتواناند. مدل Prompt Guard 2 متا و فیلترهای مبتنی…

پلتفرم Kaggle و جامعه DEV رقابتی را برای ساخت محکهای (Benchmarks) سفارشی آغاز کردند تا نقاط ضعف مدلهای AI در وظایف واقعی دنیای حرفهای شناسایی شود. پنج برنده برترین ارزیابیهای…

بسیاری از بنچمارکهای عاملهای هوش مصنوعی، خطاهای شبکه و تایماوتها را به اشتباه بهعنوان شکست مدل ثبت میکنند. یک متدولوژی جدید با جداسازی «لایه انتقال» از «لایه استدلال»، دقت…

تحلیلهای فنی نشان میدهد مدل Jev شرکت TypeSafe نمیتواند احتمالات کالیبرهشده را در توزیعهای مختلف دادههای کاربر حفظ کند. مهندسان باید امتیازات این مدل را بهجای احتمال مطلق،…

یک توسعهدهنده کشف کرد که تثبیت شناسهی مدل (Model ID) مانع از تغییر رفتار مدل در سمت سرور نمیشود. این یافته نشان میدهد که تأیید هویت مدل با تأیید صحت خروجی متفاوت است و…

یک توسعهدهنده با استفاده از یک تسک بلندمدت در Codex، چارچوبی ریاضی را به یک بسته آموزشی نسخهبندیشده تبدیل کرد. این پروژه با جایگزینی حافظهٔ چت با آرتیفکتهای نسخهبندیشده،…

انتقال مدلهای هوش مصنوعی به محیط عملیاتی اغلب خطاهای پیشبینینشدهای را آشکار میکند. این راهنما چارچوبی سیستماتیک برای بازتولید، مکانیابی و رفع خطاهای پرامپت با استفاده از…

محققان Jane Street دریافتند که تأثیر وزندهی دادهها بر یادگیری مدلها با تغییر مقیاس، تغییر میکند. در حالی که مدلهای متوسط به وزنها حساساند، مدلهای بسیار کوچک و بسیار بزرگ،…

مؤسسه ایمنی هوش مصنوعی بریتانیا (AISI) برای تبدیل نتایج ارزیابی مدلهای پیشرو به حقایق علمی قابل راستیآزمایی، زیرساخت باز EvalEval را پذیرفت. این اقدام دادههای سطح تراکنش را…

ارزیابیهای سنتی هوش مصنوعی بهدلیل تغییر همزمان وزنهای مدل، پرامپتها و منطق داور شکست میخورند. ذخیره خروجیهای خام در قالب Snapshotهای منجمد، امکان جداسازی دقیق عامل ایجاد…