
رابط کاربری موازی در برابر متد آموزشی؛ دلیل واقعی سرعت Jev
شرکت TypeSafe AI مدل Jev را برای کالیبره کردن امتیازات اطمینان معرفی کرد تا ادعای مدل با دقت واقعی در دنیای واقعی مطابقت داشته باشد. با وجود ادعای سرعت بسیار بالا، تحلیلها نشان…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۶ مقاله منتشر شده

شرکت TypeSafe AI مدل Jev را برای کالیبره کردن امتیازات اطمینان معرفی کرد تا ادعای مدل با دقت واقعی در دنیای واقعی مطابقت داشته باشد. با وجود ادعای سرعت بسیار بالا، تحلیلها نشان…

سیستمهای هوش مصنوعی صنعتی با پارادوکس «دادههای انبوه اما برچسبهای اندک» برای خطاهای نادر دستوپنجه نرم میکنند. چارچوب جدیدی با اولویتبندی زمان خبرگان از طریق یادگیری فعال،…

یک تست کور روی کاتالوگ خطاهای هوش مصنوعی نشان داد که استفاده از زبان «تشخیصی» بهجای زبان «شکایت»، دسترسی کاربران به پاسخها را مختل میکند. راهکار این مشکل، ایجاد یک لایه واسط…

یک چارچوب ارزیابی جدید، نوسانات سرور مانند تأخیر در صفها را بهجای یادداشتهای حاشیهای، به عنوان عوامل رد صلاحیت در نظر میگیرد. با استفاده از «پوشههای نشست»، مهندسان میتوانند…

بسیاری از توسعهدهندگان یک پاسخ صحیح از مدل را به اشتباه بهعنوان تأیید نهایی گردشکار میپذیرند. یک آزمون معتبر نیازمند ثبت هش پرامپت، لاگ دستورات و مستندسازی متغیرهای سختافزاری…

محک جدید SWE-Serve نشان میدهد ۳۳٪ از کدهایی که در آزمونهای استاندارد پذیرفته شدهاند، هنگام استقرار در محیط واقعی با خطا مواجه میشوند. این یافته نشان میدهد ارزیابیهای فعلی از…

محک جدید AgentDojo نشان میدهد تشخیصدهندههای متنباز در برابر حملات تزریق پرامپت که در خروجی ابزارها پنهان شدهاند، تقریباً ناتواناند. مدل Prompt Guard 2 متا و فیلترهای مبتنی…

پلتفرم Kaggle و جامعه DEV رقابتی را برای ساخت محکهای (Benchmarks) سفارشی آغاز کردند تا نقاط ضعف مدلهای AI در وظایف واقعی دنیای حرفهای شناسایی شود. پنج برنده برترین ارزیابیهای…

بسیاری از بنچمارکهای عاملهای هوش مصنوعی، خطاهای شبکه و تایماوتها را به اشتباه بهعنوان شکست مدل ثبت میکنند. یک متدولوژی جدید با جداسازی «لایه انتقال» از «لایه استدلال»، دقت…

تحلیلهای فنی نشان میدهد مدل Jev شرکت TypeSafe نمیتواند احتمالات کالیبرهشده را در توزیعهای مختلف دادههای کاربر حفظ کند. مهندسان باید امتیازات این مدل را بهجای احتمال مطلق،…

یک توسعهدهنده کشف کرد که تثبیت شناسهی مدل (Model ID) مانع از تغییر رفتار مدل در سمت سرور نمیشود. این یافته نشان میدهد که تأیید هویت مدل با تأیید صحت خروجی متفاوت است و…

یک توسعهدهنده با استفاده از یک تسک بلندمدت در Codex، چارچوبی ریاضی را به یک بسته آموزشی نسخهبندیشده تبدیل کرد. این پروژه با جایگزینی حافظهٔ چت با آرتیفکتهای نسخهبندیشده،…