پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

آزمایش بازیابی چهاربازویی در یک پایگاه کد واقعی: واحد بازگشت
آموزش کاربردی

بازیابی کامل اسناد صحت پاسخ‌های کدنویسی هوش مصنوعی را ۸ برابر کرد

یک آزمایش کنترل‌شده روی کدهای واقعی نشان می‌دهد که ارسال کل سند به‌جای تکه‌های کوچک، دقت مدل‌های زبانی را در پرس‌وجوهای برنامه‌نویسی ۸۰۰٪ افزایش می‌دهد. این یافته ثابت می‌کند…

۱۰ دقیقه خواندن
اثبات ارتقای مدل با CSS و موتور اسکریپت غیرفعال
آموزش کاربردی

انیمیشن‌های خالص CSS در برابر JS؛ محک سخت‌گیرانه برای هوش مصنوعی

ابزار جدید Cascade با اجبار مدل‌ها به ساخت انیمیشن‌های خالص CSS و حذف کامل جاوااسکریپت، یک محک سخت‌گیرانه برای سنجش توانایی واقعی کدنویسی ایجاد کرده است. این سامانه مقایسه‌های…

۷ دقیقه خواندن
اثبات معیار سختی صفر p28-zero-diff
آموزش کاربردی

آیا مدل‌های هوش مصنوعی ساده‌ترین اثبات‌های ریاضی را پاس می‌کنند؟

یک بنچمارک مینیمال به نام p28-zero-diff معرفی شده است که توانایی مدل‌های هوش مصنوعی در حل ساده‌ترین اثبات‌های ریاضی را می‌سنجد. این ابزار به جای چالش‌های سخت، به عنوان یک «تست…

۲ دقیقه خواندن
سرور LLM بدون تغییر ۲۷٪ گران‌تر شد
آموزش کاربردی

درون نوسانات هزینه سرور؛ نقش گرمای سخت‌افزار و زمان‌بندی سیستم‌عامل

تحلیلی جدید نشان می‌دهد نویزهای سیستمی مانند گرم شدن سخت‌افزار و زمان‌بندی سیستم‌عامل، نوسانات شدیدی در هزینه‌های استنتاج ایجاد می‌کنند. این یافته ثابت می‌کند مقایسه‌های ساده‌ی…

۷ دقیقه خواندن
معیار سرتاسری افزایش داده چندوجهی و پایداری خصمانه با AugLy برای تصویر، متن، صوت و PyTorch
آموزش کاربردی

کتابخانه AugLy استواری مدل‌های چندوجهی را با داده‌های خصمانه می‌سنجد

AugLy چارچوبی جامع برای ایجاد اختلالات عمدی در داده‌های تصویری، متنی و صوتی است تا نقاط ضعف مدل‌های هوش مصنوعی شناسایی شود. این ابزار با شبیه‌سازی نویزهای دنیای واقعی، به…

۱۶ دقیقه خواندن۲
متا آیرا: از زمین تمرین تا مدال طلای کگل؛ ردیابی عدد به عدد آنچه رخ داد

بهینه‌سازی محیط در برابر قدرت مدل؛ کلید موفقیت سری AIRA

پژوهش‌های سری AIRA در متا نشان می‌دهد که عملکرد عامل‌های هوشمند بیش از آنکه به مدل وابسته باشد، به محیط تمرین و سیاست‌های جست‌وجو بستگی دارد. این رویکرد منجر به کسب رتبه هشتم در…

۳ دقیقه خواندن۲
«ناشناخته» مقدار سوم درستی بود، اما به تنهایی کافی نیست.
آموزش کاربردی

آزمایش عامل‌های AI: وضعیت «نامشخص» نرخ تأییدهای کاذب را کاهش داد

یک آزمایش روی عامل‌های هوش مصنوعی نشان می‌دهد که سیستم‌های دوتایی (قبول/رد) باعث ایجاد «تأییدهای کاذب» می‌شوند. افزودن وضعیت سوم یعنی «نامشخص»، شکست‌های پنهان در تطبیق الگوها و…

۷ دقیقه خواندن
یادگیری از برچسب‌های محدود در هوش مصنوعی صنعتی: جایی که بازخورد خبره اهمیت دارد
آموزش کاربردی

بهینه‌سازی زمان خبرگان؛ راهکار جدید برای حل بحران برچسب‌گذاری در AI صنعتی

سیستم‌های هوش مصنوعی صنعتی با پارادوکس «داده‌های انبوه اما برچسب‌های اندک» برای خطاهای نادر دست‌وپنجه نرم می‌کنند. چارچوب جدیدی با اولویت‌بندی زمان خبرگان از طریق یادگیری فعال،…

۵ دقیقه خواندن۲
نمایه مرتبط با تشخیص، واژه‌نامه‌ای کاربردی است.
آموزش کاربردی

شکاف زبانی در مستندات AI؛ چرا کاربران نمی‌توانند راهکارهای فنی را پیدا کنند؟

یک تست کور روی کاتالوگ خطاهای هوش مصنوعی نشان داد که استفاده از زبان «تشخیصی» به‌جای زبان «شکایت»، دسترسی کاربران به پاسخ‌ها را مختل می‌کند. راهکار این مشکل، ایجاد یک لایه واسط…

۶ دقیقه خواندن۱
پاکت‌های جلسه تعیین می‌کنند آیا عامل دلتا ارسال می‌شود یا خیر
آموزش کاربردی

«پایان شانس در بنچ‌مارک»؛ متدولوژی جدید برای سنجش واقعی کیفیت مدل

یک چارچوب ارزیابی جدید، نوسانات سرور مانند تأخیر در صف‌ها را به‌جای یادداشت‌های حاشیه‌ای، به عنوان عوامل رد صلاحیت در نظر می‌گیرد. با استفاده از «پوشه‌های نشست»، مهندسان می‌توانند…

۷ دقیقه خواندن۲