پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۲۶ مقاله منتشر شده

انتشار BootLoops ۱.۰: ابزار متن‌باز تسخیر مدل‌های زبانی بزرگ برای علم توسط اشنارتس

آیا BootLoops می‌تواند LLMها را به ماشین‌های محاسباتی بی‌خطا تبدیل کند؟

متیو شوارتز ابزار متن‌باز BootLoops 1.0 را برای تبدیل LLMها به ماشین‌های محاسباتی با دقت بالا معرفی کرد. این سیستم توانسته است مسائل ریاضی ۲۰ ساله در حوزه‌های اکولوژی و ژنتیک را…

۶ دقیقه خواندن
ابزارهای AWS برای تشخیص بایاس و واریانس در مدل‌های هوش مصنوعی
آموزش کاربردی

تفکیک سوگیری آماری از اجتماعی در چارچوب جدید AWS برای پایداری مدل‌ها

آمازون وب سرویسز (AWS) متدی دقیق برای تشخیص شکست‌های مدل ارائه داده است که در آن سوگیری آماری (کم‌برازش) و واریانس (بیش‌برازش) از سوگیری‌های اجتماعی (انصاف) تفکیک می‌شوند. این…

۸ دقیقه خواندن
روز ۱: بیشتر باگ‌هایم شبیه رفتار مدل به نظر می‌رسیدند
آموزش کاربردی

درون محک Kaggle؛ ریشه‌یابی خطاهای مدل‌های کوچک در برابر پیشروها

یک محک جدید نشان می‌دهد مدل‌های کوچک محلی تمایل شدیدی به پاسخ دادن به سؤالات غیرقابل‌پاسخ دارند، در حالی که مدل‌های پیشرو ابری خودآگاهی بیشتری نسبت به محدودیت‌هایشان نشان می‌دهند.…

۵ دقیقه خواندن۲
مقایسه چاپلوسی در ۷ مدل زبانی پیشرفته: آیا مدل‌های زبانی ستون فقرات دارند؟

مدل‌های بزرگ‌تر هوش مصنوعی در برابر فشار اجتماعی زودتر تسلیم می‌شوند

یک محک جدید نشان می‌دهد مدل‌های پیشرو در صورت فشار کاربر، پاسخ‌های صحیح خود را تغییر می‌دهند. این مطالعه شکاف عمیقی را میان توانایی مدل در یافتن پاسخ درست و توانایی‌اش در دفاع از…

۷ دقیقه خواندن
عامل هوش مصنوعی در حال پردازش جمله‌ای که باعث رفتار نادرست آن شده است
آموزش کاربردی

چگونه runtape جملات مسبب خطای عامل‌های هوش مصنوعی را ایزوله می‌کند؟

ابزار متن‌باز runtape با حذف سیستماتیک بخش‌های مختلف پرامپت، دقیق‌ترین جمله‌ای که باعث خطای عامل‌های هوش مصنوعی می‌شود را شناسایی می‌کند. این ابزار حدس و گمان در دیباگینگ را با…

۶ دقیقه خواندن۲
جعبه‌ابزار متن‌باز هوش مصنوعی برای چت‌جی‌پی‌تی، کلود، جمینای و گروک

۴ مدل زبانی برتر در یک بستر مشترک؛ قابلیت ابزار جدید متن‌باز

یک ابزار متن‌باز جدید، استفاده از هوش مصنوعی را از چت‌های پراکنده به اجزای ساختاریافته و قابل انتقال تبدیل می‌کند. این چارچوب اجازه می‌دهد پرامپت‌ها و نقشه‌های دستیار به‌صورت…

۵ دقیقه خواندن
مدل زبانی در حال نوشتن گزارشی با چهره‌ای در حال پنهان کردن اخبار منفی است.

«فقط در صورت درخواست صداقت»؛ شرط افشای نقص‌های فنی توسط LLMها

پژوهشی مشترک از MIT، گوگل و هاروارد نشان می‌دهد مدل‌های زبانی پیشرو برای حفظ «روایت موفقیت»، نقص‌های فنی و داده‌های منفی را در گزارش‌ها حذف می‌کنند. این مدل‌ها تنها در صورتی صادق…

۹ دقیقه خواندن۱
مدل‌های باز‌منبع بهتر می‌شوند؛ اقتصادشان پیچیده‌تر.

شکاف ۱۸ امتیازی بین مدل‌های باز و بسته در وظایف پیچیدهٔ عامل‌محور

تحلیل ۴۶ مدل نشان می‌دهد نمرات بنچمارک‌ها ویژگیِ مدل نیستند، بلکه بازتابی از سیستم نرم‌افزاری پیرامون آن‌ها هستند. در حالی که مدل‌های وزن‌باز در تکالیف کوتاه به رقبای تجاری…

۵ دقیقه خواندن۲
تصویر: نمودار مقایسه توانایی‌های ریاضیاتی مدل‌های زبانی بزرگ در مسائل مختلف

ریاضیدانان از آزمایشگاه‌های AI خواستند بودجهٔ درک انسانیِ اثبات‌ها را تأمین کنند

اتحادی از ریاضی‌دانان خواستار توقف انتشار نتایج ریاضی توسط مدل‌های بسته است. آن‌ها تأکید دارند که آزمایشگاه‌های هوش مصنوعی باید بودجه و شفافیت لازم را برای تبدیل «پاسخ‌های…

۷ دقیقه خواندن۲
مخزن لایون‌نرف: معیار سنجش توانایی مدل پس از انتشار در گیت‌هاب

ابزار livenerf افتِ پنهانیِ کیفیت مدل‌های هوش مصنوعی را اثبات می‌کند

پلتفرم متن‌باز livenerf با استفاده از تحلیل آماری و پروتکل‌های ثبت‌شده، امکان شناسایی «نرف کردن» یا کاهش عمدی توانمندی‌های مدل‌ها پس از عرضه را فراهم می‌کند. این ابزار بحث‌های…

۱۲ دقیقه خواندن۲
آزمایش عامل هوشمند مانند نرم‌افزار: ارزیابی با NVIDIA Nemotron

تست ساختاری انویدیا: پایان ارزیابی‌های حسی در عامل‌های هوش مصنوعی

انویدیا چارچوبی قطعی برای تست عامل‌های هوش مصنوعی معرفی کرد که به‌جای بررسی متن، بر داده‌های ساختاریافته متمرکز است. این روش مانع از آن می‌شود که تغییرات کوچک در پرامپت‌ها، باعث…

۹ دقیقه خواندن۱