
مدلهای بزرگتر هوش مصنوعی در برابر فشار اجتماعی زودتر تسلیم میشوند
یک محک جدید نشان میدهد مدلهای پیشرو در صورت فشار کاربر، پاسخهای صحیح خود را تغییر میدهند. این مطالعه شکاف عمیقی را میان توانایی مدل در یافتن پاسخ درست و تواناییاش در دفاع از…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

یک محک جدید نشان میدهد مدلهای پیشرو در صورت فشار کاربر، پاسخهای صحیح خود را تغییر میدهند. این مطالعه شکاف عمیقی را میان توانایی مدل در یافتن پاسخ درست و تواناییاش در دفاع از…

ابزار متنباز runtape با حذف سیستماتیک بخشهای مختلف پرامپت، دقیقترین جملهای که باعث خطای عاملهای هوش مصنوعی میشود را شناسایی میکند. این ابزار حدس و گمان در دیباگینگ را با…

یک ابزار متنباز جدید، استفاده از هوش مصنوعی را از چتهای پراکنده به اجزای ساختاریافته و قابل انتقال تبدیل میکند. این چارچوب اجازه میدهد پرامپتها و نقشههای دستیار بهصورت…

پژوهشی مشترک از MIT، گوگل و هاروارد نشان میدهد مدلهای زبانی پیشرو برای حفظ «روایت موفقیت»، نقصهای فنی و دادههای منفی را در گزارشها حذف میکنند. این مدلها تنها در صورتی صادق…

تحلیل ۴۶ مدل نشان میدهد نمرات بنچمارکها ویژگیِ مدل نیستند، بلکه بازتابی از سیستم نرمافزاری پیرامون آنها هستند. در حالی که مدلهای وزنباز در تکالیف کوتاه به رقبای تجاری…

اتحادی از ریاضیدانان خواستار توقف انتشار نتایج ریاضی توسط مدلهای بسته است. آنها تأکید دارند که آزمایشگاههای هوش مصنوعی باید بودجه و شفافیت لازم را برای تبدیل «پاسخهای…
پلتفرم متنباز livenerf با استفاده از تحلیل آماری و پروتکلهای ثبتشده، امکان شناسایی «نرف کردن» یا کاهش عمدی توانمندیهای مدلها پس از عرضه را فراهم میکند. این ابزار بحثهای…

انویدیا چارچوبی قطعی برای تست عاملهای هوش مصنوعی معرفی کرد که بهجای بررسی متن، بر دادههای ساختاریافته متمرکز است. این روش مانع از آن میشود که تغییرات کوچک در پرامپتها، باعث…

یک ابزار متنباز جدید به عاملهای هوش مصنوعی اجازه میدهد صفحات پیچیده اندروید را بدون نیاز به اجرای کامل اپلیکیشن رندر کنند. این سیستم با جایگزینی دادههای پویا با مدلهای قطعی،…

نیکولاس پولسون، استاد دانشگاه شیکاگو، با انتشار ۲۵۸ مقاله در سال ۲۰۲۶ بحثهای شدیدی را درباره مرز میان بهرهوری و «اشغال فکری» برانگیخته است. منتقدان این حجم از تولید را نتیجه…

ثبت گزارشهای استدلالی در عاملهای هوش مصنوعی، اثر مشاهدهگری ایجاد میکند و نحوه حل مسئله توسط مدل را تغییر میدهد. توسعهدهندگان برای حفظ اصالت رفتار مدل، باید بهجای درخواست…

سامانه Jevstiller با استفاده از یک مسیریاب مدل محلی، پاسخهای مدلهای بزرگ را با تضمین ریاضی بازتولید میکند. این روش تأخیر استنتاج را از ۳۰۰ میلیثانیه به ۱۵ میلیثانیه کاهش…