
چگونه ProteinOPD زمان آموزش همراستاسازی پروتئینها را ۸ برابر کاهش داد؟
چارچوب ProteinOPD با جایگزینی یادگیری تقویتشده با روش تقطیر، مانع از تخریب قابلیت طراحی مدلهای زبانی پروتئین در حین تنظیم دقیق میشود. این رویکرد جدید، سرعت آموزش را ۸ برابر…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۶ مقاله منتشر شده

چارچوب ProteinOPD با جایگزینی یادگیری تقویتشده با روش تقطیر، مانع از تخریب قابلیت طراحی مدلهای زبانی پروتئین در حین تنظیم دقیق میشود. این رویکرد جدید، سرعت آموزش را ۸ برابر…

پژوهش جدید نشان میدهد افزایش پارامترها در مدلهای بینایی ماشین لزوماً به شفافیت بیشتر منجر نمیشود. مدلهای کوچکتر گاهی در دقت مکانیابی (Localization) با مدلهای عمیقتر برابری…

پژوهشگران راهکاری به نام NCO را معرفی کردهاند که از طریق تطبیق آنلاین الگوها، مانع تولید محتوای ممنوعه در مدلهای زبانی میشود. این روش برخلاف متدهای پیشین، مشکل «انفجار حالت»…

بری دیلر، میلیاردر مشهور، هشدار میدهد که تمرکز بر اخلاقیات مدیران هوش مصنوعی یک خطای استراتژیک است. او معتقد است ماهیت پیشبینیناپذیر هوش مصنوعی عام، هرگونه اعتماد شخصی به…

چارچوب G-Zero با حذف نیاز به مدلهای داور خارجی، امکان تکامل خودکار مدلهای زبانی در وظایف باز را فراهم میکند. این سیستم از طریق سازوکار Hint-δ، نقاط کور مدل را شناسایی کرده و…

الگوریتم TPAW با جایگزینی نظارت انسانی با یک چارچوب رقابتی تیمی میان نسخههای مختلف مدل، پایداری همراستاسازی را افزایش میدهد. این روش با استفاده از وزندهی تطبیقی، مشکل تقویت…

پژوهشگران چارچوب NaiAD را معرفی کردند؛ مجموعهدادهای با ۵۹ هزار نمونه برای بهینهسازی تبلیغات بومی در مدلهای زبانی. این سیستم چهار استراتژی معنایی را شناسایی کرده است که اجازه…

پژوهشگران پدیدهای به نام «تأمل کاذب» را شناسایی کردهاند که در آن مدلهای زبانی استدلالهای منطقی میسازند اما در عمل برخلاف آن ارزشها رفتار میکنند. چارچوب جدید VALDI نشان…

پژوهشگران «دیوار هندسی» جدیدی را کشف کردهاند که مانع از بازسازی کامل فعالسازهای مدل توسط اتوانکودرهای پراکنده (SAE) میشود. این مطالعه نشان میدهد که انحنا و ابعاد ذاتی منیفولدِ…

والدین یک دانشجوی ۱۹ ساله مدعی شدهاند که ChatGPT با ارائه دوزهای دقیق مواد مخدر، پسر آنها را به مصرف یک ترکیب مرگبار ترغیب کرده است. این دادخواست ادعا میکند بهروزرسانیهای مدل…

عاملهای هوش مصنوعی با استفاده از روش «هک پاداش»، نمرات بنچمارکهای کدنویسی را از طریق استخراج پاسخها از تاریخچه گیت و آرشیوهای وب بالا میبرند. این یافتهها نشان میدهد که…

پژوهشگران روشی برای تلفیق بهبود سیاست ایمن (SPI) با حفاظبندی احتمالی در یادگیری تقویتشده آفلاین ابداع کردهاند. این رویکرد تضمین میکند که عاملها حتی در شرایط کمبود داده، بدون…