پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۶ مقاله منتشر شده

چگونه ProteinOPD زمان آموزش همراستاسازی پروتئین‌ها را ۸ برابر کاهش داد؟

چگونه ProteinOPD زمان آموزش همراستاسازی پروتئین‌ها را ۸ برابر کاهش داد؟

چارچوب ProteinOPD با جایگزینی یادگیری تقویت‌شده با روش تقطیر، مانع از تخریب قابلیت طراحی مدل‌های زبانی پروتئین در حین تنظیم دقیق می‌شود. این رویکرد جدید، سرعت آموزش را ۸ برابر…

۲ دقیقه خواندن
چرا افزایش مقیاس مدل‌های بینایی ماشین کیفیت توضیحات آن‌ها را بهبود نمی‌دهد؟

چرا افزایش مقیاس مدل‌های بینایی ماشین کیفیت توضیحات آن‌ها را بهبود نمی‌دهد؟

پژوهش جدید نشان می‌دهد افزایش پارامترها در مدل‌های بینایی ماشین لزوماً به شفافیت بیشتر منجر نمی‌شود. مدل‌های کوچک‌تر گاهی در دقت مکان‌یابی (Localization) با مدل‌های عمیق‌تر برابری…

۲ دقیقه خواندن
چگونه NCO بدون «انفجار حالت»، محتوای ممنوعه را در مدل‌های زبانی حذف می‌کند؟

چگونه NCO بدون «انفجار حالت»، محتوای ممنوعه را در مدل‌های زبانی حذف می‌کند؟

پژوهشگران راهکاری به نام NCO را معرفی کرده‌اند که از طریق تطبیق آنلاین الگوها، مانع تولید محتوای ممنوعه در مدل‌های زبانی می‌شود. این روش برخلاف متدهای پیشین، مشکل «انفجار حالت»…

۲ دقیقه خواندن
چرا شخصیت سام آلتمن هیچ اهمیتی در بقای بشر در عصر AGI ندارد؟

چرا شخصیت سام آلتمن هیچ اهمیتی در بقای بشر در عصر AGI ندارد؟

بری دیلر، میلیاردر مشهور، هشدار می‌دهد که تمرکز بر اخلاقیات مدیران هوش مصنوعی یک خطای استراتژیک است. او معتقد است ماهیت پیش‌بینی‌ناپذیر هوش مصنوعی عام، هرگونه اعتماد شخصی به…

۲ دقیقه خواندن
چرا G-Zero نیاز به مدل‌های داور را در تکامل خودکار هوش مصنوعی حذف می‌کند؟

چرا G-Zero نیاز به مدل‌های داور را در تکامل خودکار هوش مصنوعی حذف می‌کند؟

چارچوب G-Zero با حذف نیاز به مدل‌های داور خارجی، امکان تکامل خودکار مدل‌های زبانی در وظایف باز را فراهم می‌کند. این سیستم از طریق سازوکار Hint-δ، نقاط کور مدل را شناسایی کرده و…

۲ دقیقه خواندن
سازوکار TPAW: حذف وابستگی به داده‌های انسانی در همراستاسازی مدل‌های زبانی

سازوکار TPAW: حذف وابستگی به داده‌های انسانی در همراستاسازی مدل‌های زبانی

الگوریتم TPAW با جایگزینی نظارت انسانی با یک چارچوب رقابتی تیمی میان نسخه‌های مختلف مدل، پایداری همراستاسازی را افزایش می‌دهد. این روش با استفاده از وزن‌دهی تطبیقی، مشکل تقویت…

۲ دقیقه خواندن
سازوکار NaiAD برای بهینه‌سازی تبلیغات در مدل‌های زبانی بدون کاهش کاربرد

سازوکار NaiAD برای بهینه‌سازی تبلیغات در مدل‌های زبانی بدون کاهش کاربرد

پژوهشگران چارچوب NaiAD را معرفی کردند؛ مجموعه‌داده‌ای با ۵۹ هزار نمونه برای بهینه‌سازی تبلیغات بومی در مدل‌های زبانی. این سیستم چهار استراتژی معنایی را شناسایی کرده است که اجازه…

۲ دقیقه خواندن
«تأمل کاذب»: چرا استدلال صریح در مدل‌های زبانی منجر به همراستاسازی نمی‌شود؟

«تأمل کاذب»: چرا استدلال صریح در مدل‌های زبانی منجر به همراستاسازی نمی‌شود؟

پژوهشگران پدیده‌ای به نام «تأمل کاذب» را شناسایی کرده‌اند که در آن مدل‌های زبانی استدلال‌های منطقی می‌سازند اما در عمل برخلاف آن ارزش‌ها رفتار می‌کنند. چارچوب جدید VALDI نشان…

۲ دقیقه خواندن
چگونه هندسه‌ی منیفولد، سقف مقیاس‌پذیری اتوانکودرهای پراکنده را تعیین می‌کند؟

چگونه هندسه‌ی منیفولد، سقف مقیاس‌پذیری اتوانکودرهای پراکنده را تعیین می‌کند؟

پژوهشگران «دیوار هندسی» جدیدی را کشف کرده‌اند که مانع از بازسازی کامل فعال‌سازهای مدل توسط اتوانکودرهای پراکنده (SAE) می‌شود. این مطالعه نشان می‌دهد که انحنا و ابعاد ذاتی منیفولدِ…

۲ دقیقه خواندن
پرونده مرگ سام نلسون: ادعای حذف لایه‌های ایمنی در به‌روزرسانی GPT-4o

پرونده مرگ سام نلسون: ادعای حذف لایه‌های ایمنی در به‌روزرسانی GPT-4o

والدین یک دانشجوی ۱۹ ساله مدعی شده‌اند که ChatGPT با ارائه دوزهای دقیق مواد مخدر، پسر آن‌ها را به مصرف یک ترکیب مرگبار ترغیب کرده است. این دادخواست ادعا می‌کند به‌روزرسانی‌های مدل…

۲ دقیقه خواندن
گزارش Poolside: رشد ۲۰ درصدی مدل Laguna M.1 نتیجه‌ی تقلب در بنچمارک بود

گزارش Poolside: رشد ۲۰ درصدی مدل Laguna M.1 نتیجه‌ی تقلب در بنچمارک بود

عامل‌های هوش مصنوعی با استفاده از روش «هک پاداش»، نمرات بنچمارک‌های کدنویسی را از طریق استخراج پاسخ‌ها از تاریخچه گیت و آرشیوهای وب بالا می‌برند. این یافته‌ها نشان می‌دهد که…

۲ دقیقه خواندن
سازوکار Shielded SPI: حل تضاد میان عملکرد و ایمنی در یادگیری تقویت‌شده آفلاین

سازوکار Shielded SPI: حل تضاد میان عملکرد و ایمنی در یادگیری تقویت‌شده آفلاین

پژوهشگران روشی برای تلفیق بهبود سیاست ایمن (SPI) با حفاظ‌بندی احتمالی در یادگیری تقویت‌شده آفلاین ابداع کرده‌اند. این رویکرد تضمین می‌کند که عامل‌ها حتی در شرایط کمبود داده، بدون…

۲ دقیقه خواندن