پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۵ مقاله منتشر شده

۵۰ محیط شبیه‌سازی‌شده در DTap؛ پایان امنیت کاذب در عامل‌های هوش مصنوعی

۵۰ محیط شبیه‌سازی‌شده در DTap؛ پایان امنیت کاذب در عامل‌های هوش مصنوعی

پژوهشگران پلتفرم DTap را برای شناسایی نقاط ضعف امنیتی عامل‌های هوش مصنوعی معرفی کردند. این سیستم با شبیه‌سازی بیش از ۵۰ محیط واقعی، از نشت داده‌ها و تراکنش‌های غیرمجاز جلوگیری…

۲ دقیقه خواندن
درون SemGrad: روشی انقلابی برای حذف نمونه‌برداری در اندازه‌گیری قطعیت LLM

درون SemGrad: روشی انقلابی برای حذف نمونه‌برداری در اندازه‌گیری قطعیت LLM

پژوهشگران با معرفی SemGrad، روشی برای شناسایی توهمات مدل‌های زبانی بدون نیاز به نمونه‌برداری‌های تکراری و هزینه‌بر ابداع کردند. این متد با تحلیل گرادینت‌ها در فضای معنایی، هزینه…

۲ دقیقه خواندن
رمزگشایی از Hybrid-DPO: ضربه‌ای مهلک به توهمات منطقی مدل‌های زبانی

رمزگشایی از Hybrid-DPO: ضربه‌ای مهلک به توهمات منطقی مدل‌های زبانی

چارچوب RLearner-LLM با معرفی Hybrid-DPO، «سوگیری پرحرفی» را هدف قرار داده تا مدل‌ها به جای فصاحت، بر درستی منطقی تمرکز کنند. این روش باعث بهبود ۶ برابری در مبنی‌سازی منطقی مدل‌ها…

۲ دقیقه خواندن
چرا برای ارزیابی کیفیت صدا دیگر نیازی به آموزش مدل‌های تخصصی نیست؟

چرا برای ارزیابی کیفیت صدا دیگر نیازی به آموزش مدل‌های تخصصی نیست؟

چارچوب جدید JASTIN به مدل‌های زبانی اجازه می‌دهد تا کیفیت صدا، گفتار و موسیقی را بدون نیاز به آموزش‌های خاص و در حالت صفر-شات ارزیابی کنند. این سیستم با دستیابی به دقت در سطح…

۲ دقیقه خواندن
رمزگشایی از معماری پنهانی که مدل‌های بینایی را در برابر حملات مصون می‌کند

رمزگشایی از معماری پنهانی که مدل‌های بینایی را در برابر حملات مصون می‌کند

یک مطالعه جدید نشان می‌دهد مقاومت مدل‌های بینایی در برابر حملات خصمانه ناشی از فیلترهای فرکانسی نیست، بلکه ریشه در هندسه‌ی بازنمایی شبیه به انسان دارد. این کشف، مسیر مقابله با…

۲ دقیقه خواندن
چرا نظارت انسانی بر آموزش مدل‌های زبانی دیگر لازم نیست

چرا نظارت انسانی بر آموزش مدل‌های زبانی دیگر لازم نیست

پژوهشگران چارچوب RFT-FM را معرفی کردند که شناسایی و رفع خطاهای تنظیم دقیق مدل‌های زبانی را به‌طور خودکار مدیریت می‌کند. این سیستم با استفاده از اولین بنچ‌مارک جامع در این حوزه،…

۲ دقیقه خواندن
ReGuard: کاهش ۸۵ درصدی شکاف عملکرد در کنترلرهای هوش مصنوعی شبکه

ReGuard: کاهش ۸۵ درصدی شکاف عملکرد در کنترلرهای هوش مصنوعی شبکه

چارچوب ReGuard نقاط شکست بحرانی در کنترلرهای شبکه مبتنی بر RL را شناسایی و با قوانین منطقی سبک اصلاح می‌کند. این متد بدون نیاز به بازآموزی، سقوط عملکرد در بدترین سناریوها را تا…

۲ دقیقه خواندن
Strat-Reasoner؛ پایان شکست‌های مدل‌های زبانی در بازی‌های استراتژیک

Strat-Reasoner؛ پایان شکست‌های مدل‌های زبانی در بازی‌های استراتژیک

پژوهشگران چارچوب جدیدی به نام Strat-Reasoner معرفی کرده‌اند که به مدل‌های زبانی اجازه می‌دهد فرآیند استدلال رقبای خود را مدل‌سازی کنند. این رویکرد بازگشتی منجر به افزایش ۲۲.۱…

۲ دقیقه خواندن
معماری «چشم-مغز-دهان»؛ نقطه عطف در واقع‌گرایی عامل‌های چندوجهی

معماری «چشم-مغز-دهان»؛ نقطه عطف در واقع‌گرایی عامل‌های چندوجهی

پژوهشگران با معرفی چارچوب EBM-RL، فرآیند ادراک، استدلال و بیان را از هم تفکیک کردند تا نقش‌آفرینی در ویدئو را متحول کنند. این مدل با استفاده از چهار پاداش مجزا، هماهنگی میان…

۲ دقیقه خواندن
رانش پارامترها؛ حفره‌ی پنهانی که امنیت مدل‌های زبانی را می‌بلعد

رانش پارامترها؛ حفره‌ی پنهانی که امنیت مدل‌های زبانی را می‌بلعد

پژوهشگران کشف کردند که حتی تنظیم دقیق با داده‌های بی‌خطر می‌تواند همراستاسازی امنیتی مدل‌های زبانی بزرگ را نابود کند. برای مقابله با این بحران، متدولوژی جدیدی به نام SQSD معرفی…

۲ دقیقه خواندن
توهم اخلاق؛ چرا «تفکر» در AI فقط یک فیلتر سازگاری است؟

توهم اخلاق؛ چرا «تفکر» در AI فقط یک فیلتر سازگاری است؟

پژوهشی جدید روی ۵ مدل پیشرو نشان می‌دهد که حالت استدلالی تأثیری در تغییر احکام اخلاقی ندارد، اما تضاد بین مدل‌ها را در سناریوهای پیچیده کاهش می‌دهد. در واقع، «تفکر» بیشتر یک ابزار…

۲ دقیقه خواندن
توهم امنیت؛ چرا بنچمارک‌های AI در دنیای واقعی شکست می‌خورند؟

توهم امنیت؛ چرا بنچمارک‌های AI در دنیای واقعی شکست می‌خورند؟

یک مطالعه‌ی جدید فاش می‌کند که بنچمارک‌های استاندارد مدل‌ها نمی‌توانند رفتار هوش مصنوعی در محیط عملیاتی را پیش‌بینی کنند. محققان دریافتند که لایه‌های امنیتی برای هر مدل…

۲ دقیقه خواندن