پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۴ مقاله منتشر شده

چرا برای ارزیابی کیفیت صدا دیگر نیازی به آموزش مدل‌های تخصصی نیست؟

چرا برای ارزیابی کیفیت صدا دیگر نیازی به آموزش مدل‌های تخصصی نیست؟

چارچوب جدید JASTIN به مدل‌های زبانی اجازه می‌دهد تا کیفیت صدا، گفتار و موسیقی را بدون نیاز به آموزش‌های خاص و در حالت صفر-شات ارزیابی کنند. این سیستم با دستیابی به دقت در سطح…

۲ دقیقه خواندن۵
رمزگشایی از معماری پنهانی که مدل‌های بینایی را در برابر حملات مصون می‌کند

رمزگشایی از معماری پنهانی که مدل‌های بینایی را در برابر حملات مصون می‌کند

یک مطالعه جدید نشان می‌دهد مقاومت مدل‌های بینایی در برابر حملات خصمانه ناشی از فیلترهای فرکانسی نیست، بلکه ریشه در هندسه‌ی بازنمایی شبیه به انسان دارد. این کشف، مسیر مقابله با…

۲ دقیقه خواندن
چرا نظارت انسانی بر آموزش مدل‌های زبانی دیگر لازم نیست

چرا نظارت انسانی بر آموزش مدل‌های زبانی دیگر لازم نیست

پژوهشگران چارچوب RFT-FM را معرفی کردند که شناسایی و رفع خطاهای تنظیم دقیق مدل‌های زبانی را به‌طور خودکار مدیریت می‌کند. این سیستم با استفاده از اولین بنچ‌مارک جامع در این حوزه،…

۲ دقیقه خواندن
ReGuard: کاهش ۸۵ درصدی شکاف عملکرد در کنترلرهای هوش مصنوعی شبکه

ReGuard: کاهش ۸۵ درصدی شکاف عملکرد در کنترلرهای هوش مصنوعی شبکه

چارچوب ReGuard نقاط شکست بحرانی در کنترلرهای شبکه مبتنی بر RL را شناسایی و با قوانین منطقی سبک اصلاح می‌کند. این متد بدون نیاز به بازآموزی، سقوط عملکرد در بدترین سناریوها را تا…

۲ دقیقه خواندن
Strat-Reasoner؛ پایان شکست‌های مدل‌های زبانی در بازی‌های استراتژیک

Strat-Reasoner؛ پایان شکست‌های مدل‌های زبانی در بازی‌های استراتژیک

پژوهشگران چارچوب جدیدی به نام Strat-Reasoner معرفی کرده‌اند که به مدل‌های زبانی اجازه می‌دهد فرآیند استدلال رقبای خود را مدل‌سازی کنند. این رویکرد بازگشتی منجر به افزایش ۲۲.۱…

۲ دقیقه خواندن۱
معماری «چشم-مغز-دهان»؛ نقطه عطف در واقع‌گرایی عامل‌های چندوجهی

معماری «چشم-مغز-دهان»؛ نقطه عطف در واقع‌گرایی عامل‌های چندوجهی

پژوهشگران با معرفی چارچوب EBM-RL، فرآیند ادراک، استدلال و بیان را از هم تفکیک کردند تا نقش‌آفرینی در ویدئو را متحول کنند. این مدل با استفاده از چهار پاداش مجزا، هماهنگی میان…

۲ دقیقه خواندن
رانش پارامترها؛ حفره‌ی پنهانی که امنیت مدل‌های زبانی را می‌بلعد

رانش پارامترها؛ حفره‌ی پنهانی که امنیت مدل‌های زبانی را می‌بلعد

پژوهشگران کشف کردند که حتی تنظیم دقیق با داده‌های بی‌خطر می‌تواند همراستاسازی امنیتی مدل‌های زبانی بزرگ را نابود کند. برای مقابله با این بحران، متدولوژی جدیدی به نام SQSD معرفی…

۲ دقیقه خواندن
توهم اخلاق؛ چرا «تفکر» در AI فقط یک فیلتر سازگاری است؟

توهم اخلاق؛ چرا «تفکر» در AI فقط یک فیلتر سازگاری است؟

پژوهشی جدید روی ۵ مدل پیشرو نشان می‌دهد که حالت استدلالی تأثیری در تغییر احکام اخلاقی ندارد، اما تضاد بین مدل‌ها را در سناریوهای پیچیده کاهش می‌دهد. در واقع، «تفکر» بیشتر یک ابزار…

۲ دقیقه خواندن
توهم امنیت؛ چرا بنچمارک‌های AI در دنیای واقعی شکست می‌خورند؟

توهم امنیت؛ چرا بنچمارک‌های AI در دنیای واقعی شکست می‌خورند؟

یک مطالعه‌ی جدید فاش می‌کند که بنچمارک‌های استاندارد مدل‌ها نمی‌توانند رفتار هوش مصنوعی در محیط عملیاتی را پیش‌بینی کنند. محققان دریافتند که لایه‌های امنیتی برای هر مدل…

۲ دقیقه خواندن۱
هشدار OpenAI: مدل GPT-5.5 Instant وارد منطقه خطرناک «قابلیت‌های بالا» شد

هشدار OpenAI: مدل GPT-5.5 Instant وارد منطقه خطرناک «قابلیت‌های بالا» شد

اوپن‌ای‌آی مدل GPT-5.5 Instant را معرفی کرد؛ اولین مدل سری سریع که به دلیل قابلیت‌های پیشرفته در حوزه‌های سایبری و بیوشیمی، در دسته «پرخطر» قرار گرفته است. این تغییر به معنای…

۲ دقیقه خواندن