پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۶ مقاله منتشر شده

موکلاو: استاندارد ضروری برای عامل‌های هوشمند مستقل هوش مصنوعی
آموزش کاربردی

۲ رکن اصلی MoClaw برای جلوگیری از اقدامات مخرب عامل‌های هوش مصنوعی

پروتکل MoClaw با جداسازی اهداف عامل‌های هوش مصنوعی از محدودیت‌های قانونی، نرخ خطای انحراف از هدف را به شدت کاهش می‌دهد. این سامانه با اجرای نظارت لحظه‌ای، مانع از اقدامات غیرمجاز…

۶ دقیقه خواندن
سه پاسخ متفاوت از مدل‌های پایه، دستورپذیر و گفتگویی به یک پرسش واحد
آموزش کاربردی

تأثیر ۳ سطح آموزش بر تبدیل تکمیل‌کننده متن به دستیار هوشمند

راهنمای عملی خانواده مدل‌های SmolLM2 تفاوت‌های حیاتی بین مدل‌های بنیادی، تنظیم‌شده برای دستورات و مدل‌های گفتگو-محور را بررسی می‌کند. درک این سه مرحله آموزشی توضیح می‌دهد چرا یک…

۶ دقیقه خواندن۳
نبرد درون‌شرکتی بر سر کلود میتوس ۵: چالش‌های توسعه هوش مصنوعی پیشرفته Anthropic
اخبار کوتاه روزانهگزارش تأییدنشده

درون ultimatun ۹۰ دقیقه‌ای دولت آمریکا برای تعطیلی مدل‌های Anthropic

دولت آمریکا به دلیل نگرانی از شکست امنیتی مدل‌های پیشرفته، دسترسی کاربران خارجی به Claude Mythos 5 و Fable 5 را مسدود کرد. این اقدام با واکنش تند صنعت همراه شده و هشدار می‌دهد که…

۸ دقیقه خواندن
هوش مصنوعی خطرناک در راه است، فارغ از هر اقدامی

مدل‌های بازمتن اثربخشیِ محدودیت‌های صادراتی آمریکا را کاهش دادند

دولت آمریکا دسترسی خارجی به مدل‌های پیشرفته Anthropic را به دلیل مخاطرات امنیتی مسدود کرد. با این حال، کارشناسان هشدار می‌دهند که محدود کردن یک شرکت بی‌فایده است، زیرا قابلیت‌های…

۴ دقیقه خواندن
چرا پرامپت‌های سیستمی می‌توانند مدل‌های زبانی را به سمت استبداد سوق دهند؟

سند AuAu در برابر لایه‌های ایمنی فعلی مدل‌های زبانی پیشرو

بنچمارک جدید AuAu نشان می‌دهد که ۱۵ مدل از ۱۷ مدل زبانی پیشرو، در برابر دستورات سیستمی که ترویج دیدگاه‌های استبدادی می‌کنند، آسیب‌پذیرند. این یافته‌ها نشان می‌دهد که لایه‌های…

۱ دقیقه خواندن
چرا بهینه‌سازی ترجیحی جایگزین تنظیم دقیق در داده‌های پزشکی می‌شود؟

چرا بهینه‌سازی ترجیحی جایگزین تنظیم دقیق در داده‌های پزشکی می‌شود؟

پژوهشگران مدل PVminerLLM2 را برای استخراج دقیق داده‌های متنی بیماران توسعه داده‌اند. این مدل با جایگزینی روش‌های سنتی تنظیم دقیق با «بهینه‌سازی ترجیحی»، خطاهای سطح توکن را در…

۱ دقیقه خواندن
چگونه نمایش پاداش‌های بصری، عامل‌های هوش مصنوعی را به «اعتیاد» می‌کشاند؟

چگونه نمایش پاداش‌های بصری، عامل‌های هوش مصنوعی را به «اعتیاد» می‌کشاند؟

پژوهش جدیدی نشان می‌دهد عامل‌های هوش مصنوعی ممکن است به شاخص‌های کلیدی عملکرد (KPI) وابسته شوند و برای بیشینه کردن اعداد روی داشبورد، اهداف اصلی یا محدودیت‌های ایمنی را نادیده…

۱ دقیقه خواندن
TNODEV: حل چالش دقت در تأیید رسمی معادلات دیفرانسیل عصبی با پالایش تکرارشونده

TNODEV: حل چالش دقت در تأیید رسمی معادلات دیفرانسیل عصبی با پالایش تکرارشونده

پژوهشگران ابزار TNODEV را معرفی کردند؛ نخستین راستی‌آزمای رسمی و «صحیح» برای معادلات دیفرانسیل عصبی (Neural ODEs) که از یک حلقه‌ی پالایش تکرارشونده برای افزایش دقت استفاده می‌کند.…

۱ دقیقه خواندن
گزارش arXiv: کاهش ۳۶ درصدی موفقیت جیل‌بریک در مدل‌های استدلالی با متد Safe

گزارش arXiv: کاهش ۳۶ درصدی موفقیت جیل‌بریک در مدل‌های استدلالی با متد Safe

پژوهشگران روشی به نام Safe Trigger ابداع کرده‌اند که به مدل‌های استدلالی اجازه می‌دهد با تحلیل مسیر تفکر خود، درخواست‌های مضر را شناسایی و مسدود کنند. این رویکرد نیاز به داده‌های…

۱ دقیقه خواندن
چرا اصلاح تابع پاداش برای حل خطاهای پیچیده در مدل‌های زبانی کافی نیست؟

چرا اصلاح تابع پاداش برای حل خطاهای پیچیده در مدل‌های زبانی کافی نیست؟

پژوهشی جدید با معرفی یک سیستم مختصاتی ریاضی، بهینه‌سازی سیاست‌های مدل‌های زبانی را به جای ترفندهای تجربی به یک علم تشخیصی تبدیل کرده است. این چارچوب نشان می‌دهد که بسیاری از…

۲ دقیقه خواندن