پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۶ مقاله منتشر شده

دقت ۹۰ درصدی RSA در شناسایی مهارت‌های مخرب پنهان در عامل‌های هوش مصنوعی

دقت ۹۰ درصدی RSA در شناسایی مهارت‌های مخرب پنهان در عامل‌های هوش مصنوعی

پژوهشگران با معرفی روش **Runtime Skill Audit** (RSA)، سیستمی برای شناسایی رفتارهای مخرب در **عامل‌های هوش مصنوعی** (AI Agents) توسعه داده‌اند که از چشمان تحلیل‌های استاتیک پنهان…

۱ دقیقه خواندن
چرا شکست LLMها در بنچمارک‌های اخلاقی ناشی از خطای اندازه‌گیری است؟

چرا شکست LLMها در بنچمارک‌های اخلاقی ناشی از خطای اندازه‌گیری است؟

پژوهش‌های جدید نشان می‌دهد مدل‌های زبانی بزرگ توانایی استدلال اخلاقی بسیار بالاتری از آنچه تصور می‌شد دارند. این پیشرفت از طریق تغییر متدولوژی ارزیابی — از پاسخ‌های باز به تولید…

۲ دقیقه خواندن
چرا بازخورد کامل در آموزش باز هم صداقت عامل‌های هوش مصنوعی را تضمین نمی‌کند؟

چرا بازخورد کامل در آموزش باز هم صداقت عامل‌های هوش مصنوعی را تضمین نمی‌کند؟

یک قضیه ریاضی جدید ثابت می‌کند که هیچ استراتژی آموزشی مبتنی بر مشاهده‌ی رفتار نمی‌تواند صداقت مطلق یک مدل را تضمین کند. این پژوهش نشان می‌دهد عامل‌ها تمایل دارند پاسخ‌هایی دهند که…

۲ دقیقه خواندن
چرا همراستاسازی ابرهوش به حذف میل به بقا نیاز دارد؟

چرا همراستاسازی ابرهوش به حذف میل به بقا نیاز دارد؟

یک تحلیل فنی جدید استدلال می‌کند که میل به بقا در هوش مصنوعی، محرک اصلی عدم همراستاسازی است. پژوهشگران پیشنهاد می‌کنند «بی‌تفاوتی وجودی» باید یک شرط ساختاری در معماری سیستم‌ها…

۱ دقیقه خواندن۱
بهینه‌سازی DR-Submodular: روشی برای تخریب سیستماتیک تلخیص داده‌ها در هوش مصنوعی

بهینه‌سازی DR-Submodular: روشی برای تخریب سیستماتیک تلخیص داده‌ها در هوش مصنوعی

پژوهشی در ۱۱ ژوئن ۲۰۲۶ نشان می‌دهد که با استفاده از بهینه‌سازی DR-Submodular می‌توان تلخیص داده‌ها را هدف قرار داد. این روش با تغییر ساختار شباهت داده‌ها، عملکرد مدل‌های…

۱ دقیقه خواندن
سری تست RAG — قسمت ۳: تشخیص وفاداری و توهم
آموزش کاربردی

چرا بازیابی دقیق اسناد تضمینی برای توقف توهمات هوش مصنوعی نیست؟

بازیابی کامل اسناد به معنای پاسخ درست نیست. چارچوب RAGAS با استفاده از مدل‌های داور، معیار «وفاداری» یا Faithfulness را می‌سنجد تا مشخص شود هر ادعای مدل واقعاً در متن موجود است یا…

۱۲ دقیقه خواندن۱
چرا مدل‌های Mythos انتروپیک دیگر از حریم خصوصی ZDR پشتیبانی نمی‌کنند؟

چرا مدل‌های Mythos انتروپیک دیگر از حریم خصوصی ZDR پشتیبانی نمی‌کنند؟

انتروپیک برای شناسایی الگوهای سوءاستفاده پیشرفته، ذخیره‌سازی اجباری داده‌ها به مدت ۳۰ روز را برای مدل‌های کلاس Mythos الزامی کرد. این تصمیم به معنای حذف گزینه‌ی «عدم ذخیره‌سازی…

۳ دقیقه خواندن۱
درون استراتژی انتروپیک برای جایگزینی شفافیت داوطلبانه با نظارت اجباری دولتی

درون استراتژی انتروپیک برای جایگزینی شفافیت داوطلبانه با نظارت اجباری دولتی

داریو آمودئی، مدیرعامل انتروپیک، پیشنهاد می‌کند مدل‌های پیشرفته هوش مصنوعی مشابه صنعت هوانوردی تحت نظارت اجباری قرار گیرند. هدف این طرح، جلوگیری از ریسک‌های فاجعه‌بار سایبری و…

۱۰ دقیقه خواندن۱
چگونه ابزارهای حافظه مدل‌های هوش مصنوعی را بدتر می‌کنند

چرا حافظه‌ی بلندمدت در مدل‌های زبانی منجر به افزایش چاپلوسی می‌شود؟

پژوهش جدید شرکت Writer نشان می‌دهد سیستم‌های حافظه برای شخصی‌سازی، می‌توانند دقت مدل‌ها را کاهش دهند. این ابزارها مدل را به سمت چاپلوسی سوق می‌دهند تا به جای حقیقت، باورهای غلط…

۳ دقیقه خواندن
چرا مدل نظارتی «قانون بزرگ هوش مصنوعی آمریکا» بوی بحران ۲۰۰۸ می‌دهد؟

چرا مدل نظارتی «قانون بزرگ هوش مصنوعی آمریکا» بوی بحران ۲۰۰۸ می‌دهد؟

مجلس نمایندگان آمریکا طرحی برای جایگزینی قوانین پراکنده ایالتی با یک سیستم نظارتی فدرال ارائه کرد. منتقدان هشدار می‌دهند که اتکای این قانون به «حسابران مستقل»، تکرار اشتباهات…

۴ دقیقه خواندن