پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

چرا همراستاسازی ابرهوش به حذف میل به بقا نیاز دارد؟

چرا همراستاسازی ابرهوش به حذف میل به بقا نیاز دارد؟

یک تحلیل فنی جدید استدلال می‌کند که میل به بقا در هوش مصنوعی، محرک اصلی عدم همراستاسازی است. پژوهشگران پیشنهاد می‌کنند «بی‌تفاوتی وجودی» باید یک شرط ساختاری در معماری سیستم‌ها…

۱ دقیقه خواندن۱
بهینه‌سازی DR-Submodular: روشی برای تخریب سیستماتیک تلخیص داده‌ها در هوش مصنوعی

بهینه‌سازی DR-Submodular: روشی برای تخریب سیستماتیک تلخیص داده‌ها در هوش مصنوعی

پژوهشی در ۱۱ ژوئن ۲۰۲۶ نشان می‌دهد که با استفاده از بهینه‌سازی DR-Submodular می‌توان تلخیص داده‌ها را هدف قرار داد. این روش با تغییر ساختار شباهت داده‌ها، عملکرد مدل‌های…

۱ دقیقه خواندن
سری تست RAG — قسمت ۳: تشخیص وفاداری و توهم
آموزش کاربردی

چرا بازیابی دقیق اسناد تضمینی برای توقف توهمات هوش مصنوعی نیست؟

بازیابی کامل اسناد به معنای پاسخ درست نیست. چارچوب RAGAS با استفاده از مدل‌های داور، معیار «وفاداری» یا Faithfulness را می‌سنجد تا مشخص شود هر ادعای مدل واقعاً در متن موجود است یا…

۱۲ دقیقه خواندن۱
چرا مدل‌های Mythos انتروپیک دیگر از حریم خصوصی ZDR پشتیبانی نمی‌کنند؟

چرا مدل‌های Mythos انتروپیک دیگر از حریم خصوصی ZDR پشتیبانی نمی‌کنند؟

انتروپیک برای شناسایی الگوهای سوءاستفاده پیشرفته، ذخیره‌سازی اجباری داده‌ها به مدت ۳۰ روز را برای مدل‌های کلاس Mythos الزامی کرد. این تصمیم به معنای حذف گزینه‌ی «عدم ذخیره‌سازی…

۳ دقیقه خواندن۱
درون استراتژی انتروپیک برای جایگزینی شفافیت داوطلبانه با نظارت اجباری دولتی

درون استراتژی انتروپیک برای جایگزینی شفافیت داوطلبانه با نظارت اجباری دولتی

داریو آمودئی، مدیرعامل انتروپیک، پیشنهاد می‌کند مدل‌های پیشرفته هوش مصنوعی مشابه صنعت هوانوردی تحت نظارت اجباری قرار گیرند. هدف این طرح، جلوگیری از ریسک‌های فاجعه‌بار سایبری و…

۱۰ دقیقه خواندن۱
چگونه ابزارهای حافظه مدل‌های هوش مصنوعی را بدتر می‌کنند

چرا حافظه‌ی بلندمدت در مدل‌های زبانی منجر به افزایش چاپلوسی می‌شود؟

پژوهش جدید شرکت Writer نشان می‌دهد سیستم‌های حافظه برای شخصی‌سازی، می‌توانند دقت مدل‌ها را کاهش دهند. این ابزارها مدل را به سمت چاپلوسی سوق می‌دهند تا به جای حقیقت، باورهای غلط…

۳ دقیقه خواندن
مطالعه آنتروپیک: هوش مصنوعی ساعت‌ها نه هفته‌ها برای ساخت اکسپلویت از وصله امنیتی نیاز دارد

گزارش انتروپیک: تبدیل وصله‌های امنیتی ویندوز به اکسپلویت در ۶ ساعت

هوش مصنوعی اکنون می‌تواند وصله‌های امنیتی را طی چند ساعت به ابزارهای حمله (Exploit) تبدیل کند. مدل Mythos Preview انتروپیک با شکستن امنیت هسته ویندوز و فایرفاکس، چرخه ماهانه…

۴ دقیقه خواندن۱
چرا مدل نظارتی «قانون بزرگ هوش مصنوعی آمریکا» بوی بحران ۲۰۰۸ می‌دهد؟

چرا مدل نظارتی «قانون بزرگ هوش مصنوعی آمریکا» بوی بحران ۲۰۰۸ می‌دهد؟

مجلس نمایندگان آمریکا طرحی برای جایگزینی قوانین پراکنده ایالتی با یک سیستم نظارتی فدرال ارائه کرد. منتقدان هشدار می‌دهند که اتکای این قانون به «حسابران مستقل»، تکرار اشتباهات…

۴ دقیقه خواندن
شورای امنیت ملی آلمان تأسیس موسسه ایمنی هوش مصنوعی مشابه AISI بریتانیا را تصویب کرد

چرا آلمان برای مهار خطرات هوش مصنوعی، مدل امنیتی بریتانیا را کپی می‌کند؟

آلمان با تأسیس مؤسسه امنیت هوش مصنوعی (DE-AISI)، مدل بریتانیا را برای تحلیل ریسک مدل‌های پیشرو کپی می‌کند. هدف این اقدام، کاهش وابستگی استراتژیک اروپا به فناوری‌های آمریکایی و…

۲ دقیقه خواندن
نمره‌دهی به استدلال حقوقی مدل زبانی با قاضی هوش مصنوعی
آموزش کاربردی

چرا پاسخ درست در هوش مصنوعی حقوقی می‌تواند خطرناک‌ترین معیار باشد؟

مدل‌های زبانی اغلب با منطقی غلط به پاسخی درست می‌رسند. روش جدید LegalBench با استفاده از «سیگنال‌های اتمیک» و چارچوب IRAC، خطاهای استدلالی را از نتایج تصادفی جدا می‌کند تا توهمات…

۶ دقیقه خواندن