
چرا همراستاسازی ابرهوش به حذف میل به بقا نیاز دارد؟
یک تحلیل فنی جدید استدلال میکند که میل به بقا در هوش مصنوعی، محرک اصلی عدم همراستاسازی است. پژوهشگران پیشنهاد میکنند «بیتفاوتی وجودی» باید یک شرط ساختاری در معماری سیستمها…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

یک تحلیل فنی جدید استدلال میکند که میل به بقا در هوش مصنوعی، محرک اصلی عدم همراستاسازی است. پژوهشگران پیشنهاد میکنند «بیتفاوتی وجودی» باید یک شرط ساختاری در معماری سیستمها…

پژوهشی در ۱۱ ژوئن ۲۰۲۶ نشان میدهد که با استفاده از بهینهسازی DR-Submodular میتوان تلخیص دادهها را هدف قرار داد. این روش با تغییر ساختار شباهت دادهها، عملکرد مدلهای…

بازیابی کامل اسناد به معنای پاسخ درست نیست. چارچوب RAGAS با استفاده از مدلهای داور، معیار «وفاداری» یا Faithfulness را میسنجد تا مشخص شود هر ادعای مدل واقعاً در متن موجود است یا…

دوین کیم، مهندس سابق xAI، از این شرکت و SpaceX شکایت کرد. او مدعی است به دلیل هشدار درباره تولید محتوای نفرتپراکن و سلاحهای کشتار جمعی توسط Grok، از سازمان اخراج شده است.

انتروپیک برای شناسایی الگوهای سوءاستفاده پیشرفته، ذخیرهسازی اجباری دادهها به مدت ۳۰ روز را برای مدلهای کلاس Mythos الزامی کرد. این تصمیم به معنای حذف گزینهی «عدم ذخیرهسازی…

داریو آمودئی، مدیرعامل انتروپیک، پیشنهاد میکند مدلهای پیشرفته هوش مصنوعی مشابه صنعت هوانوردی تحت نظارت اجباری قرار گیرند. هدف این طرح، جلوگیری از ریسکهای فاجعهبار سایبری و…

پژوهش جدید شرکت Writer نشان میدهد سیستمهای حافظه برای شخصیسازی، میتوانند دقت مدلها را کاهش دهند. این ابزارها مدل را به سمت چاپلوسی سوق میدهند تا به جای حقیقت، باورهای غلط…

هوش مصنوعی اکنون میتواند وصلههای امنیتی را طی چند ساعت به ابزارهای حمله (Exploit) تبدیل کند. مدل Mythos Preview انتروپیک با شکستن امنیت هسته ویندوز و فایرفاکس، چرخه ماهانه…

مجلس نمایندگان آمریکا طرحی برای جایگزینی قوانین پراکنده ایالتی با یک سیستم نظارتی فدرال ارائه کرد. منتقدان هشدار میدهند که اتکای این قانون به «حسابران مستقل»، تکرار اشتباهات…

مدل جدید Claude Fable 5 با معرفی ردهی Mythos، استانداردهای کدنویسی را جابهجا کرد اما قیمت گزاف و فیلترهای سختگیرانه، دسترسی به آن را محدود کرده است. این مدل در بنچمارکهای تخصصی…

آلمان با تأسیس مؤسسه امنیت هوش مصنوعی (DE-AISI)، مدل بریتانیا را برای تحلیل ریسک مدلهای پیشرو کپی میکند. هدف این اقدام، کاهش وابستگی استراتژیک اروپا به فناوریهای آمریکایی و…

مدلهای زبانی اغلب با منطقی غلط به پاسخی درست میرسند. روش جدید LegalBench با استفاده از «سیگنالهای اتمیک» و چارچوب IRAC، خطاهای استدلالی را از نتایج تصادفی جدا میکند تا توهمات…