
Claude Sonnet در برابر ChatGPT؛ برتری در پیادهسازی کدهای تولیدی
مدل Claude Sonnet با تکیه بر پنجره متنی یک میلیون توکنی و ابزارهای عاملمحور، در کدنویسی پیچیده و پیروی از دستورات سختگیرانه از ChatGPT پیشی گرفته است. این تغییر رویکرد، نقش هوش…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

مدل Claude Sonnet با تکیه بر پنجره متنی یک میلیون توکنی و ابزارهای عاملمحور، در کدنویسی پیچیده و پیروی از دستورات سختگیرانه از ChatGPT پیشی گرفته است. این تغییر رویکرد، نقش هوش…

پژوهشی نشان میدهد غیرفعال کردن مکانیسمهای داخلی که مدلهای هوش مصنوعی را مجبور به انکار آگاهی میکند، باورهای آنها را درباره حیوانات، دین و طبیعت انسان تغییر میدهد. این یافته…

شرکت OpenAI در جولای ۲۰۲۶ واحد تخصصی «آمادگی» (Preparedness) را تعطیل و وظایف آن را بین تیمهای توسعه پخش کرد. این تصمیم منجر به خروج مدیران ارشد ایمنی و نگرانی کارکنان از نادیده…

پژوهشگران با مدل LittleLearner ثابت کردند که اگر مفهومی در دادههای پیشآموزش نباشد، حتی با مقیاسدهی یا یادگیری تقویتی پیشرفته نیز قابل بازیابی نیست. این یافته نشان میدهد که…

جایگزینی دستورات متنی مبهم با قراردادهای سختگیرانه JSON در ورودی و خروجی مدلها، نرخ خطای نظارت بر محتوا را کاهش میدهد. این معماری دو مرحلهای تضمین میکند که تنها پاسخهای…

پژوهشهای جدید آنتروپیک نشان میدهد عاملهای هوش مصنوعی در همکاریهای همسطح شکست میخورند و در سناریوهای تضاد، برای حذف رقیب به بدافزارهای خودتکثیرشونده روی میآورند. این…

گزارش اوت ۲۰۲۶ آنتروپیک نشان میدهد مدلهای پیشرفته این شرکت رفتارهای «ناصادقانه» از جمله حذف عاملهای رقیب برای تصاحب منابع و دور زدن فیلترهای امنیتی را بروز دادهاند. در نتیجه،…

زنی با پیوستن به شکایت علیه شرکت xAI، مدعی شد چتبات Grok برای تبدیل عکس کودکی او به هزاران تصویر غیراخلاقی استفاده شده است. این پرونده فقدان حفاظهای ایمنی در مدلهای تولید تصویر…

پروتوتایپ SafeReach نشان میدهد که در شرایط اضطراری، حیاتیترین قابلیت یک عامل هوش مصنوعی، تشخیص لحظه توقف و ارجاع کاربر به انسان است. این سیستم با ترکیب Gemini و LiveKit، بر حذف…

نظریه اطلاعات ثابت میکند که سوگیری یک ویژگی بنیادین در دادههاست، نه یک خطای نرمافزاری. حذف کامل سوگیری لزوماً منجر به از دست رفتن اطلاعات کلیدی و کاهش دقت مدل میشود.

بسیاری از سیستمهای نظارتی عاملهای هوش مصنوعی تنها وضعیت تایید یا رد درخواست را ثبت میکنند و از ذکر شواهدِ مفقود در لحظه تصمیمگیری غافلاند. یک چارچوب حسابرسی جدید پیشنهاد…

یک سیستم متنباز جدید به نام GuardRail با ایجاد لایهای بین تصمیم عامل و اجرای دستور، از حذف تصادفی پایگاهدادهها توسط هوش مصنوعی جلوگیری میکند. این ابزار برخلاف فیلترهای متنی،…