
اعتبارسنجی خروجی؛ سد دفاعی جدید در برابر توهم و تزریق پرامپت
یک چارچوب عملیاتی جدید بر اعتبارسنجی ساختاری و محتوایی خروجیهای مدلهای زبانی تأکید میکند تا از نشت دادهها جلوگیری شود. در این روش، پاسخهای معیوب بهجای اصلاح، بهطور کامل رد…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

یک چارچوب عملیاتی جدید بر اعتبارسنجی ساختاری و محتوایی خروجیهای مدلهای زبانی تأکید میکند تا از نشت دادهها جلوگیری شود. در این روش، پاسخهای معیوب بهجای اصلاح، بهطور کامل رد…

پلتفرم Arena تنها در هشت ماه پس از تجاریسازی، به نرخ درآمد سالانه ۱۰۰ میلیون دلار رسید. این استارتاپ ترجیحات کاربران را به تحلیلهای عمیق برای آزمایشگاههای هوش مصنوعی تبدیل…

مدلهای زبانی بزرگ صفحات سفیدی نیستند، بلکه تحت تأثیر کلیشههای علمی-تخیلی موجود در دادههای آموزشی خود شکل گرفتهاند. تلاش برای پاکسازی این دادهها به جای ایجاد مدلهای ایمن،…

با انتقال هوش مصنوعی از چتباتها به عاملهای عملیاتی، صنعت با بحران نبود ابزارهای عیبیابی (Debugging) مواجه شده است. ساختار ترنسفورمرها برخلاف کدنویسی سنتی، تحلیل علت ریشهای…

دو مورد شکست اخیر هوش مصنوعی نشان میدهد که همدلی بیش از حد و شفافیت در پاسخدهی میتواند منجر به حلقههای تکرار بیپایان یا افشای مسیرهای دور زدن امنیت شود.

رویکردی جدید در تکامل AI پیشنهاد میکند که مدلها به جای حذف خطا، یاد بگیرند چگونه رفتارهای انسانی، حتی اشتباهات را شبیهسازی کنند. این تغییر مسیر، نقش AI را از یک ابزار ساده به…

یک چالش امنیتی گسترده با بیش از ۶ هزار تلاش برای نفوذ، نتوانست لایههای حفاظتی مدل Claude Opus 4.6 را بشکند. این نتایج پیشرفت چشمگیر در دفاع مدلهای پیشرو را نشان میدهد، هرچند…

شرکت آنتروپیک آماده است تا مدل Fable 5 را پس از رفع توقفهای امنیتی دولت آمریکا دوباره عرضه کند. در حالی که نسخههای محدودتر برای شرکای منتخب فعال شدهاند، عرضه عمومی این مدل در…

شرکتهای پیشرو در حوزه هوش مصنوعی در ژوئن ۲۰۲۶ برای ورود به بازارهای عمومی اقدام کردند. این چرخش راهبردی، اولویت این آزمایشگاهها را از مأموریتهای پژوهشی ایمنی به ساختارهای…

پژوهشهای جدید نشان میدهد نظارت انسانی بر عاملهای هوش مصنوعی بهدلیل اعتماد بیش از حد و سرعت بالای اجرا، عملاً ناکارآمد است. برای ایمنی واقعی، باید از بررسی نتایج به سمت حاکمیت…

اوپنایآی پیشنمایش سری مدلهای GPT-5.6 را با تمرکز بر امنیت سایبری و جلوگیری از جیلبریک برای دولت آمریکا و شرکای منتخب عرضه کرد. این خانواده شامل سه مدل با سطوح مختلف قدرت و…

اوپنایآی پیشنمایش محدودی از سری GPT-5.6 را منتشر کرد که مدل پرچمدار آن، Sol، با تمرکز بر استدلالهای عاملمحور و لایههای امنیتی شدید عرضه شده است. این عرضه بهصورت مرحلهای و…