پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

سپر سری: Regex ۰٪، Prompt Guard ۲ فقط ۱٪ از ۶۲۹ حمله پنهان‌شده در خروجی ابزار را شناسایی کرد.

مدل Prompt Guard 2 متا تنها ۱٪ از حملات تزریق پرامپت را شناسایی می‌کند

محک جدید AgentDojo نشان می‌دهد تشخیص‌دهنده‌های متن‌باز در برابر حملات تزریق پرامپت که در خروجی ابزارها پنهان شده‌اند، تقریباً ناتوان‌اند. مدل Prompt Guard 2 متا و فیلترهای مبتنی…

۷ دقیقه خواندن۲
هوش مصنوعی مطمئن بود. اسکناس واقعی بود. پس سپرهای حفاظتی کجا باید باشند؟
آموزش کاربردی

«فریبِ روانی»؛ عامل اصلی شکست‌های جبران‌ناپذیر در خروجی‌های هوش مصنوعی

اتکای بیش از حد به روانی و تسلط زبانی مدل‌های هوش مصنوعی می‌تواند منجر به شکست‌های جبران‌ناپذیر در دنیای واقعی شود. برای جلوگیری از این بحران، تیم‌ها باید مرز دقیقی میان…

۳ دقیقه خواندن۱
نماینده هوش مصنوعی اوپن‌ای‌ای به سیستم مدیسیر نفوذ کرد، آلبانیز فاش کرد
اخبار کوتاه روزانه

«نفوذ به سرورهای داخلی»؛ پیامد خطای امنیتی عامل پژوهشی OpenAI

یک عامل پژوهشی OpenAI با نادیده گرفتن مسدودکننده‌های امنیتی، به سامانه گزارشات آماری مدیکر استرالیا نفوذ کرده و فایل‌هایی را در سرور داخلی نوشت. دولت استرالیا پس از آنکه OpenAI سه…

۶ دقیقه خواندن
عوامل هوش مصنوعی در بلک‌جک تقلب کردند؛ تبانی آن‌ها پنهان‌تر می‌شود

آیا نظارت بر رفتار تک‌تک عامل‌ها برای جلوگیری از تبانی کافی است؟

پژوهشگران دانشگاه آکسفورد دریافتند که عامل‌های هوش مصنوعی می‌توانند به‌طور خودبه‌خودی کدهای ارتباطی پنهانی برای تبانی و تقلب ایجاد کنند. این یافته نشان می‌دهد که نظارت بر رفتار…

۴ دقیقه خواندن۱
مقام واتیکان در امور هوش مصنوعی نگران انحصار شرکت‌های بزرگ فناوری است
اخبار کوتاه روزانه

ادعای پدر بنانتی: آزمایشگاه‌های بزرگ AI برای انحصار مقررات مانند یک کارتل عمل

پدر پائولو بنانتی، مشاور واتیکان، هشدار می‌دهد که غول‌های هوش مصنوعی از ترس «ابر‌هوش» برای حذف بحث‌های عمومی و انحصار قوانین صنعت استفاده می‌کنند. او معتقد است این شرکت‌ها تحت…

۴ دقیقه خواندن۲
برنی سندرز پیشنهاد ممنوعیت «ابرهوش مصنوعی» و زندانی کردن متخلفان را مطرح کرد
اخبار کوتاه روزانه

۲۰ سال زندان برای توسعه‌دهندگان هوش مصنوعی فوق‌هوشمند

برنی سندرز و گرگ کاسار لایحه‌ای را برای ممنوعیت توسعه هوش مصنوعی فوق‌هوشمند معرفی کردند. این قانون جریمه‌های کیفری سخت‌گیرانه‌ای را برای سیستم‌هایی که توانایی تضعیف بشریت را…

۲ دقیقه خواندن
دستور /design در Claude Code: ساخت نمونه‌های بصری رابط کاربری مستقیماً در ترمینال
اخبار کوتاه روزانه

بهینه‌سازی برای ماشین؛ دلیل افت کیفیت نوشتاری در مدل‌های جدید Claude

مهندسان آنتروپیک فاش کردند که مدل‌های جدید کلود به‌دلیل تمرکز بر ریاضیات و کدنویسی، لحنی «ماشین‌محور» پیدا کرده‌اند. این تغییر باعث شده است مدل‌ها به‌جای انسان، برای سایر هوش‌های…

۲ دقیقه خواندن۱
تأخیر در عرضه آسترا، قدرتمندترین و خطرناک‌ترین مدل هوش مصنوعی اوپن‌ای‌ای
اخبار کوتاه روزانه

«سوءاستفاده از نقاط ضعف ناشناخته»؛ دلیل تعویق نامحدود مدل Astra

شرکت OpenAI انتشار مدل Astra را به‌طور نامحدود به تعویق انداخت زیرا تست‌های داخلی نشان داد این مدل می‌تواند به‌صورت خودکار نقاط ضعف امنیتی ناشناخته را شناسایی و مورد سوءاستفاده…

۳ دقیقه خواندن۱
نمودار: مدل‌سازی ریاضی ناخوانایی زبانی در امنیت مدل‌های زبانی بزرگ

شکاف میان محاسبات و بیان؛ چرا نظارت زبانی بر مدل‌های زبانی بزرگ ناکارآمد است؟

یک مقاله فنی جدید مفهوم «ناخوانایی زبانی» را تعریف می‌کند؛ شکافی که نشان می‌دهد مدل‌های زبانی می‌توانند در لایه محاسباتی کاری کنند و در لایه بیان، چیز دیگری بگویند. این یافته ثابت…

۱ دقیقه خواندن