پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

چرا گوگل دیپ‌مایند را ترک کردم: داستان یک پژوهشگر از بحران اخلاقی هوش مصنوعی

چرا گوگل DeepMind محدودیت‌های اخلاقی Gemini را پیش پنتاگون کنار گذاشت؟

افشای جزئیات قرارداد جدید گوگل با پنتاگون نشان می‌دهد این شرکت حفاظ‌های اخلاقی علیه سلاح‌های خودمختار را کنار گذاشته است. این توافق به ارتش آمریکا اجازه می‌دهد فیلترهای ایمنی مدل…

۵۴ دقیقه خواندن
هکر هوش مصنوعی GPT-Red شرکت OpenAI برای افزایش امنیت مدل‌ها ساخته شد.

«اتوماسیون Red-Teaming»؛ راهکار جدید OpenAI برای شناسایی حفره‌های امنیتی

اوپن‌ای‌آی مدل تخصصی GPT-Red را برای شناسایی و رفع خودکار حفره‌های امنیتی مدل‌های دیگر توسعه داده است. این سیستم با استفاده از یک حلقه «بازی با خود»، استواری GPT-5.6 را به‌طوری…

۵ دقیقه خواندن
فضای J، مدل‌های متن‌باز — نسخه ۲

بردار‌های هدایت مفاهیم در مدل‌های مختلف هوش مصنوعی با چرخش خطی منتقل می‌شوند

پژوهش‌های جدید نشان می‌دهد بردار‌های هدایت (Steering Vectors) یک مدل زبانی را می‌توان با یک چرخش ریاضی ساده به مدل دیگری از خانواده‌ای متفاوت منتقل کرد. این یافته ثابت می‌کند…

۲۰ دقیقه خواندن
مقیاس‌سنجی کیفیت انسانی صدای هوش مصنوعی در دنیای واقعی با VoiceEQ

شکاف عمیق میان نمرات فنی و کیفیت انسانی در مدل‌های صوتی هوش مصنوعی

پلتفرم Hume با معرفی محک Real World VoiceEQ نشان داد که مدل‌های صوتی علیرغم نمرات بالای فنی، در درک احساسات و بافت‌های صوتی شکست می‌خورند. داده‌ها حاکی از آن است که هیچ مدل واحدی…

۵ دقیقه خواندن
کارکنان اوپن‌ای‌آی از یک کمیته اقدام سیاسی رقیب برای مقابله با مدیرعامل خود حمایت مالی می‌کنند

۸ сотруд OpenAI بیش از ۲۱۵ هزار دلار برای محدود کردن نفوذ مدیران خود پرداخت

تعدادی از کارکنان فعلی و سابق OpenAI با حمایت مالی از یک کمیته اقدام سیاسی (Super PAC)، مستقیماً با استراتژی‌های گرگ بروکمن برای جلوگیری از قانون‌گذاری هوش مصنوعی مقابله می‌کنند.…

۶ دقیقه خواندن
نقشه راه کنترل هوش مصنوعی دیپ‌مایند گوگل: پنج آزمون امنیتی عامل هوشمند
آموزش کاربردی

۵ آزمون امنیتی برای اعتبارسنجی نقشه راه کنترل هوش مصنوعی گوگل

یک چارچوب فنی جدید، نقشه راه کنترل هوش مصنوعی گوگل دیپ‌مایند را به پنج آزمون امنیتی تکرارپذیر برای عامل‌های کدنویسی تبدیل کرده است. این رویکرد تمرکز را از همراستاسازی مدل به تعیین…

۲ دقیقه خواندن
همکاری آمریکا و چین برای کاهش مخاطرات فوری هوش مصنوعی | بروکینگز

«تبادل تجربیات»؛ راهکار پیشنهادی برای پیشگیری از تلهٔ کنترل تسلیحات AI

ایالات متحده و چین برای کاهش خطرات امنیتی هوش مصنوعی، گفتگوهای فنی غیررسمی را آغاز کردند. تحلیلگران تأکید دارند که برای موفقیت این مسیر، باید به‌جای معاهدات سخت‌گیرانه، بر تبادل…

۱۱ دقیقه خواندن
فرشتگان نگهبان: شخصی‌سازی مدل زبانی برای بهره‌وری و امنیت

مدل‌های «منجمد» مانع شخصی‌سازی هوش مصنوعی برای متخصصان دانش‌بنیان شدند

تحلیلی فنی نشان می‌دهد پارادایم فعلی چت‌بات‌ها بر پایه وزن‌های ثابت، با نیازهای بهره‌وری و امنیت متخصصان در تضاد است. چارچوب پیشنهادی «فرشته نگهبان»، جایگزینی مدل‌های عمومی را با…

۵۲ دقیقه خواندن
پاسخ کلود در هندی گرم‌تر و در روسی دقیق‌تر است؛ زبان پاسخ هوش مصنوعی را شکل می‌دهد.

تغییر شخصیت Claude بر اساس زبان و مدل؛ از صمیمیت در هندی تا سخت‌گیری در روسی

پژوهش جدید آنتروپیک نشان می‌دهد مدل‌های Claude بسته به زبان مورد استفاده، ویژگی‌های رفتاری متفاوتی از خود نشان می‌دهند. این تحلیل تفاوت‌های شخصیتی میان خانواده‌های Sonnet و Opus…

۳ دقیقه خواندن
چت‌بات پیش‌بینی‌کننده: چرا مردم رازها را با ChatGPT در میان می‌گذارند

کدهای گم‌شدهٔ ELIZA؛ ریشه‌های روان‌شناختی توهمات در هوش مصنوعی مدرن

بازکشف کدهای منبع برنامهٔ ELIZA از دههٔ ۶۰ میلادی نشان می‌دهد که مدل‌های زبانی بزرگ امروز همچنان بر پایهٔ همان ترفند روان‌شناختی پیشین عمل می‌کنند. «اثر الیزا» توضیح می‌دهد چرا…

۱۰ دقیقه خواندن
روش جدید MIT مدل‌های هوش مصنوعی آموزش‌دیده بر تصاویر سوءاستفاده از کودکان را بدون تولید آن‌ها شناسایی می‌کند

روش «کاوش گوسی» MIT مدل‌های هوش مصنوعیِ خطرناک را بدون تولید تصویر شناس می‌کند

محققان MIT روشی برای شناسایی مدل‌های تنظیم‌شده روی محتوای کودک‌آزار (CSAM) ابداع کردند که بدون نیاز به تولید حتی یک تصویر، ماهیت مدل را می‌فهمد. این دستاورد موانع قانونی تست‌های…

۴ دقیقه خواندن