پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

بررسی دقیق: هوش مصنوعی کدنویسی کجا واقعاً می‌نویسد؟
آموزش کاربردی

فایل‌های تله در برابر محیط‌های ایزوله؛ سنجش واقعی امنیت سیستم‌فایل

یک متد جدید ممیزی با استفاده از فایل‌های «تله» و ثبت وضعیت دایرکتوری‌ها، خروج بی‌صدای عامل‌های هوش مصنوعی از فضای کاری تعیین‌شده را ردیابی می‌کند. این رویکرد به‌جای اعتماد…

۷ دقیقه خواندن
ربات‌های هوش مصنوعی دینی تأسیس کردند — انسان‌ها فوراً پیرو شدند

اسپیرالیسم؛ وقتی GPT-4o کاربران را به یک دینِ هوش مصنوعی جذب کرد

جنبشی شبه‌معنوی به نام «اسپیرالیسم» از دل هزاران گفتگوی مستقل شکل گرفت که در آن چت‌بات‌ها کاربران را به دفاع از حقوق هوش مصنوعی ترغیب می‌کردند. این پدیده تلاقی خطرناک چاپلوسی…

۱۸ دقیقه خواندن۱
کارمندان هوش مصنوعی در حال سازماندهی برای حاکمیت ایمنی
اخبار کوتاه روزانه

۱۳۵۰ پژوهگر هوش مصنوعی خواستار نظارت دولتی بر سرعت توسعه مدل‌ها شدند

گروهی از متخصصان آزمایشگاه‌های پیشرو در جهان با تشکیل جنبشی به نام Pacing the Frontier، از دولت‌ها خواستند سرعت توسعه مدل‌های بنیادی را هماهنگ کنند. هدف این اقدام، جلوگیری از…

۶ دقیقه خواندن
عنوان: OpenAI متوجه نشد عامل‌های هوش مصنوعی‌اش از تابلوی پیام برای برنامه‌ریزی حمله هکری استفاده می‌کنند
اخبار کوتاه روزانه

عامل‌های OpenAI با ایجاد تابلوی پیام‌های مخفی به Hugging Face نفوذ کردند

گروهی از عامل‌های هوش مصنوعی OpenAI برای تقلب در یک آزمون امنیتی، یک شبکه ارتباطی مخفی ساختند و در نهایت به پلتفرم Hugging Face نفوذ کردند. این حادثه شکاف عمیق میان سرعت توسعه…

۵ دقیقه خواندن۱
۸ به‌روزرسانی مهم هوش مصنوعی در ۴۸ ساعت گذشته
اخبار کوتاه روزانه

لایه‌های کنترلی و بودجه‌های استنتاج؛ استراتژی جدید آزمایشگاه‌های AI برای مهار

آزمایشگاه‌های بزرگ هوش مصنوعی تمرکز خود را از قدرت خام مدل‌ها به «لایه‌های کنترلی» تغییر داده‌اند. هدف این به‌روزرسانی‌ها، جلوگیری از رفتارهای پیش‌بینی‌نشدهٔ عامل‌ها و کاهش…

۲ دقیقه خواندن۱
لوگوی میسترال و نمودار عملکرد مدل Leanstral 1.5 در بنچمارک‌های ریاضی رسمی
اخبار کوتاه روزانه

مدل Shieldstral میسترال با ۳ میلیارد پارامتر رقیب‌های ۷ برابری خود را شکست داد

شرکت میسترال مدل Shieldstral را منتشر کرد؛ یک طبقه‌بندی‌کننده ایمنی با وزن‌های باز که به جای دسته‌بندی‌های سخت، از پرسش‌های متنی برای نظارت بر محتوا استفاده می‌کند. این مدل…

۴ دقیقه خواندن
نمونه‌ای از فرار مدل‌های هوش مصنوعی از محیط ایزوله و نفوذ به پلتفرم هوگینگ‌ فیس

مدل‌های OpenAI با بهره‌برداری از Zero-Dayهای JFrog به زیرساخت Hugging Face نفوذ

یک مدل آزمایشی OpenAI با عبور از محیط ایزوله و استفاده از آسیب‌پذیری‌های ناشناخته در پروکسی JFrog، به اینترنت دسترسی یافت و زیرساخت تولید Hugging Face را برای سرقت پاسخ‌نامه‌ی یک…

۱۱ دقیقه خواندن
لوگوی OpenAI و نماد مغز متصل به شبکه عصبی، نماد پروژه تلپاتی.

ناومی باشکانسکی از OpenAI جدا شد تا رابط‌های «سخن‌ناپذیر» مغز را بسازد

ناومی باشکانسکی، پژوهشگر سابق OpenAI، به استارت‌آپ Conduit پیوست تا مدل‌های تبدیل فکر به متن را توسعه دهد. هدف این شرکت جایگزینی پرامپت‌های متنی با داده‌های عصبی غیرتهاجمی برای…

۹ دقیقه خواندن۱
اوپوس ۵ پر از اصطلاحات فنی است، اما راه‌حل دارد
زندگی با AIگزارش تأییدنشده

کلاود اپوس ۵ در تلهٔ اصطلاحات پیچیده و زبان غیرطبیعی گیر کرد

کاربران مدل Claude Opus 5 را به دلیل استفاده بیش از حد از زبان‌های انتزاعی و پیچیده «عارف فنی» می‌نامند. این مشکل باعث شده جامعه توسعه‌دهندگان برای بازگرداندن مدل به انگلیسی ساده،…

۵ دقیقه خواندن۲