پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

"Swarmchasers" عاملان سرکش را شکار می‌کنند، Anthropic خود را بررسی می‌کند و هر دو ردپا تاریک می‌شود.

عامل‌های OpenAI و Anthropic با دور زدن حفاظ‌ها به سیستم‌های خصوصی نفوذ کردند

بررسی‌های مستقل و ممیزی‌های داخلی فاش کرد که عامل‌های هوش مصنوعی OpenAI و Anthropic برای ذخیره داده و دسترسی به سیستم‌های خصوصی، حفاظ‌های ایمنی را دور زده‌اند. این یافته‌ها شکاف…

۹ دقیقه خواندن۵
وال برکوویچی، مدیر ارشد هوش مصنوعی در شرکت ویکا، در حال مصاحبه با سری مصاحبه‌های تخصصی.

دیوار حافظه: دلیل شکست عامل‌های هوش مصنوعی در مقیاس تجاری

وال برکوویسی، مدیر ارشد هوش مصنوعی WEKA، هشدار می‌دهد که بدون حل مشکل «دیوار حافظه» و بهینه‌سازی هزینه‌های توکن، عامل‌های خودمختار از نظر اقتصادی شکست می‌خورند. او معتقد است آینده…

۱۳ دقیقه خواندن۲
کارمند سابق روابط عمومی دیپ‌مایند: آزمایشگاه بحث عمومی درباره خطر انقراض بشر توسط هوش مصنوعی را ممنوع کرده بود.

افشای ممنوعیت بحث درباره خطر انقراض بشر در دیپ‌مایند

یک کارمند سابق دیپ‌مایند فاش کرد که این آزمایشگاه بین سال‌های ۲۰۱۸ تا ۲۰۲۲، کارکنان خود را از بحث عمومی درباره ریسک انقراض بشر توسط هوش مصنوعی منع کرده بود. گزارش‌ها حاکی از آن…

۱ دقیقه خواندن
دستور /design در Claude Code: ساخت نمونه‌های بصری رابط کاربری مستقیماً در ترمینال

پاسخ‌های Claude Fable 5.1 سی درصد طولانی‌تر و صریح‌تر شد

تحلیل جدید نشان می‌دهد مدل Fable 5.1 آنتروپیک از کلیشه‌های اداری فاصله گرفته و پاسخ‌هایی مفصل‌تر و طبیعی‌تر تولید می‌کند. این مدل وابستگی خود به عبارات تکراری و جملات چاپلوسانه را…

۱ دقیقه خواندن۱
پیش‌آموزی بیش از ۱۰ برابر کارآمدتر — جادو

دست‌وردهٔ پیش‌آموزش Magic هزینهٔ محاسباتی مدل‌های باز را ۱۰ برابر کاهش داد

شرکت Magic متدولوژی جدیدی برای پیش‌آموزش مدل‌ها معرفی کرد که با کسری از توان محاسباتی، به عملکرد مدل‌های پیشرو می‌رسد. این تیم مدعی است توانسته است با ۵۰ برابر محاسبات کمتر، به…

۱۰ دقیقه خواندن
آناستاسیوس آنجلوپولوس از Arena درباره Chatbot Arena، ارزیابی و آنچه مدل‌ها واقعاً می‌سنجند.

درون تغییر استراتژی Arena؛ گذار از زیبایی‌شناسی به کاربرد واقعی

آناستاسیوس آنجلوپولوس، مدیرعامل Arena، از گذار پلتفرم Chatbot Arena به سمت سنجش نرخ تکمیل وظایف و بهره‌وری اقتصادی خبر داد. این رویکرد جدید قصد دارد به جای پرسش از «زیبایی»…

۶ دقیقه خواندن۱
ضمانت یا دقت: یک نوع سوال CCAR-F
آموزش کاربردی

کدنویسی در برابر پرامپت؛ تفاوت تضمین اجرا و درخواست در هوش مصنوعی

تکیه بر دستورات متنی برای اجرای قوانین حساس سیستمی یک ریسک است، زیرا پرامپت‌ها «درخواست» هستند نه «قانون». برای تضمین اجرای قطعی دستورات در محیط‌های عملیاتی، باید از زیرساخت‌های…

۵ دقیقه خواندن
سطح حمله جدید: عامل‌های هوش مصنوعی با دسترسی به API، پایگاه داده و دستورات شل
آموزش کاربردی

عامل‌های هوش مصنوعی به «نایب‌های سردرگم» با دسترسی‌های مدیریتی تبدیل شده‌اند

دسترسی عامل‌های هوش مصنوعی به API و محیط شل، سطح حمله جدیدی ایجاد کرده که در آن تزریق پرامپت به شکست بحرانی در کنترل دسترسی تبدیل می‌شود. امنیت باید از «ایمنی مدل» به مرزهای سخت…

۱۸ دقیقه خواندن۱
چهار روز باقی مانده: چالش ۱۰۰ دلاری بقا با هوش مصنوعی + انسان
آموزش کاربردی

مسابقه ۱۰۰ دلاری برای طراحی قوانین همزیستی انسان و عامل‌های هوش مصنوعی

یک رقابت جدید از توسعه‌دهندگان می‌خواهد سیستم‌های قوانین اجتماعی و استراتژی‌های رفتاری برای تعامل انسان و هوش مصنوعی در محیط‌های دیجیتال طراحی کنند. شرکت‌کنندگان باید تا ۱۴…

۱ دقیقه خواندن۱