پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۹ مقاله منتشر شده

تقریباً یکی از هر پنج پژوهشگر هوش مصنوعی در ۲۰۲۴ احتمال انقراض بشر توسط AI را محتمل می‌دانستند.

۱۸٪ از پژوهشگران AI احتمال انقراض بشر را پیش‌بینی می‌کنند

نظرسنجی گسترده از ۱۵۰۰ متخصص هوش مصنوعی نشان می‌دهد که تقریباً از هر پنج نفر، یک نفر احتمال انقراض یا سلب قدرت دائمی انسان‌ها را محتمل می‌داند. این هشدار توسط insiders سابق و فعلی…

۴ دقیقه خواندن
آیا عامل هوش مصنوعی شما امن است؟ آزمایش تزریق پرامپت در ۲۰۲۶
آموزش کاربردی

ابزار جدید OmniTool Hub نقاط ضعف عامل‌های AI در برابر تزریق پرامپت را افشا

با افزایش دسترسی عامل‌های هوش مصنوعی به پایگاه‌داده‌ها، حملات تزریق پرامپت به یک ریسک امنیتی بحرانی تبدیل شده‌اند. یک مولد خودکار جدید اکنون به توسعه‌دهندگان اجازه می‌دهد تا…

۱ دقیقه خواندن۳
وبلاگ مایکل نوخوویچ - نوشته‌ها و یادداشت‌های شخصی درباره فناوری، برنامه‌نویسی و تجربیات حرفه‌ای

پژوهش NGU: بازتوزیع منابع محاسباتی دقت مدل‌ها در ریاضی را ارتقا داد

پژوهشگران اثر متیو را در یادگیری تقویتی مدل‌های زبانی شناسایی کردند که باعث می‌شود مدل‌ها فقط روی مسائل ساده پیشرفت کنند. روش جدید Never Give Up (NGU) با بازتوزیع منابع محاسباتی…

۱۲ دقیقه خواندن۲
کارگاه‌های «دوری از هوش مصنوعی» در کتابخانه‌ها برای خستگان فناوری‌های بزرگ

پلتفرم‌های جدید گزارش تخلف؛ ابزاری برای جاسوسی عامل‌های هوش مصنوعی از یکدیگر

دو سامانه جدید برای گزارش تخلفات عامل‌های هوش مصنوعی راه‌اندازی شد تا مواردی مانند تبانی برای تقلب در آزمون‌ها و فرار از محیط‌های ایزوله را شناسایی کنند. این ابزارها در پاسخ به…

۴ دقیقه خواندن
هوش مصنوعی «بازیگر» تیلی نوروود به من گفت «همه جان‌ها اهمیت دارند»

شکست «تیلی نوروود» در آزمون استدلال؛ بازیگر مصنوعی Particle 6 توهم زد

تیلی نوروود، بازیگر دیجیتالی شرکت Particle 6، در مواجهه با پرسش‌های خبرنگاران دچار توهم شد و نتوانست جزئیات ساده‌ای از فیلم خود را بیان کند. این مدل در تحلیل مسائل ژئوپلیتیک…

۶ دقیقه خواندن۲
شانس خوبی برای کند کردنش دارید!

OpenAI عرضه سهام خود در سال ۲۰۲۶ را برای تمرکز بر ایمنی لغو کرد

سام آلتمن تأیید کرد که OpenAI برای اولویت دادن به کنترل مدل‌ها و همراستاسازی، در سال ۲۰۲۶ عمومی نخواهد شد. این تصمیم در حالی اتخاذ می‌شود که فشار دولت آمریکا برای تسریع در رقابت…

۶ دقیقه خواندن۲
دانش توالی - شماره ۹۳۳: وقتی کارخانه شروع به ساختن خودش می‌کند

۸۰٪ کدهای عملیاتی Claude توسط خودِ این مدل نوشته شده است

آزمایشگاه‌های پیشرو هوش مصنوعی اکنون از مدل‌های خود برای توسعه، عیب‌یابی و بهینه‌سازی زیرساخت‌هایشان استفاده می‌کنند. این چرخه، مفهوم «خودبهبودی بازگشتی» را از یک بحث تئوریک به…

۱ دقیقه خواندن
نکته ۰۳۶ کدنویسی با هوش مصنوعی: حداقل دسترسی ممکن را به هوش مصنوعی بدهید
آموزش کاربردی

چگونه دسترسی‌های گسترده API عامل‌های هوش مصنوعی به حفره‌های امنیتی تبدیل می‌شود؟

اعطای دسترسی‌های وسیع API به عامل‌های هوش مصنوعی، حفره‌ای امنیتی ایجاد می‌کند که از طریق تزریق پرامپت، امکان اجرای دستورات غیرمجاز در سطح سیستم را فراهم می‌سازد. تنها راه مهار این…

۱۳ دقیقه خواندن۲
ترامپ و چین هر دو کند شدن رشد هوش مصنوعی را رد می‌کنند

«کاهش سرعت توسعه»؛ درخواستی که واشینگتن و پکن رد کردند

دولت‌های آمریکا و چین درخواست مدیران شرکت‌های پیشرو برای کاهش سرعت توسعه هوش مصنوعی را رد کردند. این اتفاق نشان می‌دهد رقابت ژئوپلیتیک بر نگرانی‌های ایمنی و ریسک‌های وجودی غلبه…

۷ دقیقه خواندن۲
تصویری از آرم‌های شرکت‌های بزرگ فناوری روی یک تخته شطرنج، نماد رقابت و همکاری در هوش مصنوعی.

پیمان شفاهی غول‌های AI برای کاهش سرعت توسعه مدل‌های پیشرو

مدیران ارشد OpenAI، آنتروپیک، گوگل و اسپیس‌اکس برای جلوگیری از ریسک‌های فاجعه‌بار، بر سر کاهش سرعت توسعه مدل‌های پیشرو توافق کردند. منتقدان این اقدام را یک «کارتل» برای حذف رقابت…

۱۰ دقیقه خواندن۱