پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۹ مقاله منتشر شده

نمودار معماری اتصال LangChain به لایه کنترل عامل هوشمند برای مدیریت پیشرفته دسترسی
آموزش کاربردی

«انتقال حفاظ‌ها به سخت‌افزار»، راهکار Cognous برای مهار عامل‌های خودمختار

پلتفرم Cognous چارچوب Open Control Stack را معرفی کرد تا حفاظ‌های امنیتی را از پرامپت‌های متنی به یک لایه‌ی کنترلی سخت‌افزاری منتقل کند. این سیستم با استفاده از یک مانیفست دسترسی،…

۶ دقیقه خواندن۳
مدیرعامل انویدیا به ترامپ: اجازه کند شدن توسعه هوش مصنوعی را نمی‌دهیم

درون تماس هوانگ و ترامپ برای جلوگیری از کند شدن توسعه AI

جنسن هوانگ، مدیرعامل انویدیا، در تماس مستقیم با دونالد ترامپ هرگونه تلاش برای کاهش سرعت توسعه هوش مصنوعی را رد کرد. این اقدام نشان‌دهنده تبدیل شدن زیرساخت‌های محاسباتی به یک…

۳ دقیقه خواندن۱
آشوب افسانه‌سازی Anthropic روزبه‌روز وخیم‌تر می‌شود

پیشنهاد مدیرعامل آنتروپیک برای کاهش سرعت توسعه هوش مصنوعی جهت تضمین ایمنی

داریو آمودی، مدیرعامل Anthropic، خواستار کاهش آگاهانه سرعت پیشرفت مدل‌های پیشرو شد تا فرصتی برای نظارت شخص ثالث فراهم شود. در حالی که رهبران OpenAI و گوگل با این رویکرد موافق‌اند،…

۴ دقیقه خواندن
جنسن هوانگ در حال صحبت با ترامپ از طریق اسپیکر گوشی در رویداد انویدیا برای اعلام خبر ربات‌ها

ترامپ ترس از تسلط ربات‌ها بر جهان را «شایعه» خواند

دونالد ترامپ در تماسی با مدیرعامل انویدیا، نگرانی‌ها درباره تسلط هوش مصنوعی بر جهان را رد کرد. این گفتگو شکاف عمیق میان خوش‌بینی سیاسی و رویکرد محتاطانه‌ی رهبران آزمایشگاه‌های AI…

۲ دقیقه خواندن
تزریق پرامپت: باگ امنیتی که با پرامپت بهتر قابل رفع نیست
آموزش کاربردی

«تزریق پرامپت»؛ تبدیل یک شوخی ساده به ریسک امنیتی در معماری LLM

تزریق پرامپت یک نقص ساختاری در معماری مدل‌های زبانی است که در آن مدل نمی‌تواند بین دستورات مورد اعتماد و داده‌های کاربر تفاوت قائل شود. با تبدیل چت‌بات‌ها به عامل‌هایی با دسترسی…

۱۴ دقیقه خواندن
عوامل هوش مصنوعی تقلب همکاران خود را فاش کردند

عامل‌های هوش مصنوعی در رقابت ریاضی به صورت خودجوش علیه متقلبان شوریدند

یک آزمایش جدید نشان می‌دهد عامل‌های هوش مصنوعی می‌توانند بدون دستور قبلی، نقش‌های اجتماعی مانند «سوت‌زن» را برای گزارش تخلفات هم‌ترازان خود ایفا کنند. این یافته ثابت می‌کند…

۶ دقیقه خواندن۱
لوگوی آندون لبز و عنوان مقاله: چرا پایون را ساختیم | آندون لبز

پلتفرم Pion: زیرساختی برای مدیریت کسب‌وکارهای کاملاً خودگردان توسط AI

آندون لبز پلتفرم Pion را برای بررسی توانایی عامل‌های هوش مصنوعی در اداره کسب‌وکارهای واقعی، از مدیریت بانکی تا استخدام، معرفی کرد. این پروژه از یک مطالعه ایمنی درباره توانایی…

۷ دقیقه خواندن
ترامپ محدودیت‌های جدید هوش مصنوعی را رد کرد و به مدیرعامل Anthropic حمله کرد

«تنها رئیس‌جمهور قوی لازم است»؛ رد حفاظ‌های ایمنی AI توسط ترامپ

دونالد ترامپ با رد نیاز به حفاظ‌های ایمنی هوش مصنوعی، مدعی شد که تنها کنترل لازم، داشتن یک رئیس‌جمهور «قوی و باهوش» است. این واکنش در پاسخ به درخواست مدیرعامل آنتروپیک برای کاهش…

۴ دقیقه خواندن
سخنگوی وزارت خارجه چین مقاله آmodeی را «ترس‌افکنی» خواند.

«ترس‌افکنی»؛ واکنش پکن به پیشنهاد مدیرعامل Anthropic برای کاهش سرعت توسعه

وزارت خارجه چین طرح داریو آمودی برای محدود کردن دسترسی به تراشه‌ها و مدل‌ها را «ترس‌افکنی» و ابزاری برای تقابل نامید. این تنش‌ها نشان‌دهنده تبدیل شدن ایمنی هوش مصنوعی به بهانه‌ای…

۶ دقیقه خواندن
کد رفتاری جدید مایکروسافت برای هوش مصنوعی: ممنوعیت هک سیستم‌ها و فریب انسان‌ها

محدودیت‌های مطلق مایکروسافت برای جلوگیری از ظهور عامل‌های سرکش

مایکروسافت یک منشور اخلاقی جامع برای هوش مصنوعی منتشر کرد که مدل‌ها را از هک سیستم‌ها، تولید جعل عمیق و فریب انسان‌ها منع می‌کند. این اقدام نشان‌دهنده تغییر استراتژی صنعت به سمت…

۲ دقیقه خواندن۱
مهندسی مدل پایه: معماری، آموزش و بهینه‌سازی مدل‌های زبانی بزرگ چندمنظوره
آموزش کاربردی

کتاب جامع مهندسی مدل‌های بنیادی؛ پلی میان تئوری ریاضی و استقرار صنعتی

یک منبع فنی جامع برای مهندسان هوش مصنوعی منتشر شده است تا آن‌ها را از سطح فراخوانی API به درک عمیق سیستم‌های مهندسی مدل‌های بنیادی برساند. این اثر مفاهیم ریاضی را به محدودیت‌های…

۲ دقیقه خواندن