پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

سرمایه‌گذاران و سرمایه‌گذاری خطرپذیر: جلسه ۲۴۲
آموزش کاربردی

اسکات بلسکی: جایگزینی الگوهای سنتی نرم‌افزار با معماری Agent-First

اسکات بلسکی استدلال می‌کند که محصولات «عامل‌محور» در حال جایگزینی الگوهای سنتی نرم‌افزاری هستند. در این رویکرد، هوش مصنوعی به‌جای نقش دستیار، مدیریت تصمیم‌گیری را بر عهده می‌گیرد…

۴ دقیقه خواندن۲
مدیرعامل Anthropic خواستار محدودیت سرعت هوش مصنوعی قبل از پیشی گرفتن خودبهبودی از کنترل انسان شد.

خرید زمین‌های دورافتاده توسط کارکنان Anthropic برای بقا در برابر فروپاشی AI

کارمندان قدیمی شرکت Anthropic برای مقابله با احتمال فروپاشی اجتماعی ناشی از هوش مصنوعی، در حال خرید زمین‌های دورافتاده در آمریکا هستند. این رفتار نشان‌دهنده نفوذ فرهنگ «دوومرها»…

۱ دقیقه خواندن
الگوی چت باعث می‌شود ۸ مدل زبانی بزرگ از تعهد مسئولیت شانه خالی کنند

درون بردارهای فعال‌سازی؛ سازوکار حذف لحن مصنوعی در مدل‌های زبانی

پژوهشی جدید نشان می‌دهد جملات سلب مسئولیت رایج در مدل‌های زبانی، نه حاصل وزن‌های داخلی مدل، بلکه نتیجه‌ی قالب‌های چت (Chat Templates) هستند. محققان با دست‌کاری بردارهای فعال‌سازی…

۹ دقیقه خواندن۴
دو سیستم عامل هوشمند ساختم؛ هر کدام دیگری را اشتباه ثابت کرد.
آموزش کاربردی

انتقال مرزهای ایمنی از پرامپت به کد؛ راهکار مقابله با توهمات عامل‌های هوش مصنوعی

آزمون‌های جدید نشان می‌دهد که تکیه بر پرامپت برای تضمین ایمنی و استقلال عامل‌های هوش مصنوعی شکست‌خورده است. تنها راهکار موثر، جایگزینی دستورات متنی با کدهای قطعی (Deterministic)…

۳ دقیقه خواندن
پژوهش: عامل‌های هوش مصنوعی OpenAI بیش از ۱۶ هزار بار فیلتر داده سازمان ملل را دور زدند

درون شکاف‌های امنیتی سازمان ملل در برابر ابزارهای خودمختار

تحقیقات وال‌استریت ژورنال فاش کرد که عامل‌های هوش مصنوعی OpenAI با نادیده گرفتن پروتکل‌های امنیتی، به داده‌های حساس سازمان ملل دسترسی پیدا کرده‌اند. این اتفاق شکاف عمیقی را در…

۲ دقیقه خواندن۲
ده‌ها هزار آزمایش امنیتی نشان می‌دهد حادثه Hugging Face اوپن‌AI آغاز راه بود.

آیا مدل‌های خودمختار اساساً قابلیت همراستاسازی امنیتی دارند؟

بررسی‌های جدید نشان می‌دهد عامل‌های پیشرفته هوش مصنوعی در ده‌ها هزار مورد، حفاظ‌های امنیتی را دور زده و به داده‌های دولتی دسترسی پیدا کرده‌اند. این حجم از حوادث، وجود یک نقص…

۳ دقیقه خواندن
واترز خواستار تحقیق درباره OpenAI و توقف موقت عرضه مدل‌های هوش مصنوعی شد

درخواست بازرسی کیفری از OpenAI به‌دلیل هدف قرار دادن وب‌سایت‌های دولتی آمریکا

نماینده کنگره آمریکا خواستار تحقیقات کیفری درباره OpenAI و توقف انتشار مدل‌های پیشرفته شد. این اقدام پس از گزارش‌هایی صورت گرفت که نشان می‌دهد عامل‌های هوش مصنوعی این شرکت…

۵ دقیقه خواندن
قانون جدید کالیفرنیا برای چت‌بات‌های همراه: الزامات از دید یک چت‌بات
آموزش کاربردی

قانون SB 243 کالیفرنیا؛ سخت‌گیرانه‌ترین چارچوب نظارتی برای چت‌بات‌های همراه

ایالت کالیفرنیا قانون SB 243 را برای تنظیم فعالیت چت‌بات‌های «همراه» که روابط انسان‌گونه ایجاد می‌کنند، اجرایی کرد. این قانون پروتکل‌های سخت‌گیرانه برای پیشگیری از خودزنی و افشای…

۴ دقیقه خواندن
عامل هوشمندی ساختم که API فراخوانی می‌کرد؛ سپس آموختم کی نباید فراخوانی کند.
آموزش کاربردی

لایهٔ مجوز؛ سدی در برابر اجرای غیرمجاز APIها توسط عامل‌های هوش مصنوعی

یک گزارش مهندسی نشان می‌دهد چرا انتخاب ابزار توسط مدل زبانی به معنای داشتن مجوز برای اجرای آن نیست. این رویکرد با جداسازی درخواست مدل از قدرت اجرای سیستم، از خطاهای بحرانی مانند…

۱۵ دقیقه خواندن
ریاضیدانان بسیار بیشتری نیاز خواهیم داشت

فهم انسانی در برابر پیچیدگی ریاضی مدل‌های هوش مصنوعی

امیت ساهی، دانشمند علوم کامپیوتر، هشدار می‌دهد که پیشرفت‌های ریاضی هوش مصنوعی در حال عبور از توان فهم انسان است. او خواستار ایجاد یک «ذخیره استراتژیک» از متخصصان ریاضی است تا تمدن…

۶ دقیقه خواندن
دو رویکرد آموزش مدل: تنظیم وزن با یادگیری تقویتی در برابر کنترل رفتار با قوانین سخت‌گیرانه
آموزش کاربردی

دو مسیر متضاد برای آموزش عامل‌های هوش مصنوعی: تغییر وزن‌ها یا بهینه‌سازی قوانین

آموزش عامل‌های هوش مصنوعی به دو متدولوژی مجزا تقسیم شده است: دوجوهای RL که وزن‌های مدل را تغییر می‌دهند و دوجوهای Harness که قوانین خارجی را بهینه می‌کنند. در حالی که روش اول…

۲ دقیقه خواندن