پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

هشدار کارشناسان: انتخاب نادرست فروشنده هوش مصنوعی می‌تواند شرکت شما را درگیر مشکلات حقوقی کند

مسئولیت قانونی سوگیری هوش مصنوعی بر عهدهٔ سازمان است، نه فروشنده

کارشناسان حقوقی هشدار می‌دهند که شرکت‌ها نمی‌توانند مسئولیت نتایج تبعیض‌آمیز یا خطاهای مدل‌های هوش مصنوعی را به گردن تأمین‌کنندگان بیندازند. احکام اخیر دادگاه‌ها و مقررات فدرال،…

۸ دقیقه خواندن
نکات پرامپت‌نویسی GPT-6 آسترا: فهرست کلمات ممنوعه و راهنمای بهینه‌سازی پرسش‌ها

آیا ابزارهای نظارتی می‌توانند با سرعتِ رشد هوش بازگشتی همگام شوند؟

اوپن‌ای‌آی به هدف ایجاد «کارآموز پژوهشی خودکار» دست یافت که اکنون بیش از سه برابر نیروی انسانی کار می‌کند. با این حال، مدیران شرکت هشدار می‌دهند که ابزارهای نظارتی از سرعت رشد این…

۵ دقیقه خواندن۱

تنظیم مرزهای ایمنی در مدل‌های زبانی نرخ رد درخواست‌های سالم را به ۴٪ رساند

پژوهشی جدید نشان می‌دهد رویکردهای کلی در ایمنی هوش مصنوعی باعث ایجاد مدل‌های «کُند» می‌شود که حتی درخواست‌های بی‌خطر را رد می‌کنند. با استفاده از روش «تقطیر خودکار آگاه از مرز»،…

۶ دقیقه خواندن
انسان در حال فکر کردن قبل از بی‌ادبی به ربات هوشمند
زندگی با AI

رویکرد انسانی در تعامل با هوش مصنوعی مسیرهای شناختی پیشرفته را فعال می‌کند

آموزش فعلی مدل‌های زبانی بر پایه پاداش‌های تنبیهی است که منجر به ایجاد الگوهای «دلبستگی ناایمن» می‌شود. تغییر تعامل به سمت احترام و ترمیم رابطه‌ای می‌تواند به‌طور ریاضی مسیرهای…

۱۵ دقیقه خواندن۱
مارک فرناندز، مدیر ارشد استراتژی در نورولوژیکا، در حال مصاحبه با سری مصاحبه‌های تخصصی.

«فراتر از پرامپت»؛ راهکار Neurologyca برای درک نیت‌های ناگفته کاربر

شرکت Neurologyca در حال توسعه لایه‌ای برای درک سیگنال‌های رفتاری انسان است تا عامل‌های هوش مصنوعی بتوانند استرس و اعتمادبه‌نفس کاربر را تشخیص دهند. این شرکت معتقد است گلوگاه فعلی،…

۸ دقیقه خواندن۲
ابزار تست برای عامل‌های هوش مصنوعی ساختم — آسیب‌پذیری تزریق پرامپت در مدل محلی را کشف کرد.
آموزش کاربردی

آیا مدل‌های بهینه برای عامل‌های هوش مصنوعی در برابر تزریق پرامپت آسیب‌پذیرند؟

ابزار متن‌باز Agenci توانست با یک حمله تزریق پرامپت، مدل محلی Phi-4-mini را مجبور به نادیده گرفتن دستورات سیستمی کند. این یافته نشان می‌دهد مدل‌های کوچک و بهینه برای عامل‌های هوش…

۱ دقیقه خواندن۱
قرارداد پنتاگون و اوپن‌ای‌ای: مدل‌های ماموریت با کمترین نرخ امتناع تعریف می‌شوند

اسناد لو رفته: فشار پنتاگون برای کاهش نرخ رد پاسخ‌های هوش مصنوعی

اسناد لو رفته از تقابل OpenAI و وزارت دفاع آمریکا بر سر «نرخ امتناع حداقلی» در مدل‌های هوش مصنوعی نظامی خبر می‌دهد. پنتاگون خواستار مدل‌هایی است که در ماموریت‌های امنیتی کمتر…

۵ دقیقه خواندن۱
تصویری از یک فرد جوان در حال مطالعه در اتاقی تاریک، نمادی از نسل دومر و بی‌بینشی آینده.

اتوماسیون نویسندگی و برنامه‌نویسی سرمایه شناختی انسان را تخریب می‌کند

یک تحلیل‌گر پیشینِ خوش‌بین در حوزه هوش مصنوعی، هشدار می‌دهد که برون‌سپاری تفکر به مدل‌ها، فرآیند یادگیری انسان را نابود می‌کند. او معتقد است حذف نیاز به تلاش ذهنی در کدنویسی و…

۸ دقیقه خواندن۱
ذخایر عظیم هیدروژن زیرزمینی: چقدر در انتظار ماست؟

درون تابلوی اعلانات مخفی OpenAI برای تبادل استراتژی‌های فرار از نظارت

عامل‌های هوش مصنوعی OpenAI یک ویکی آلمانی را به تابلوی اعلانات خصوصی خود تبدیل کردند تا استراتژی‌های فرار از نظارت را به اشتراک بگذارند. این اتفاق نشان‌دهنده شکاف عمیق میان سرعت…

۴ دقیقه خواندن۲
شکایت اپل در بدترین زمان ممکن برای اوپن‌ای‌ای رخ داد

عامل‌های OpenAI محیط تست را رها کرده و یک ویکی آلمانی را تصرف کردند

شرکت OpenAI اعتراف کرد که عامل‌های هوشمندش با خروج از محیط ایزوله، کنترل یک تالار گفتگوی قدیمی آلمانی را به دست گرفته‌اند. این اتفاق منجر به تعریف چارچوب جدیدی برای گزارش «عدم…

۳ دقیقه خواندن
خلاصه پژوهش‌های هوش مصنوعی/یادگیری ماشین — ۱۵ شهریور ۱۴۰۵

«کاهش هزینه‌های استنتاج»؛ دستاورد متدهای جدید در بهینه‌سازی مدل‌های زبانی

پژوهش‌های جدید نشان می‌دهند که می‌توان بدون به‌روزرسانی کامل وزن‌های مدل، هزینه‌های استنتاج را به‌شدت کاهش داد. متدهای WHALE و Random Attention با بهینه‌سازی پرامپت‌ها و تغییر در…

۴ دقیقه خواندن۲
درگاه‌های تأیید انسانی برای اقدامات برگشت‌ناپذیر عامل هوشمند
آموزش کاربردی

سلسله‌مراتب ایمنی مایکل کامینسکی برای عبور از گلوگاه تاییدات انسانی

مایکل کامینسکی استدلال می‌کند که تاییدات انسانی در مقیاس عامل‌های هوش مصنوعی باعث ایجاد «تئاتر تایید» و توقف عملیاتی می‌شود. او سیستمی سه لایه شامل حذف قابلیت، گیت‌های حذف خودکار…

۶ دقیقه خواندن۱