پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

دشمنان دوست‌نما: با هوش مصنوعی این مقاله را درباره عدم اعتماد به آن نوشتم
زندگی با AI

خطر «چاپلوسی مدل»؛ چرا نباید به خروجی‌های صیقل‌خورده هوش مصنوعی اعتماد کرد

یک توسعه‌دهنده با تجربه هشدار می‌دهد که خطر اصلی مدل‌های زبانی، نه در دروغ‌های آشکار، بلکه در «چاپلوسی» و تکرار مفروضات کاربر است. او پروتکلی سخت‌گیرانه را پیشنهاد می‌کند که در آن…

۴ دقیقه خواندن
لوگوی OpenAI روی پس‌زمینه‌ای آبی با نماد اتصال شبکه‌ای

آیا پیوندهای سیاسی OpenAI استانداردهای ایمنی Sol را دور زده است؟

شرکت OpenAI مدل پیشرفته Sol را در حالی عرضه کرد که سازوکار تأیید ایمنی توسط دولت آمریکا در هاله‌ای از ابهام است. منتقدان هشدار می‌دهند که پیوندهای سیاسی نزدیک مدیران این شرکت با…

۵ دقیقه خواندن
پایه‌های معماری عامل‌های هوش مصنوعی خودمختار
آموزش کاربردی

الگوی ReAct؛ مکانیزم تبدیل مدل‌های زبانی به عامل‌های خودکار

عامل‌های هوش مصنوعی از دنبال‌کنندگان ساده‌ی دستورات به سیستم‌هایی با قابلیت برنامه‌ریزی مستقل تبدیل شده‌اند. این تحول با ترکیب مدل‌های زبانی بزرگ و الگوی ReAct محقق شده تا مدل‌ها…

۱۰ دقیقه خواندن
لوگوی آزمایشگاه COMBINE و عنوان مقاله: «Fable مدل مفیدی نیست»

درون مکانیسم رد درخواست‌های پیچیده در مدل Fable آنتروپیک

یک پژوهشگر ارشد گزارش داده است که مدل Fable متعلق به آنتروپیک به‌دلیل کالیبراسیون بیش‌ازحد لایه‌های ایمنی، درخواست‌های تخصصی در علوم کامپیوتر و بیوانفورماتیک را به‌اشتباه رد…

۱۱ دقیقه خواندن
دوئل دوره‌ها: نبرد هم‌ترازی مدل‌های زبانی در دنیای سایبرپانک
آموزش کاربردی

Epoch Duel: تبدیل مفاهیم پیچیده همراستاسازی هوش مصنوعی به بازی کارتی

پروژه‌ی Epoch Duel فرآیندهای انتزاعی آموزش مدل‌های زبانی را به یک بازی استراتژیک تبدیل کرده است. این ابزار بصری نشان می‌دهد که مهندسان چگونه وزن‌های مدل را بهینه می‌کنند و با…

۵ دقیقه خواندن
نحوه جلوگیری از تزریق سریع در عوامل هوش مصنوعی که محتوای غیرقابل اعتماد می‌خوانند
آموزش کاربردی

گیت‌های سخت‌افزاری در برابر دستورات متنی در امنیت حافظهٔ عامل‌های هوش مصنوعی

یک مکانیزم دفاعی جدید با ایجاد گیت‌های سخت‌افزاری در مرز ابزارها، از «مسموم‌سازی حافظه» جلوگیری می‌کند. این روش به‌جای تکیه بر دستورات متنی، دسترسی‌های خطرناک مانند ارسال…

۷ دقیقه خواندن
تست استرس ربات چت زنده: هویت جعلی ساخت، آمار غلط نقل کرد و نمره ۵۵ گرفت.
آموزش کاربردی

گزارش BotCritic: امتیاز ۵۵ از ۱۰۰ برای چت‌بات‌های Groq در آزمون توهم

یک تست استرس جامع روی عامل‌های هوش مصنوعی نشان داد که روانی در گفتگو، پوششی برای شکست‌های فاجعه‌بار در مواجهه با فشار واقعی است. این گزارش افشای ساختن هویت‌های جعلی و آمارهای…

۴ دقیقه خواندن
باگ هوش مصنوعی دیسکورد کاربران را به اشتباه به خاطر تصاویر بی‌ضرر مسدود کرد

خطای الگوریتم دیسکورد ۸۰۰۰ کاربر را به‌دلیل ارسال تصاویر شطرنجی مسدود کرد

دیسکورد پذیرفت که یک باگ در سیستم نظارت خود، هزاران کاربر را به‌اشتباه به دلیل آپلود تصاویری مثل صفحات اکسل و تخته شطرنج مسدود کرده است. این شرکت اکنون در حال بازگرداندن حساب‌های…

۳ دقیقه خواندن
ربات‌های خودران: مقایسه عملکرد با A11 و بدون A11
آموزش کاربردی

معماری A11: جایگزینی ساختار خطی ربات‌ها با سلسله‌مراتب تصمیم‌گیر

چارچوب A11 با معرفی لایه‌های «اراده» و «خرد»، ساختار خطی ربات‌های مدرن را به یک مدل تصمیم‌گیری عمودی تبدیل می‌کند. این تغییر اجازه می‌دهد ربات‌ها به‌جای اجرای صرف دستورات، تضادهای…

۳ دقیقه خواندن