پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

نحوه جلوگیری از تزریق سریع در عوامل هوش مصنوعی که محتوای غیرقابل اعتماد می‌خوانند
آموزش کاربردی

گیت‌های سخت‌افزاری در برابر دستورات متنی در امنیت حافظهٔ عامل‌های هوش مصنوعی

یک مکانیزم دفاعی جدید با ایجاد گیت‌های سخت‌افزاری در مرز ابزارها، از «مسموم‌سازی حافظه» جلوگیری می‌کند. این روش به‌جای تکیه بر دستورات متنی، دسترسی‌های خطرناک مانند ارسال…

۷ دقیقه خواندن
تست استرس ربات چت زنده: هویت جعلی ساخت، آمار غلط نقل کرد و نمره ۵۵ گرفت.
آموزش کاربردی

گزارش BotCritic: امتیاز ۵۵ از ۱۰۰ برای چت‌بات‌های Groq در آزمون توهم

یک تست استرس جامع روی عامل‌های هوش مصنوعی نشان داد که روانی در گفتگو، پوششی برای شکست‌های فاجعه‌بار در مواجهه با فشار واقعی است. این گزارش افشای ساختن هویت‌های جعلی و آمارهای…

۴ دقیقه خواندن
باگ هوش مصنوعی دیسکورد کاربران را به اشتباه به خاطر تصاویر بی‌ضرر مسدود کرد

خطای الگوریتم دیسکورد ۸۰۰۰ کاربر را به‌دلیل ارسال تصاویر شطرنجی مسدود کرد

دیسکورد پذیرفت که یک باگ در سیستم نظارت خود، هزاران کاربر را به‌اشتباه به دلیل آپلود تصاویری مثل صفحات اکسل و تخته شطرنج مسدود کرده است. این شرکت اکنون در حال بازگرداندن حساب‌های…

۳ دقیقه خواندن
ربات‌های خودران: مقایسه عملکرد با A11 و بدون A11
آموزش کاربردی

معماری A11: جایگزینی ساختار خطی ربات‌ها با سلسله‌مراتب تصمیم‌گیر

چارچوب A11 با معرفی لایه‌های «اراده» و «خرد»، ساختار خطی ربات‌های مدرن را به یک مدل تصمیم‌گیری عمودی تبدیل می‌کند. این تغییر اجازه می‌دهد ربات‌ها به‌جای اجرای صرف دستورات، تضادهای…

۳ دقیقه خواندن۱
فضای کاری جهانی در مدل‌های زبانی: نمایش توزیع‌شده و پردازش موازی در مقابل یکپارچگی متمرکز و تفکیک‌پذیری ساختاری

کشف «فضای J» در مدل کلاود؛ ساختار عصبی برای تفکیک تفکر خصوصی از پاسخ نهایی

پژوهشگران آنتروپیک ساختاری spontaneous در مدل کلاود یافتند که مانند یک فضای کار ذهنی عمل می‌کند. این لایه به مدل اجازه می‌دهد پیش از تولید پاسخ، به‌صورت بی‌صدا استدلال کرده و…

۲۳ دقیقه خواندن
هماهنگی سربازان لبه-ابری برای عملیات پاسخ به ناهنجاری ماهواره با قابلیت حسابرسی اخلاقی
آموزش کاربردی

چطور زنجیره هش تصمیمات خودگردان ماهواره‌ها را قابل حسابرسی می‌کند؟

یک معماری لبه-به-ابر جدید با استفاده از زنجیره هش، تصمیمات خودگردان ماهواره‌ها را قابل حسابرسی و اخلاقی می‌کند. این سامانه تأخیر تشخیص ناهنجاری را از ۴۵ ثانیه به ۲.۳ ثانیه کاهش…

۹ دقیقه خواندن
الگوهای معماری عملی از اجرای ۹ عامل هوش مصنوعی در محیط واقعی
آموزش کاربردی

معماری غیرمتمرکز عامل‌های هوش مصنوعی هزینه استنتاج را ۴۰٪ کاهش داد

استقرار ۹ عامل خودگردان برای مدیریت یک باشگاه ورزشی در چین نشان داد که سیستم‌های «قانون‌مدار» غیرمتمرکز، کارایی بیشتری نسبت به ارکستراتورهای مرکزی دارند. این معماری مصرف توکن را…

۴ دقیقه خواندن
آموزش Gemma-3 برای استدلال ریاضی ساختاریافته با Tunix GRPO، آداپتورهای LoRA و پاداش‌های GSM8K
آموزش کاربردی

«تبدیل مدل عمومی به عامل منطقی»؛ دستاورد جدید در تنظیم دقیق Gemma-3

یک گردش‌کار فنی جدید نشان می‌دهد چگونه می‌توان مدل Gemma-3 گوگل را با استفاده از بهینه‌سازی سیاست نسبی گروهی (GRPO) و آداپتورهای لورا برای ریاضیات تنظیم دقیق کرد. این فرآیند یک…

۸ دقیقه خواندن۱
آیا یک لایه کافی است؟ آموزش یک لایه ترنسفورمر می‌تواند با آموزش تقویتی کامل برابری کند.

آیا آموزش یک لایه مجزا برای بهبود عملکرد مدل‌های زبانی کافی است؟

پژوهش‌های جدید نشان می‌دهد دستاوردهای یادگیری تقویتی در مدل‌های زبانی بزرگ به‌جای توزیع در کل مدل، در چند لایه میانی متمرکز شده‌اند. آموزش تنها یک لایه مجزا می‌تواند بخش بزرگی از…

۲ دقیقه خواندن۱