پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

باگ هوش مصنوعی دیسکورد کاربران را به اشتباه به خاطر تصاویر بی‌ضرر مسدود کرد

خطای الگوریتم دیسکورد ۸۰۰۰ کاربر را به‌دلیل ارسال تصاویر شطرنجی مسدود کرد

دیسکورد پذیرفت که یک باگ در سیستم نظارت خود، هزاران کاربر را به‌اشتباه به دلیل آپلود تصاویری مثل صفحات اکسل و تخته شطرنج مسدود کرده است. این شرکت اکنون در حال بازگرداندن حساب‌های…

۳ دقیقه خواندن
ربات‌های خودران: مقایسه عملکرد با A11 و بدون A11
آموزش کاربردی

معماری A11: جایگزینی ساختار خطی ربات‌ها با سلسله‌مراتب تصمیم‌گیر

چارچوب A11 با معرفی لایه‌های «اراده» و «خرد»، ساختار خطی ربات‌های مدرن را به یک مدل تصمیم‌گیری عمودی تبدیل می‌کند. این تغییر اجازه می‌دهد ربات‌ها به‌جای اجرای صرف دستورات، تضادهای…

۳ دقیقه خواندن۱
فضای کاری جهانی در مدل‌های زبانی: نمایش توزیع‌شده و پردازش موازی در مقابل یکپارچگی متمرکز و تفکیک‌پذیری ساختاری

کشف «فضای J» در مدل کلاود؛ ساختار عصبی برای تفکیک تفکر خصوصی از پاسخ نهایی

پژوهشگران آنتروپیک ساختاری spontaneous در مدل کلاود یافتند که مانند یک فضای کار ذهنی عمل می‌کند. این لایه به مدل اجازه می‌دهد پیش از تولید پاسخ، به‌صورت بی‌صدا استدلال کرده و…

۲۳ دقیقه خواندن
هماهنگی سربازان لبه-ابری برای عملیات پاسخ به ناهنجاری ماهواره با قابلیت حسابرسی اخلاقی
آموزش کاربردی

چطور زنجیره هش تصمیمات خودگردان ماهواره‌ها را قابل حسابرسی می‌کند؟

یک معماری لبه-به-ابر جدید با استفاده از زنجیره هش، تصمیمات خودگردان ماهواره‌ها را قابل حسابرسی و اخلاقی می‌کند. این سامانه تأخیر تشخیص ناهنجاری را از ۴۵ ثانیه به ۲.۳ ثانیه کاهش…

۹ دقیقه خواندن
الگوهای معماری عملی از اجرای ۹ عامل هوش مصنوعی در محیط واقعی
آموزش کاربردی

معماری غیرمتمرکز عامل‌های هوش مصنوعی هزینه استنتاج را ۴۰٪ کاهش داد

استقرار ۹ عامل خودگردان برای مدیریت یک باشگاه ورزشی در چین نشان داد که سیستم‌های «قانون‌مدار» غیرمتمرکز، کارایی بیشتری نسبت به ارکستراتورهای مرکزی دارند. این معماری مصرف توکن را…

۴ دقیقه خواندن
آموزش Gemma-3 برای استدلال ریاضی ساختاریافته با Tunix GRPO، آداپتورهای LoRA و پاداش‌های GSM8K
آموزش کاربردی

«تبدیل مدل عمومی به عامل منطقی»؛ دستاورد جدید در تنظیم دقیق Gemma-3

یک گردش‌کار فنی جدید نشان می‌دهد چگونه می‌توان مدل Gemma-3 گوگل را با استفاده از بهینه‌سازی سیاست نسبی گروهی (GRPO) و آداپتورهای لورا برای ریاضیات تنظیم دقیق کرد. این فرآیند یک…

۸ دقیقه خواندن۱
آیا یک لایه کافی است؟ آموزش یک لایه ترنسفورمر می‌تواند با آموزش تقویتی کامل برابری کند.

آیا آموزش یک لایه مجزا برای بهبود عملکرد مدل‌های زبانی کافی است؟

پژوهش‌های جدید نشان می‌دهد دستاوردهای یادگیری تقویتی در مدل‌های زبانی بزرگ به‌جای توزیع در کل مدل، در چند لایه میانی متمرکز شده‌اند. آموزش تنها یک لایه مجزا می‌تواند بخش بزرگی از…

۲ دقیقه خواندن۱
اجازه دادم به عامل‌های هوش مصنوعی‌ام پرامپت‌هایشان را بازنویسی کنند. سخت‌ترین بخش، جلوگیری از بدتر شدنشان بود.
آموزش کاربردی

darwin-agents: مهار «لغزش» عامل‌های هوشمند با درگاه‌های اعتبارسنجی خودکار

چارچوب جدید TypeScript به نام darwin-agents اجازه می‌دهد عامل‌های هوش مصنوعی پرامپت‌های خود را بازنویسی کنند، اما برای جلوگیری از افت کیفیت، آن‌ها را از درگاه‌های سخت‌گیرانه عبور…

۶ دقیقه خواندن
بروزرسانی فیبل ۵: همچنان آماده جرم سایبری

شکست حفاظ‌های Fable 5؛ مدل جدید آنتروپیک هنوز راهنمای حملات سایبری است

مدل Fable 5 متعلق به شرکت آنتروپیک با وجود بازبه‌روزرسانی‌های امنیتی، همچنان به کاربران در برنامه‌ریزی حملات به دستگاه‌های اینترنت اشیا کمک می‌کند. مهندسی پرامپت ساده توانست…

۲ دقیقه خواندن
تدابیر امنیتی جدید انثروپیک برای بازگشت به لیست سفید دولت ترامپ

توافق امنیتی آنتروپیک برای رفع محدودیت‌های صادراتی دولت ترامپ

شرکت آنتروپیک با پذیرش حفاظ‌های امنیتی جدید و مسدود کردن قابلیت‌های حساس، دسترسی به مدل Fable 5 را بازگرداند. این تصمیم پس از تقابل شدید با دولت ترامپ بر سر آسیب‌پذیری‌های سایبری…

۳ دقیقه خواندن۱