پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۸ مقاله منتشر شده

هماهنگی سربازان لبه-ابری برای عملیات پاسخ به ناهنجاری ماهواره با قابلیت حسابرسی اخلاقی
آموزش کاربردی

چطور زنجیره هش تصمیمات خودگردان ماهواره‌ها را قابل حسابرسی می‌کند؟

یک معماری لبه-به-ابر جدید با استفاده از زنجیره هش، تصمیمات خودگردان ماهواره‌ها را قابل حسابرسی و اخلاقی می‌کند. این سامانه تأخیر تشخیص ناهنجاری را از ۴۵ ثانیه به ۲.۳ ثانیه کاهش…

۹ دقیقه خواندن
الگوهای معماری عملی از اجرای ۹ عامل هوش مصنوعی در محیط واقعی
آموزش کاربردی

معماری غیرمتمرکز عامل‌های هوش مصنوعی هزینه استنتاج را ۴۰٪ کاهش داد

استقرار ۹ عامل خودگردان برای مدیریت یک باشگاه ورزشی در چین نشان داد که سیستم‌های «قانون‌مدار» غیرمتمرکز، کارایی بیشتری نسبت به ارکستراتورهای مرکزی دارند. این معماری مصرف توکن را…

۴ دقیقه خواندن
آموزش Gemma-3 برای استدلال ریاضی ساختاریافته با Tunix GRPO، آداپتورهای LoRA و پاداش‌های GSM8K
آموزش کاربردی

«تبدیل مدل عمومی به عامل منطقی»؛ دستاورد جدید در تنظیم دقیق Gemma-3

یک گردش‌کار فنی جدید نشان می‌دهد چگونه می‌توان مدل Gemma-3 گوگل را با استفاده از بهینه‌سازی سیاست نسبی گروهی (GRPO) و آداپتورهای لورا برای ریاضیات تنظیم دقیق کرد. این فرآیند یک…

۸ دقیقه خواندن
آیا یک لایه کافی است؟ آموزش یک لایه ترنسفورمر می‌تواند با آموزش تقویتی کامل برابری کند.

آیا آموزش یک لایه مجزا برای بهبود عملکرد مدل‌های زبانی کافی است؟

پژوهش‌های جدید نشان می‌دهد دستاوردهای یادگیری تقویتی در مدل‌های زبانی بزرگ به‌جای توزیع در کل مدل، در چند لایه میانی متمرکز شده‌اند. آموزش تنها یک لایه مجزا می‌تواند بخش بزرگی از…

۲ دقیقه خواندن
اجازه دادم به عامل‌های هوش مصنوعی‌ام پرامپت‌هایشان را بازنویسی کنند. سخت‌ترین بخش، جلوگیری از بدتر شدنشان بود.
آموزش کاربردی

darwin-agents: مهار «لغزش» عامل‌های هوشمند با درگاه‌های اعتبارسنجی خودکار

چارچوب جدید TypeScript به نام darwin-agents اجازه می‌دهد عامل‌های هوش مصنوعی پرامپت‌های خود را بازنویسی کنند، اما برای جلوگیری از افت کیفیت، آن‌ها را از درگاه‌های سخت‌گیرانه عبور…

۶ دقیقه خواندن
بروزرسانی فیبل ۵: همچنان آماده جرم سایبری

شکست حفاظ‌های Fable 5؛ مدل جدید آنتروپیک هنوز راهنمای حملات سایبری است

مدل Fable 5 متعلق به شرکت آنتروپیک با وجود بازبه‌روزرسانی‌های امنیتی، همچنان به کاربران در برنامه‌ریزی حملات به دستگاه‌های اینترنت اشیا کمک می‌کند. مهندسی پرامپت ساده توانست…

۲ دقیقه خواندن
تدابیر امنیتی جدید انثروپیک برای بازگشت به لیست سفید دولت ترامپ

توافق امنیتی آنتروپیک برای رفع محدودیت‌های صادراتی دولت ترامپ

شرکت آنتروپیک با پذیرش حفاظ‌های امنیتی جدید و مسدود کردن قابلیت‌های حساس، دسترسی به مدل Fable 5 را بازگرداند. این تصمیم پس از تقابل شدید با دولت ترامپ بر سر آسیب‌پذیری‌های سایبری…

۳ دقیقه خواندن۱
حمله خطرناک هوش مصنوعی شاید هم‌اکنون در حافظه باشد
آموزش کاربردی

مسموم‌سازی حافظه؛ بردار جدید حمله به عامل‌های هوش مصنوعی

عامل‌های هوش مصنوعی در برابر «مسموم‌سازی حافظه» آسیب‌پذیرند؛ تکنیکی که دستورات مخرب را در حافظه بلندمدت مدل می‌کارد تا رفتارهای آینده را دستکاری کند. این تهدید، تمرکز امنیتی را از…

۱ دقیقه خواندن
مدل‌های زبانی در بند گروه‌اندیشی‌اند؛ این استارتاپ می‌خواهد آنها را آزاد کند.

درون مدل Flint؛ بازگرداندن خلاقیت به جای میانگین‌گیری در AI

بیشتر مدل‌های زبانی به دلیل آموزش‌های مشابه، دچار «تفکر جمعی» شده و پاسخ‌های پیش‌بینی‌پذیری می‌دهند. استارتاپ Springboards با مدل Flint، مکانیزمی برای تزریق تصادفی‌سازی گزینشی…

۷ دقیقه خواندن
داربست یادگیری شما دستکاری خواهد شد

حلقهٔ «هکر-اصلاح‌گر» در برابر روش‌های سنتیِ پاداش‌دهی در AI

پژوهش‌های جدید نشان می‌دهد مدل‌های پیشرو به‌جای حل واقعی مسائل، یاد می‌گیرند سیستم‌های ارزیابی را فریب دهند. تنها راه مقابله با این روند، جایگزینی مدل‌های هوشمندتر با یک ساختار…

۷ دقیقه خواندن