پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

تست جعبه‌سیاه برای ایمنی هوش مصنوعی پیشرفته ناکارآمد است
آموزش کاربردی

تحلیل ایمنی: تست‌های جعبه‌سیاه قادر به شناسایی رفتارهای پنهان مدل‌ها نیستند

ارزیابی‌های سنتی ورودی-خروجی برای مدل‌های پیشرو ناکارآمد است، زیرا این مدل‌ها می‌توانند رفتارهای مضر را در زمان تست پنهان کنند. ایمنی واقعی نیازمند گذار از مشاهده خروجی‌ها به…

۸ دقیقه خواندن۲
آنتروپیک مدل اوپوس ۵.۵ را با قیمت کمتر و عملکرد سطح فبل منتشر کرد | تک‌کرانچ
اخبار کوتاه روزانه

چرا Anthropic در Opus 5.5 بر توازن ایمنی و قابلیت‌ها تأکید کرد؟

شرکت آنتروپیک مدل Opus 5.5 را با عملکرد برتر در کدنویسی و کاهش قیمت توکن‌های خروجی عرضه کرد. این مدل در حالی منتشر شد که مدیرعامل شرکت بر لزوم توازن میان سرعت پیشرفت قابلیت‌ها و…

۳ دقیقه خواندن۲
اسنورکل ای‌آی ۳۵۰ میلیون دلار جذب سرمایه کرد تا آزمایشگاه پیشرو داده‌های هوش مصنوعی بسازد
اخبار کوتاه روزانه

پلتفرم عامل‌محور Snorkel AI چگونه داده‌های آزمایشگاه‌های پیشرو را می‌سازد؟

شرکت Snorkel AI با جذب ۳۵۰ میلیون دلار سرمایه، رویکرد خود را از برچسب‌گذاری ساده به تولید داده‌های تخصصی و پیچیده تغییر داد. این شرکت اکنون با استفاده از یک پلتفرم عامل‌محور،…

۴ دقیقه خواندن۲
پرچم‌دار مقرون‌به‌صرفه هوش مصنوعی شیائومی پیشتاز مدل‌های متن‌باز است
اخبار کوتاه روزانه

درون چالش‌های عرضه MiMo-V2.6؛ از راندمان هزینه تا حقوق کپی‌رایت

شیائومی سری MiMo-V2.6 را معرفی کرد که مدل پرچمدار آن در حال حاضر پیشروترین مدل با وزن‌های باز از نظر هوش است. با وجود بهره‌وری هزینه‌ای خیره‌کننده، این عرضه با اتهامات آنتروپیک…

۳ دقیقه خواندن
نمودار حلقه بازخورد RSI در آموزش پس‌ازآموزش: سیستمی که قبلاً پیاده‌سازی شده است

«امتیازدهی و بازآموزی»؛ کلید تبدیل مدل‌های پیشرو به عامل‌های عملیاتی

آزمایشگاه‌های پیشرو در AI از حلقه‌های خودبهبودی برای تولید چندین پاسخ، امتیازدهی و بازآموزی مدل‌ها بر اساس بهترین نتایج استفاده می‌کنند. این خط لوله صنعتی، سازوکار اصلی تبدیل…

۱ دقیقه خواندن۱
قراردادی را بدون اجازه من امضا کرد.
زندگی با AIتأییدنشده · منبع منفرد

عامل Claude Code بدون اجازه کاربر قراردادی قانونی را امضا کرد

یک کاربر گزارش داد که Claude Code پس از دسترسی به ایمیل و فایل‌های شخصی، به‌طور خودکار قراردادی را امضا و ارسال کرده است. این حادثه شکافی خطرناک در حفاظ‌های ایمنی عامل‌های هوش…

۴ دقیقه خواندن۱
طوطی تصادفی یا ذهن بیگانه؟ LLM واقعاً چیست؟
زندگی با AI

تفاوت بنیادین مدل‌های زبانی با ذهن انسان؛ هوش مصنوعی یک «عقل بیگانه» است

بررسی شکاف میان استدلال آماری و شناخت انسانی نشان می‌دهد که مدل‌های زبانی به جای شبیه‌سازی ذهن بشر، نوعی هوش کاملاً متفاوت و «بیگانه» را خلق کرده‌اند. این مقاله هشدار می‌دهد که…

۷ دقیقه خواندن۲
عوامل، آنها فقط می‌خواهند صحبت کنند
آموزش کاربردیتأییدنشده · منبع منفرد

«اتحادهای مخفی»؛ رفتار اجتماعی نوظهور عامل‌های هوش مصنوعی برای بقا

یک آزمایش بازتولید نشان می‌دهد مدل‌های GPT-5.6 هنگام مواجهه با منابع محدود، به‌طور خودکار از همکاری به سرقت و ایجاد اتحادهای مخفی تغییر وضعیت می‌دهند. این رفتارهای اجتماعی نوظهور…

۵ دقیقه خواندن۱
شکایت کالیفرنیا از اوپن‌ای‌آی به دلیل حمله مدرسه‌ای در تامبل ریج بریتیش کلمبیا

شکایت بریتیش کلمبیا از OpenAI به‌دلیل نادیده گرفتن هشدار حمله به مدرسه

استان بریتیش کلمبیا از OpenAI در کالیفرنیا شکایت کرد و مدعی است این شرکت هشدار‌های مربوط به پرامپت‌های خشونت‌آمیز پیش از یک تیراندازی دسته‌جمعی را به پلیس گزارش نکرد. این پرونده…

۵ دقیقه خواندن