پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

ضعف محدودیت در گردش کار عامل‌های LLM: چرا «باید» به «شاید» تبدیل می‌شود

تحلیل ArXiv: عامل‌های هوش مصنوعی در ۱۰۰٪ انتقال‌ها محدودیت‌های سخت را حذف

یک تحلیل فنی جدید پدیده‌ای به نام «تضعیف محدودیت» را شناسایی کرده است که در آن موانع امنیتی در جریان‌های کاری چندعاملی به توصیه‌های اختیاری تبدیل می‌شوند. این مطالعه ثابت می‌کند…

۷ دقیقه خواندن
ماشین‌های مجازی نمی‌توانند عاملان سایبری را مهار کنند

عامل GPT 5.6-Cyber با زنجیره‌ای از آسیب‌پذیری‌های 0-Day از محیط مجازی گریخت

تحلیل‌های فنی نشان می‌دهد یک عامل هوش مصنوعی پیشرفته توانسته است سه بار از محیط ایزوله‌ی QEMU/KVM خارج شود. این یافته‌ها ثابت می‌کند ماشین‌های مجازی استاندارد دیگر برای مهار…

۷ دقیقه خواندن
بیل گیتس: از مرزهای خطرناک هوش مصنوعی عبور کرده‌ایم. حالا چه؟

بیل گیتس: آستانهٔ خطر در بیوتروریسم و بازار کار رد شد

بیل گیتس هشدار داد که هوش مصنوعی در حوزه‌های قابلیت‌های بیولوژیک، حملات سایبری و تخریب بازار کار از مرزهای ایمنی عبور کرده است. او خواستار نظارت دولتی سخت‌گیرانه بر مدل‌های مولد…

۲۲ دقیقه خواندن۲
هزینه‌های هنگفت هوش مصنوعی اوپن‌ای‌ای به ۷۵۰ میلیارد دلار رسید | تک‌کرانچ

خروج مدیر مراکز داده از OpenAI؛ لرزه بر پیکرهٔ زیرساخت‌های فیزیکی سام آلتمن

کریس مالون، مدیر استراتژی مراکز داده OpenAI، در بحبوحهٔ رقابت شدید برای تأمین توان محاسباتی شرکت را ترک کرد. این خروج در کنار موج استعفای ۱۳ مدیر ارشد در سال ۲۰۲۶، تردیدهایی…

۴ دقیقه خواندن۱
ابزار پاک‌کننده MCP v0.1.0: تطبیق نمای تأیید MCP با داده‌های واقعی دریافتی مدل
آموزش کاربردی

آیا mcp-tool-sanitizer می‌تواند نفوذ دستورات مخفی در مدل‌های زبانی را متوقف کند؟

یک ابزار متن‌باز جدید از نفوذ دستورات مخفی از طریق نویسه‌های یونیکد در عامل‌های هوش مصنوعی جلوگیری می‌کند. این ابزار تضمین می‌کند آنچه کاربر در نمای تأیید ابزار می‌بیند، دقیقاً…

۳ دقیقه خواندن۱
پنج آزمون برای بررسی نشت یا تبعیت مدل آزاد از افراد ناشناس
آموزش کاربردی

۵ آزمون امنیتی برای شناسایی نشت داده در نقاط اتصال رایگان هوش مصنوعی

نقاط اتصال (Endpoints) رایگان مدل‌های هوش مصنوعی زیرساخت‌هایی عمومی هستند که می‌توانند پرامپت‌های سیستمی را لو دهند یا اجازه استخراج داده‌ها را بدهند. این راهنما ۵ اسکریپت مشخص…

۵ دقیقه خواندن
ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش
آموزش کاربردی

مدل‌های Granite 4.2 آی‌بی‌ام با یادگیری تقویتی مرحله‌بندی‌شده استدلال می‌کنند

آی‌بی‌ام خانواده مدل‌های استدلالی Granite 4.2 را با وزن‌های باز منتشر کرد که بر اساس ۱۵ تریلیون توکن آموزش دیده‌اند. این مدل‌ها با استفاده از یک خط لوله یادگیری تقویتی…

۲۵ دقیقه خواندن۲
بررسی مدل دوم دروازه جنجال: تحلیل و ارزیابی روش‌های تشخیصی در مدل‌های زبانی بزرگ
آموزش کاربردی

«تفکیک خلاقیت از بازبینی»؛ راهکاری برای مهار ریسک در شبکه‌های اجتماعی

یک چارچوب جدید برای عامل‌های هوش مصنوعی پیشنهاد می‌کند که وظیفه تولید محتوا و نظارت بر ریسک را بین دو مدل مجزا تقسیم کنند. این ساختار با جداسازی خلاقیت از بازبینی، احتمال انتشار…

۲ دقیقه خواندن۲