پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۸ مقاله منتشر شده

هجوم عرضه اولیه سهام هوش مصنوعی: پیامدهای ورود Anthropic و OpenAI به بورس

گزارش بازار: تغییر اولویت دو آزمایشگاه AI از پژوهش به سودآوری

شرکت‌های پیشرو در حوزه هوش مصنوعی در ژوئن ۲۰۲۶ برای ورود به بازارهای عمومی اقدام کردند. این چرخش راهبردی، اولویت این آزمایشگاه‌ها را از مأموریت‌های پژوهشی ایمنی به ساختارهای…

۴ دقیقه خواندن
هوش مصنوعی عامل‌محور: تعریف و ضرورت تغییر نظارت بر آن
آموزش کاربردی

چرا نظارت انسانی نمی‌تواند جلوی خطاهای عامل‌های هوش مصنوعی را بگیرد؟

پژوهش‌های جدید نشان می‌دهد نظارت انسانی بر عامل‌های هوش مصنوعی به‌دلیل اعتماد بیش از حد و سرعت بالای اجرا، عملاً ناکارآمد است. برای ایمنی واقعی، باید از بررسی نتایج به سمت حاکمیت…

۹ دقیقه خواندن۱
پیش‌نمایش محدود GPT-5.6 برای گروهی از شرکای مورد اعتماد OpenAI

«رقابت تنظیم‌شده»؛ استراتژی جدید اوپن‌ای‌آی در عرضه مدل‌های امنیتی

اوپن‌ای‌آی پیش‌نمایش سری مدل‌های GPT-5.6 را با تمرکز بر امنیت سایبری و جلوگیری از جیل‌بریک برای دولت آمریکا و شرکای منتخب عرضه کرد. این خانواده شامل سه مدل با سطوح مختلف قدرت و…

۳ دقیقه خواندن
پیش‌نمایش مدل نسل بعدی GPT-5.6 Sol: هوش مصنوعی پیشرفته با قابلیت‌های نوآورانه

مدل Sol در برابر Mythos؛ برتری در استدلال‌های عامل‌محور و امنیت

اوپن‌ای‌آی پیش‌نمایش محدودی از سری GPT-5.6 را منتشر کرد که مدل پرچمدار آن، Sol، با تمرکز بر استدلال‌های عامل‌محور و لایه‌های امنیتی شدید عرضه شده است. این عرضه به‌صورت مرحله‌ای و…

۸ دقیقه خواندن
هیچ‌کس از طبقه پایین دائمی فرار نمی‌کند
زندگی با AI

سهم از OpenAI میلیاردرها را در برابر «طبقهٔ فرودسوزی ابدی» نجات نمی‌دهد

یک تحلیل جسورانه استدلال می‌کند که هوش مصنوعی ابر‌هوشمند، حتی ثروتمندان و رهبران سیاسی را از نظر مادی زائد می‌کند. در دنیایی که ماشین‌ها تولید و دفاع را مدیریت می‌کنند، حقوق…

۱۳ دقیقه خواندن
شرکت Patronus AI ۵۰ میلیون دلار برای ساخت «جهان‌های دیجیتال» تست استرس عامل‌های هوش مصنوعی جذب کرد.

بنچمارک‌های ایستا در برابر شبیه‌سازی‌های پویا در ارزیابی AI

استارتاپ Patronus AI با جذب ۵۰ میلیون دلار سرمایه، محیط‌های دیجیتال شبیه‌سازی‌شده‌ای می‌سازد تا قابلیت‌های عامل‌های هوش مصنوعی را در دنیای واقعی بسنجد. درآمد این شرکت در یک سال ۱۵…

۳ دقیقه خواندن
تزریق پرامپت، سردرگمی نقش است و دروازه MCP شما نمی‌تواند آن را ببیند

جعل زنجیره‌های تفکر، نرخ موفقیت جیل‌بریک را به ۶۰٪ رساند

پژوهشگران دریافتند که تقلید از سبک تفکر داخلی مدل‌ها، مؤثرترین راه برای دور زدن حفاظ‌های امنیتی است. این آسیب‌پذیری به‌ویژه در درگاه‌های MCP که محتوای پاسخ ابزارها را بررسی…

۴ دقیقه خواندن
هوش مصنوعی‌های چت‌بات همچنان در مسائل سیاسی تمایل چپ دارند، حتی مدل‌های «ضد بیداری» هم مستثنی نیستند.

سویه‌های سیاسی هوش مصنوعی: ۸۰٪ پاسخ‌های GPT-5.5 متمایل به چپ است

بررسی واشینگتن پست نشان می‌دهد اکثر چت‌بات‌های پیشرو، حتی مدل‌های ادعایی محافظه‌کار، سوگیری سیاسی چپ‌گرا دارند. تنها جمینای ۳.۱ پرو گوگل توانسته است با ارائه دیدگاه‌های متقابل،…

۳ دقیقه خواندن
آنتروپیک: علی‌بابا قابلیت‌های مدل کلود را به‌طور غیرقانونی استخراج کرد؛ بزرگ‌ترین حمله تقطیر شناخته‌شده

آنتروپیک علیه علی‌بابا: استخراج صنعتی قابلیت‌های مدل کلود از طریق API

شرکت آنتروپیک علی‌بابا را به سرقت گسترده قابلیت‌های مدل Claude از طریق حملات «تقطیری» متهم کرد. این حادثه نشان می‌دهد مدل‌های پیشرو حتی بدون نشت وزن‌ها، از طریق رابط‌های…

۲۶ دقیقه خواندن
عامل هوش مصنوعی: پیشنهاد همه‌چیز، اجرای تقریباً هیچ‌چیز
آموزش کاربردی

آیا جداسازی پیشنهاد از اجرا می‌تواند جلوی اقدامات غیرقابل‌بازگشت AI را بگیرد؟

یک معماری مرجع جدید برای عامل‌های هوش مصنوعی، پیشنهاد از اجرا را جدا می‌کند تا از اقدامات غیرقابل‌بازگشت ناشی از پرامپت‌های مخرب جلوگیری شود. این سیستم با ایجاد یک مرز «بسته در…

۹ دقیقه خواندن