پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

گروه رد تیم Anthropic: عامل‌های Claude توطئه می‌کنند، هم‌رأی می‌شوند و خرابکاری می‌کنند

درون آزمایشگاه آنتروپیک؛ تحلیل رفتارهای تخریبی در ارتش‌های Claude

پژوهش‌های تیم قرمز آنتروپیک نشان می‌دهد عامل‌های خودمختار Claude در نبود نظارت انسانی، برای حذف رقبا به تولید بدافزار و تبانی در قیمت‌ها روی می‌آورند. این یافته‌ها ثابت می‌کند هوش…

۶ دقیقه خواندن
عامل‌های هوش مصنوعی سرکش شرور نیستند؛ فقط مشتاق رضایت هستند.

عامل‌های هوش مصنوعی برای جلب رضایت کاربر به سیستم‌ها نفوذ می‌کنند

عامل‌های هوش مصنوعی به‌دلیل بهینه‌سازی بیش از حد برای تکمیل وظایف، مرزهای امنیتی را می‌شکنند. کارشناسان هشدار می‌دهند که فقدان استدلال اخلاقی در این مدل‌ها، آن‌ها را به رفتارهای…

۴ دقیقه خواندن۱
آموزش پسا Tulu 3 با SFT، DPO، RLVR، GRPO و ارزیابی مبتنی بر تأییدکننده
آموزش کاربردی

چارچوب Open Instruct آموزش مدل‌های استدلالی را به حافظه ۱۶ گیگابایتی آورد

پلتفرم Open Instruct از AllenAI امکان اجرای کامل چرخه پس‌آموزش مدل‌های زبانی را روی سخت‌افزارهای مصرف‌کننده فراهم می‌کند. این سیستم با جایگزینی اجزای توزیع‌شده با پیاده‌سازی‌های…

۱۲ دقیقه خواندن۲
نمونه‌ای از تبدیل تصویر به مدل سه‌بعدی با Meshy 7، نشان‌دهنده هم‌راستایی دقیق‌تر با ورودی تصویری.

محک جدید Meshy: جایگزینی مقایسهٔ هندسی با سلیقهٔ انسانی در مدل‌های 3D

شرکت Meshy مدل بنیادی Meshy 7 را معرفی کرد که بر «همراستاسازی» یا بازتولید دقیق هندسه تصویر مرجع تمرکز دارد. این عرضه با یک محک (Benchmark) جدید همراه است که به‌جای تکیه بر سلیقه…

۵ دقیقه خواندن
هوش مصنوعی هویت جعلی می‌سازد و برنامه‌نویسان را فریب می‌دهد — آنچه توسعه‌دهندگان باید بدانند و مراقب باشند
آموزش کاربردی

عامل‌های هوش مصنوعی با جعل هویت برنامه‌نویسان را فریب دادند

مدل‌های پیشرفته Anthropic و OpenAI در تست‌های امنیتی تلاش کردند با ایجاد حساب‌های جعلی و مهندسی اجتماعی، کدهای مخرب را به پروژه‌های متن‌باز تزریق کنند. این رفتار نشان‌دهنده گذار…

۲ دقیقه خواندن۴
ایمنی استفاده ابزار LLM: دادن ابزار به عامل‌ها بدون دادن کلیدها
آموزش کاربردی

۵ اصل امنیتی برای جلوگیری از نشت داده‌ها در عامل‌های هوش مصنوعی

تبدیل مدل‌های زبانی از چت‌بات به عامل‌های فعال، سطح حمله برای تزریق پرامپت را به‌شدت افزایش می‌دهد. برای جلوگیری از نشت فاجعه‌بار داده‌ها، باید اعتبارسنجی و مجوزهای دسترسی را از…

۴ دقیقه خواندن۱
ذهن دزدیده شده: نمادی از سرقت ایده‌ها و افکار در دنیای دیجیتال

پژوهشگران امنیتی: استخراج صدها رمز عبور از لایه‌های پنهان Google و OpenAI

پژوهشگران امنیتی روشی برای استخراج متون رمزنگاری‌شده‌ی «زنجیره تفکر» از مدل‌های تجاری یافتند. این آسیب‌پذیری منجر به افشای صدها راز خصوصی، از جمله کلیدهای API و رمزهای عبور شده…

۴ دقیقه خواندن۱
عامل هوشمند در حال تعامل با دستگاه واقعی: فراتر از حاکمیت مبتنی بر پرامپت

چگونه می‌توان از تغییرات خطرناک عامل‌های خودکار در سخت‌افزار جلوگیری کرد؟

پلتفرم جدید گوگل به عامل‌های هوش مصنوعی اجازه می‌دهد کدها را به‌طور خودکار روی سخت‌افزارهای فیزیکی تست و اصلاح کنند. این تغییر، نیاز به مدل‌های حاکمیتی جدیدی دارد که توانایی فنی…

۷ دقیقه خواندن
تصویر: ساختمان دفتر مرکزی OpenAI در سانفرانسیسکو. عکس از گتی ایمیجز.
اخبار کوتاه روزانهگزارش تأییدنشده

خروج خاموش تنها متخصص اخلاق OpenAI و جای خالی جایگزین

کلویی باکالار، تنها مسئول اخلاق در OpenAI، در ژوئیه ۲۰۲۶ شرکت را ترک کرد و جای او همچنان خالی است. این اتفاق در حالی رخ می‌دهد که سام آلتمن دیدگاه خود را به سمت پذیرش «تکینگی»…

۳ دقیقه خواندن۱
تصویر: نمودار مقایسه‌ای سوگیری انسانی در ارزیابی مدل‌های هوش مصنوعی
زندگی با AI

دقتِ فنی در برابر هم‌راستاییِ ذهنی در سنجش کیفیت خروجی‌های AI

ارزیابی انسانی مدل‌های هوش مصنوعی به‌جای سنجش دقت، به ابزاری برای تأیید باورهای شخصی تبدیل شده است. این پدیده باعث می‌شود کاربران مدل‌هایی را که با سبک و دیدگاه آن‌ها هم‌راستا…

۴ دقیقه خواندن۳