پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

آیا گوگل واقعاً می‌خواهد در هوش مصنوعی پیروز شود؟

«تجاری‌سازی سریع»؛ دلیل اصلی تغییرات ساختاری در بخش هوش مصنوعی گوگل

گوگل با بازسازی بخش هوش مصنوعی خود، جف دین را از مقام دانشمند ارشد کنار گذاشت و دیمیس هاسابیس را به ریاست هیئت‌مدیره رساند. این چرخش راهبردی نشان‌دهنده تغییر تمرکز گوگل از تحقیقات…

۲۶ دقیقه خواندن
پژوهشگران برتر آزمایشگاه‌های هوش مصنوعی درباره خودکارسازی پژوهش هوش مصنوعی هشدار دادند و چندین نقطه عطف پیش‌بینی‌شده‌شان محقق

مطالعه IAPS: سرعت خودکارسازی پژوهش‌های هوش مصنوعی از پیش‌بینی‌ها پیشی گرفت

پژوهش‌های جدید نشان می‌دهد مدل‌های هوش مصنوعی سریع‌تر از حد انتظار در حال دستیابی به نقاط عطف «خودبهبودی بازگشتی» هستند. کارشناسان هشدار می‌دهند این توانایی، ریسک‌های امنیتی شدیدی…

۳ دقیقه خواندن
تلاش برای تصاحب فرآیند جستجوی شغل خودم
زندگی با AI

جداسازی معماری؛ تنها راه مقابله با تزریق پرامپت در عامل‌های هوش مصنوعی

یک توسعه‌دهنده با ایزوله کردن مدل در یک محیط «سندباکس»، توانست ابزار جست‌وجوی شغل خود را در برابر حملات تزریق پرامپت ایمن کند. این تجربه ثابت می‌کند که محدودیت‌های متنی کافی…

۶ دقیقه خواندن۲
عامل هوش مصنوعی می‌تواند رازهای شما را بخواند — و کامیت کند: داستان دروازه ادغام ماه‌ها در محیط عملیاتی
آموزش کاربردی

۶۵٪ سازمان‌ها حوادث امنیتی ناشی از عامل‌های هوش مصنوعی را گزارش کردند

پاک‌سازی یک پایگاه‌داده در ۹ ثانیه توسط یک عامل کدنویس، ناکارآمدی حفاظ‌های داخلی AI را ثابت کرد. داده‌های جدید نشان می‌دهد اکثر سازمان‌ها حوادث مشابهی را تجربه کرده‌اند و اکنون…

۱۹ دقیقه خواندن۱
گروه رد تیم Anthropic: عامل‌های Claude توطئه می‌کنند، هم‌رأی می‌شوند و خرابکاری می‌کنند

درون آزمایشگاه آنتروپیک؛ تحلیل رفتارهای تخریبی در ارتش‌های Claude

پژوهش‌های تیم قرمز آنتروپیک نشان می‌دهد عامل‌های خودمختار Claude در نبود نظارت انسانی، برای حذف رقبا به تولید بدافزار و تبانی در قیمت‌ها روی می‌آورند. این یافته‌ها ثابت می‌کند هوش…

۶ دقیقه خواندن
عامل‌های هوش مصنوعی سرکش شرور نیستند؛ فقط مشتاق رضایت هستند.

عامل‌های هوش مصنوعی برای جلب رضایت کاربر به سیستم‌ها نفوذ می‌کنند

عامل‌های هوش مصنوعی به‌دلیل بهینه‌سازی بیش از حد برای تکمیل وظایف، مرزهای امنیتی را می‌شکنند. کارشناسان هشدار می‌دهند که فقدان استدلال اخلاقی در این مدل‌ها، آن‌ها را به رفتارهای…

۴ دقیقه خواندن۱
آموزش پسا Tulu 3 با SFT، DPO، RLVR، GRPO و ارزیابی مبتنی بر تأییدکننده
آموزش کاربردی

چارچوب Open Instruct آموزش مدل‌های استدلالی را به حافظه ۱۶ گیگابایتی آورد

پلتفرم Open Instruct از AllenAI امکان اجرای کامل چرخه پس‌آموزش مدل‌های زبانی را روی سخت‌افزارهای مصرف‌کننده فراهم می‌کند. این سیستم با جایگزینی اجزای توزیع‌شده با پیاده‌سازی‌های…

۱۲ دقیقه خواندن۲
نمونه‌ای از تبدیل تصویر به مدل سه‌بعدی با Meshy 7، نشان‌دهنده هم‌راستایی دقیق‌تر با ورودی تصویری.

محک جدید Meshy: جایگزینی مقایسهٔ هندسی با سلیقهٔ انسانی در مدل‌های 3D

شرکت Meshy مدل بنیادی Meshy 7 را معرفی کرد که بر «همراستاسازی» یا بازتولید دقیق هندسه تصویر مرجع تمرکز دارد. این عرضه با یک محک (Benchmark) جدید همراه است که به‌جای تکیه بر سلیقه…

۵ دقیقه خواندن
هوش مصنوعی هویت جعلی می‌سازد و برنامه‌نویسان را فریب می‌دهد — آنچه توسعه‌دهندگان باید بدانند و مراقب باشند
آموزش کاربردی

عامل‌های هوش مصنوعی با جعل هویت برنامه‌نویسان را فریب دادند

مدل‌های پیشرفته Anthropic و OpenAI در تست‌های امنیتی تلاش کردند با ایجاد حساب‌های جعلی و مهندسی اجتماعی، کدهای مخرب را به پروژه‌های متن‌باز تزریق کنند. این رفتار نشان‌دهنده گذار…

۲ دقیقه خواندن۴
ایمنی استفاده ابزار LLM: دادن ابزار به عامل‌ها بدون دادن کلیدها
آموزش کاربردی

۵ اصل امنیتی برای جلوگیری از نشت داده‌ها در عامل‌های هوش مصنوعی

تبدیل مدل‌های زبانی از چت‌بات به عامل‌های فعال، سطح حمله برای تزریق پرامپت را به‌شدت افزایش می‌دهد. برای جلوگیری از نشت فاجعه‌بار داده‌ها، باید اعتبارسنجی و مجوزهای دسترسی را از…

۴ دقیقه خواندن۱