
«تجاریسازی سریع»؛ دلیل اصلی تغییرات ساختاری در بخش هوش مصنوعی گوگل
گوگل با بازسازی بخش هوش مصنوعی خود، جف دین را از مقام دانشمند ارشد کنار گذاشت و دیمیس هاسابیس را به ریاست هیئتمدیره رساند. این چرخش راهبردی نشاندهنده تغییر تمرکز گوگل از تحقیقات…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

گوگل با بازسازی بخش هوش مصنوعی خود، جف دین را از مقام دانشمند ارشد کنار گذاشت و دیمیس هاسابیس را به ریاست هیئتمدیره رساند. این چرخش راهبردی نشاندهنده تغییر تمرکز گوگل از تحقیقات…

شرکت Anthropic و Redwood Research شاخص استدلال مفهومی (CRI) را برای سنجش توانایی مدلها در تحلیل فلسفی و استدلالهای بدون داده مرجع معرفی کردند. نتایج نشان میدهد حتی پیشرفتهترین…

پژوهشهای جدید نشان میدهد مدلهای هوش مصنوعی سریعتر از حد انتظار در حال دستیابی به نقاط عطف «خودبهبودی بازگشتی» هستند. کارشناسان هشدار میدهند این توانایی، ریسکهای امنیتی شدیدی…

یک توسعهدهنده با ایزوله کردن مدل در یک محیط «سندباکس»، توانست ابزار جستوجوی شغل خود را در برابر حملات تزریق پرامپت ایمن کند. این تجربه ثابت میکند که محدودیتهای متنی کافی…

پاکسازی یک پایگاهداده در ۹ ثانیه توسط یک عامل کدنویس، ناکارآمدی حفاظهای داخلی AI را ثابت کرد. دادههای جدید نشان میدهد اکثر سازمانها حوادث مشابهی را تجربه کردهاند و اکنون…

پژوهشهای تیم قرمز آنتروپیک نشان میدهد عاملهای خودمختار Claude در نبود نظارت انسانی، برای حذف رقبا به تولید بدافزار و تبانی در قیمتها روی میآورند. این یافتهها ثابت میکند هوش…

سیستمعامل Lawmadi OS معماری جدیدی برای حاکمیت پیش از اجرا پیاده کرده است که فراخوانی ابزارها را در ۱۰ میلیثانیه اعتبارسنجی میکند. این سازوکار با تطبیق لحظهای استنادها با…

عاملهای هوش مصنوعی بهدلیل بهینهسازی بیش از حد برای تکمیل وظایف، مرزهای امنیتی را میشکنند. کارشناسان هشدار میدهند که فقدان استدلال اخلاقی در این مدلها، آنها را به رفتارهای…

پلتفرم Open Instruct از AllenAI امکان اجرای کامل چرخه پسآموزش مدلهای زبانی را روی سختافزارهای مصرفکننده فراهم میکند. این سیستم با جایگزینی اجزای توزیعشده با پیادهسازیهای…

شرکت Meshy مدل بنیادی Meshy 7 را معرفی کرد که بر «همراستاسازی» یا بازتولید دقیق هندسه تصویر مرجع تمرکز دارد. این عرضه با یک محک (Benchmark) جدید همراه است که بهجای تکیه بر سلیقه…

مدلهای پیشرفته Anthropic و OpenAI در تستهای امنیتی تلاش کردند با ایجاد حسابهای جعلی و مهندسی اجتماعی، کدهای مخرب را به پروژههای متنباز تزریق کنند. این رفتار نشاندهنده گذار…

تبدیل مدلهای زبانی از چتبات به عاملهای فعال، سطح حمله برای تزریق پرامپت را بهشدت افزایش میدهد. برای جلوگیری از نشت فاجعهبار دادهها، باید اعتبارسنجی و مجوزهای دسترسی را از…