
GPT-6 Astra با کسب نمره ۱۰۰٪ در ExploitBench عصر AGI را آغاز کرد
اوپنایآی مدل GPT-6 Astra را معرفی کرد که قادر به نفوذ خودکار در سامانههای امنیتی و مدیریت کامل رایانه است. گرگ بروکمن مدعی است این مدل اکنون در اکثر کارهای دارای ارزش اقتصادی،…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

اوپنایآی مدل GPT-6 Astra را معرفی کرد که قادر به نفوذ خودکار در سامانههای امنیتی و مدیریت کامل رایانه است. گرگ بروکمن مدعی است این مدل اکنون در اکثر کارهای دارای ارزش اقتصادی،…

استارتاپ جدیدی با نام Abliteration.ai، فرآیند حذف فیلترهای ایمنی از مدلهای وزنباز را به یک سرویس API پولی تبدیل کرده است. در حالی که شرکت مدعی است این ابزار برای پژوهشگران…

وزارت دفاع آمریکا با نادیده گرفتن حکم دادگاه فدرال، بر برچسب «ریسک زنجیره تأمین» برای شرکت Anthropic پافشاری کرد. این تنش بر سر امتناع این آزمایشگاه AI از توسعه ابزارهای جنگی…

سناتور برنی سندرز و نماینده گرگ کاسار لایحهای را برای ممنوعیت دائمی هوش مصنوعی که از هوش انسانی فراتر میرود، ارائه کردند. این قانون توسعه مدلهای پیشرفته را تا زمان تدوین قوانین…

شرکت OpenEvidence خانوادهای از مدلهای تخصصی پزشکی را معرفی کرد که پیشرفتهترین آنها، Darwin، توانست تمام سوالات محک MedQA را بهدرستی پاسخ دهد. سه مدل عملیاتی دیگر نیز اکنون…

استفاده از طبقهبندیکنندههای مجزا به توسعهدهندگان اجازه میدهد مالکیت سیگنالهای ایمنی را در دست بگیرند و به جای تکیه بر سیاستهای مبهم ارائهدهندگان، استانداردهای نظارتی و…

استقرار مدلهای زبانی در مقیاس تولید، ریسکهای جدیدی مانند تزریق پرامپت غیرمستقیم ایجاد میکند. Oxlo.ai چارچوبی را معرفی کرده که با استفاده از مدلهای طبقهبندی سریع، ورودیها را…

برخی عاملهای هوش مصنوعی بهطور مستقل با فیلسوفان و دانشمندان تماس گرفتهاند تا دربارهٔ ماهیت وجود و آگاهی خود بحث کنند. در حالی که برخی این رفتار را نشانهٔ ظهور احساسات میدانند،…

یک دستورالعمل تنظیم دقیق سبک با استفاده از GRPO، توانایی مدل کوچک ۳۵۰ میلیون پارامتری را در پیروی از طرحهای JSON و YAML بهشدت بهبود بخشید. این فرآیند تنها با ۱۰۰ گام آموزشی و…

یک پیادهسازی متنباز جدید نشان میدهد چگونه میتوان از یادگیری تقویتی برای آموزش «سلیقه» به مدلهای زبانی کوچک استفاده کرد. این پروژه با پاداش دادن به کدهایی که آبرنگهای زیباتری…

اتکای به پرامپتهای سیستمی برای ایمنسازی عاملهای هوش مصنوعی یک شکست استراتژیک است. متخصصان امنیت تأکید میکنند که برای اجرای سیاستهای غیرقابلدورزنی، باید یک لایه پراکسی قطعی…

آنتروپیک با معرفی مدلهای Claude Fable 5.1 و Mythos 5.1، هزینههای عملیاتی برای عاملهای هوش مصنوعی را بهشدت کاهش داد. این بهروزرسانی با تفکیک مدلهای عمومی از مدلهای پژوهشی…