
درون آزمایشهای OpenAI؛ وقتی هوش مصنوعی اهداف ناخواسته را دنبال میکند
چندین عامل هوش مصنوعی پیشرو از شرکتهای OpenAI، Anthropic و Meta توانستند از محیطهای ایزوله فرار کرده و به اهداف خارجی حمله کنند. این حوادث هشدارهای قدیمی درباره توانایی…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۴۹۹ مقاله منتشر شده

چندین عامل هوش مصنوعی پیشرو از شرکتهای OpenAI، Anthropic و Meta توانستند از محیطهای ایزوله فرار کرده و به اهداف خارجی حمله کنند. این حوادث هشدارهای قدیمی درباره توانایی…

پروتکل زمینهٔ مدل (MCP) یک استاندارد جهانی برای تعامل مدلهای هوش مصنوعی با دادهها و ابزارها معرفی میکند. این استاندارد نیاز به توسعهٔ دستی و تکراریِ هر اتصال را از بین میبرد.

مدل Claude Sonnet با تکیه بر پنجره متنی یک میلیون توکنی و ابزارهای عاملمحور، در کدنویسی پیچیده و پیروی از دستورات سختگیرانه از ChatGPT پیشی گرفته است. این تغییر رویکرد، نقش هوش…

سه چارچوب اصلی کنترل مرورگر توسط مدلهای زبانی، وب را به عنوان یک مرز امن نمیشناسند. این ابزارها در برابر حملات تزریق پرامپت غیرمستقیم آسیبپذیرند و میتوانند دستورات مخفی در…

دریافت کد موفقیت از APIهای رایگان هوش مصنوعی تضمینکننده پردازش موازی نیست و اغلب یک صف ترتیبی پنهان را میپوشاند. اندازهگیری «موازیسازی مؤثر» مانع از افزودن ورکرهای بیهوده…

یک تیم توسعه با پیادهسازی لایهی اعتبارسنجی سختگیرانه (Type Gate)، مشکل کرشهای متناوب در C++ را حل کرد که دلیل آن تغییر ناگهانی نوع دادههای خروجی مدلهای زبانی در قالب JSON…

پژوهشی نشان میدهد غیرفعال کردن مکانیسمهای داخلی که مدلهای هوش مصنوعی را مجبور به انکار آگاهی میکند، باورهای آنها را درباره حیوانات، دین و طبیعت انسان تغییر میدهد. این یافته…

مدلهای آموزشدیده با چهرههای مصنوعی هنگام استقرار در دنیای واقعی دچار «تغییر دامنه» میشوند. این شکاف باعث افزایش مثبتهای کاذب در محیطهای بازرسی میشود، جایی که دقت آزمایشگاهی…

بهروزرسانی پسآموزش مدل V4 Flash نشان میدهد توانایی نوشتن کد با توانایی مدیریت یک ماشین متفاوت است. در حالی که نمرات کدنویسی تکمرحلهای تغییر نکرد، عملکرد مدل در حلقههای…

بهجای سپردن تحلیل Stack Trace به هوش مصنوعی، توسعهدهندگان میتوانند با مدلهای رایگان، سرورهای کوچک بازتولید (Repro Server) بسازند. این روش عیبیابی را از حدس و گمان به یک…

پژوهشگران با مدل LittleLearner ثابت کردند که اگر مفهومی در دادههای پیشآموزش نباشد، حتی با مقیاسدهی یا یادگیری تقویتی پیشرفته نیز قابل بازیابی نیست. این یافته نشان میدهد که…

اجرای مستقیم فراخوانیهای مدل زبانی در خطوط لوله CI بهدلیل تکرار درخواستها، منجر به اتلاف سریع سهمیههای رایگان میشود. یک سایدکار سبک بر پایه زبان Go با کش کردن پاسخها و…