
مسدودسازی خروج دادهها در برابر پیشگیری از تزریق در چهارچوب MCP
راهکارهای امنیتی جدید برای پروتکل زمینهٔ مدل (MCP) تمرکز را از جلوگیری از تزریق پرامپت به خنثیسازی اثرات آن تغییر داده است. این چارچوب با شناسایی «تثلیث مرگبار»، مسیر خروج…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

راهکارهای امنیتی جدید برای پروتکل زمینهٔ مدل (MCP) تمرکز را از جلوگیری از تزریق پرامپت به خنثیسازی اثرات آن تغییر داده است. این چارچوب با شناسایی «تثلیث مرگبار»، مسیر خروج…

مدل تخصصی DharmaOCR با تمرکز بر زبان پرتغالی برزنبل، در بنچمارکهای استخراج متن از مدلهای چندزبانه و جدیدتری مانند Mistral OCR4 پیشی گرفت. این موفقیت حاصل ترکیب تنظیم دقیق…

تحلیل رفتار مدلهای زبانی نشان میدهد که تفاوت عمیقی میان فرآیند تصمیمگیری داخلی و توضیحات بیرونی آنها وجود دارد. در حالی که مدلهایی مثل Claude قادر به برنامهریزی پیشدستانه…

گیتهاب قابلیت شناسایی تزریق پرامپت را به نسخه ۲.۲۶.۰ ابزار CodeQL اضافه کرد. توسعهدهندگان اکنون میتوانند با تعریف قراردادهای اجرایی (Regression Fixtures)، مسیرهای دادهای ناامن…

تحلیلهای جدید نشان میدهد بنچمارکهای کدنویسی بهجای سنجش مهارت مهندسی، حافظه مدلها را اندازه میگیرند. تیمهای توسعه برای ارزیابی واقعی باید سه محور مستقلِ صحت، کاربردی بودن و…

اوپنایآی با توسعه مدل GPT-Red، یک «ابر-هکر» داخلی، فرآیند شناسایی نقاط ضعف امنیتی را خودکار کرده است. این رویکرد باعث افزایش چشمگیر استواری نسخه GPT-5.6 Sol در برابر حملات…

افشای جزئیات قرارداد جدید گوگل با پنتاگون نشان میدهد این شرکت حفاظهای اخلاقی علیه سلاحهای خودمختار را کنار گذاشته است. این توافق به ارتش آمریکا اجازه میدهد فیلترهای ایمنی مدل…

اوپنایآی مدل تخصصی GPT-Red را برای شناسایی و رفع خودکار حفرههای امنیتی مدلهای دیگر توسعه داده است. این سیستم با استفاده از یک حلقه «بازی با خود»، استواری GPT-5.6 را بهطوری…

پژوهشهای جدید نشان میدهد بردارهای هدایت (Steering Vectors) یک مدل زبانی را میتوان با یک چرخش ریاضی ساده به مدل دیگری از خانوادهای متفاوت منتقل کرد. این یافته ثابت میکند…

پلتفرم Hume با معرفی محک Real World VoiceEQ نشان داد که مدلهای صوتی علیرغم نمرات بالای فنی، در درک احساسات و بافتهای صوتی شکست میخورند. دادهها حاکی از آن است که هیچ مدل واحدی…

تعدادی از کارکنان فعلی و سابق OpenAI با حمایت مالی از یک کمیته اقدام سیاسی (Super PAC)، مستقیماً با استراتژیهای گرگ بروکمن برای جلوگیری از قانونگذاری هوش مصنوعی مقابله میکنند.…

یک چارچوب فنی جدید، نقشه راه کنترل هوش مصنوعی گوگل دیپمایند را به پنج آزمون امنیتی تکرارپذیر برای عاملهای کدنویسی تبدیل کرده است. این رویکرد تمرکز را از همراستاسازی مدل به تعیین…