
درون ساختار دستیار متنباز UIUC برای دانشجویان مهندسی
دانشگاه ایلینوی (UIUC) یک دستیار آموزشی متنباز برای مهندسی برق طراحی کرده است که با اجرای موازی ۱۱ مدل مختلف، پاسخهای پیچیده چندرسانهای را در ۲ ثانیه تولید میکند. این سیستم با…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۹ مقاله منتشر شده

دانشگاه ایلینوی (UIUC) یک دستیار آموزشی متنباز برای مهندسی برق طراحی کرده است که با اجرای موازی ۱۱ مدل مختلف، پاسخهای پیچیده چندرسانهای را در ۲ ثانیه تولید میکند. این سیستم با…

پروژه ReasonGate یک لایه امنیتی بازمتن برای برنامههای مبتنی بر مدلهای زبانی است که حملات تزریق پرامپت و نشت دادهها را از طریق دفاع چندلایه میبندد. برخلاف ابزارهای سنتی، این…

یک محک جدید برای جریانهای کاری K8sGPT نشان میدهد که دقت هوش مصنوعی در تشخیص خطاها هنوز برای ایمنی کامل محیط تولید کافی نیست. این پژوهش تأکید میکند که توانایی «اجتناب از اقدام»…

پلتفرم Vulcora چالشی امنیتی با جایزه بیش از ۵۱ هزار دلار برگزار کرده است تا متخصصان بتوانند جملات تحریککننده پنهان در مدلهای هوش مصنوعی را بیابند. این رقابت خطر استقرار مدلهای…

متا سامانهای تخصصی برای شناسایی گفتگوهای مربوط به خودکشی و آسیب به خود در میان نوجوانان مستقر کرده است. این قابلیت که با نظارت انسانی برای جلوگیری از هشدارهای اشتباه همراه است،…

شرکت OpenAI برای شناسایی سریعتر نقاط ضعف امنیتی، سامانه GPT-Red را جایگزین ارزیابیهای دستی انسان کرده است. این ابزار با شبیهسازی حملات پیچیده، حفرههای نرمافزاری را پیش از…

راهکارهای امنیتی جدید برای پروتکل زمینهٔ مدل (MCP) تمرکز را از جلوگیری از تزریق پرامپت به خنثیسازی اثرات آن تغییر داده است. این چارچوب با شناسایی «تثلیث مرگبار»، مسیر خروج…

مدل تخصصی DharmaOCR با تمرکز بر زبان پرتغالی برزنبل، در بنچمارکهای استخراج متن از مدلهای چندزبانه و جدیدتری مانند Mistral OCR4 پیشی گرفت. این موفقیت حاصل ترکیب تنظیم دقیق…

تحلیل رفتار مدلهای زبانی نشان میدهد که تفاوت عمیقی میان فرآیند تصمیمگیری داخلی و توضیحات بیرونی آنها وجود دارد. در حالی که مدلهایی مثل Claude قادر به برنامهریزی پیشدستانه…

گیتهاب قابلیت شناسایی تزریق پرامپت را به نسخه ۲.۲۶.۰ ابزار CodeQL اضافه کرد. توسعهدهندگان اکنون میتوانند با تعریف قراردادهای اجرایی (Regression Fixtures)، مسیرهای دادهای ناامن…

تحلیلهای جدید نشان میدهد بنچمارکهای کدنویسی بهجای سنجش مهارت مهندسی، حافظه مدلها را اندازه میگیرند. تیمهای توسعه برای ارزیابی واقعی باید سه محور مستقلِ صحت، کاربردی بودن و…

اوپنایآی با توسعه مدل GPT-Red، یک «ابر-هکر» داخلی، فرآیند شناسایی نقاط ضعف امنیتی را خودکار کرده است. این رویکرد باعث افزایش چشمگیر استواری نسخه GPT-5.6 Sol در برابر حملات…