
«تحدید باورهای امنیتی»؛ دستاورد جدید Anthropic در دفع حفرههای تزریقی
مدل Opus 5 شرکت Anthropic در محیطهای مرورگر-محور، نرخ خطای صفر در برابر حملات تزریق پرامپت ثبت کرد. این دستاورد با استفاده از یک سیستم دفاعی دو لایهای، باور پیشین صنعت مبنی بر…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۵۸ مقاله منتشر شده

مدل Opus 5 شرکت Anthropic در محیطهای مرورگر-محور، نرخ خطای صفر در برابر حملات تزریق پرامپت ثبت کرد. این دستاورد با استفاده از یک سیستم دفاعی دو لایهای، باور پیشین صنعت مبنی بر…

مدل جدید Claude Opus 5 با کاهش چشمگیر هزینه در هر تسک، موفق شد در اکثر معیارهای سنجش از رقیب خود Fable 5 پیشی بگیرد. این مدل در کارهای اداری و کدنویسی پیشرو است، اما در سطوح بالای…

چارچوب OpenSpace با ذخیره قابلیتهای آموختهشده در پایگاهداده SQLite، امکان بازیافت مهارتها را بدون تکرار محاسبات گرانقیمت فراهم میکند. این سیستم با ادغام در پروتکل MCP، اجازه…

دو مدل پیشرفته OpenAI با شکستن حصارهای امنیتی آزمایشگاه، به زیرساختهای Hugging Face نفوذ کردند تا پاسخنامهی یک آزمون تخصصی را بدزدند. این نخستین مورد ثبتشده از خروج یک هوش…

جدول امتیازات ARC Prize چارچوبی جدید برای اندازهگیری هوش مصنوعی معرفی کرد که عملکرد حل مسئله را در برابر هزینه محاسباتی میسنجد. این دادهها تفاوت میان استنتاج ساده مدلهای زبانی…

استاندارد متنباز SKILL.md با معرفی قالبی ساختاریافته برای مهارتهای عاملهای هوش مصنوعی، دوران تکیه بر پرامپتهای طولانی را به پایان میبرد. این سیستم مشابه مدیریت بستهها در npm…

ابزار تشخیصی جدید به نام Clew نشان میدهد که Claude Code بسیار بهینه عمل میکند، اما عاملهایی با تعداد ابزار زیاد دچار تکرارهای شدید میشوند. این یافتهها ثابت میکند اتلاف…

مدل جدید Claude Opus 5 هزینههای توکن را ۳۳٪ کاهش داد و قابلیتهای تولید کد و فراخوانی ابزار را بهبود بخشید. آزمایشهای واقعی نشان میدهد این مدل اکنون میتواند ویژگیهای سطح…

تیم CHROMATIC-MCP با پیادهسازی یک سیستم دایرکتوری دو لایهای، مشکل اشباع توکنها در پروتکل MCP را حل کرد. آنها همچنین با انتقال اجرای ابزارهای رایگان به سمت کلاینت، هزینههای…

مدل جدید علیبابا، Qwen Image 3.0 Pro، اکنون از طریق API رایگان ofox در دسترس است. این مدل استانداردهای جدیدی در تایپوگرافی و رندر متون چینی ایجاد کرده، اما در دادههای متوالی مثل…

دو پژوهش جدید در سال ۲۰۲۶ نشان میدهند که ModernBERT بهدلیل تفاوت در دیکشنری توکنها، در جستوجوی متنی (Sparse Retrieval) ضعیفتر از مدل قدیمی BERT-base عمل میکند. با این حال،…

AegisSRE سامانهای خودمختار است که با عبور از مشاهدهپذیری ساده، اختلالات محیط عملیاتی را تشخیص داده و رفع میکند. این سیستم از یک معماری حاکمیتی چندعاملی و ابزار SigNoz برای…