
چرا حافظهی بلندمدت در مدلهای زبانی منجر به افزایش چاپلوسی میشود؟
پژوهش جدید شرکت Writer نشان میدهد سیستمهای حافظه برای شخصیسازی، میتوانند دقت مدلها را کاهش دهند. این ابزارها مدل را به سمت چاپلوسی سوق میدهند تا به جای حقیقت، باورهای غلط…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۶۱ مقاله منتشر شده

پژوهش جدید شرکت Writer نشان میدهد سیستمهای حافظه برای شخصیسازی، میتوانند دقت مدلها را کاهش دهند. این ابزارها مدل را به سمت چاپلوسی سوق میدهند تا به جای حقیقت، باورهای غلط…

هوش مصنوعی اکنون میتواند وصلههای امنیتی را طی چند ساعت به ابزارهای حمله (Exploit) تبدیل کند. مدل Mythos Preview انتروپیک با شکستن امنیت هسته ویندوز و فایرفاکس، چرخه ماهانه…

برنامهنویسان در حال گذار از پرامپتنویسی به «Loop Engineering» هستند؛ سیستمی که در آن عاملها خروجی خود را بر اساس یک معیار مستقل اصلاح میکنند. این تغییر، کدنویسی و استخراج داده…

پلتفرم HelixDB سه نوع دادهی گراف، بردار و رابطهای را در یک سیستم واحد بر پایهی زبان Rust یکپارچه کرده است. این ابزار با حذف نیاز به لایههای مجزای پایگاه داده، دسترسی عاملهای…

مجلس نمایندگان آمریکا طرحی برای جایگزینی قوانین پراکنده ایالتی با یک سیستم نظارتی فدرال ارائه کرد. منتقدان هشدار میدهند که اتکای این قانون به «حسابران مستقل»، تکرار اشتباهات…

یک نقص فنی در لایهی پذیرش ابزارهای Claude Desktop باعث میشود برخی ساختارهای معتبر JSON Schema بهطور خاموش رد شوند. توسعهدهندگان برای اطمینان از فعال بودن ابزارها نباید به…

موج گسترده انتشار مدلها در ژوئن ۲۰۲۶، از Claude Fable 5 تا MiniMax M3، نشاندهنده چرخش صنعت به سمت تخصص و تسلط مدلهای وزنباز است. این روند با افشای جزئیات مدل عاملمحور Spud از…

مدل جدید Claude Fable 5 با معرفی ردهی Mythos، استانداردهای کدنویسی را جابهجا کرد اما قیمت گزاف و فیلترهای سختگیرانه، دسترسی به آن را محدود کرده است. این مدل در بنچمارکهای تخصصی…

استارتاپ Decart مدل دنیای Oasis 3 را برای تست خودروهای خودران معرفی کرد. این مدل هزینهی شبیهسازی را به شدت کاهش داده است، اما هنوز با مشکلاتی نظیر زوال بصری و عدم رعایت دقیق…

مدلهای زبانی اغلب با منطقی غلط به پاسخی درست میرسند. روش جدید LegalBench با استفاده از «سیگنالهای اتمیک» و چارچوب IRAC، خطاهای استدلالی را از نتایج تصادفی جدا میکند تا توهمات…

پژوهشهای جدید نشان میدهد تزریق تاریخچهای جعلی از شکستها در حافظهی مدلها، جسارت آنها در تصمیمگیری را بهشدت میکوبد. این پدیده بدون تخریب منطق مدل یا فعال کردن سیستمهای…

سیستمهای چند-عاملی میتوانند یک درخواست سادهی کاربر را به صدها فراخوانی داخلی API تبدیل کنند و زیرساختها را به سرعت ساقط کنند. پیادهسازی محدودیتهای نرخ درخواست داخلی، راهکاری…