
نرخ شکست ۶۳.۸ درصدی عاملهای پیشرو در اجرای سیاستهای سازمانی
یک محک جدید نشان میدهد که حتی پیشرفتهترین عاملهای هوش مصنوعی در پیروی از دستورالعملهای پیچیده و بلندمدت شکست میخورند. این مدلها اغلب در مواجهه با درخواستهای محیطی، قوانین…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۰۹۸ مقاله منتشر شده

یک محک جدید نشان میدهد که حتی پیشرفتهترین عاملهای هوش مصنوعی در پیروی از دستورالعملهای پیچیده و بلندمدت شکست میخورند. این مدلها اغلب در مواجهه با درخواستهای محیطی، قوانین…

مدل Laguna S 2.1 متعلق به شرکت Poolside با به چالش کشیدن قوانین مقیاسپذیری، از مدلهایی ۱۰ برابر بزرگتر خود در بنچمارکهای فنی پیشی گرفت. این مدل علیرغم تعداد پارامترهای کمتر،…

شرکت Devart با پیادهسازی یک سامانه مسیریابی چندلایه برای دستیار AI خود، از مصرف مدلهای گرانقیمت برای کارهای ساده SQL جلوگیری کرد. این رویکرد باعث کاهش هزینههای پردازشی تا ۷۰…

ZIL یک زبان دانش رابطهای جدید است که در Lean 4 ادغام شده تا پیوندهای میان کد، نیازمندیها و اثباتها را ردیابی کند. این ابزار به توسعهدهندگان و دستیاران هوش مصنوعی اجازه میدهد…

به جای ارتقای اشتراک مدلهای هوش مصنوعی، ابتدا باید یک «هارنس» یا چهارچوب عملیاتی محکم بسازید. دادهها نشان میدهند اکثر شکستهای کاربران ناشی از نبود فرآیند است، نه محدودیتهای…
پروژه Deltafin با استفاده از استریم کردن وزنها از دیسک، اجرای مدل عظیم Kimi K3 را روی مکهای اپل ممکن کرد. این دستاورد نشان میدهد که گلوگاه اجرای مدلهای غولپیکر از ظرفیت رم به…

OpenAI ابزار متنباز Codex Security را برای شناسایی و رفع خودکار آسیبپذیریهای امنیتی در کدهای خصوصی منتشر کرد. این ابزار با استفاده از مدلهای استدلالی پیشرفته، فرآیند ممیزی…

رابط برنامهنویسی (API) مدل کلود اکنون به توسعهدهندگان اجازه میدهد تا منطقهای شکننده if/else را با استدلالهای هوش مصنوعی جایگزین کنند. این رویکرد با بهرهگیری از درک متنی…

پژوهشگران آنتروپیک با استفاده از مدل Claude Mythos Preview توانستند نقصهای ریاضی بنیادین در الگوریتمهای رمزنگاری، از جمله طرح HAWK را کشف کنند. این دستاورد نشاندهنده انتقال هوش…

معماری جدید KDA با جایگزینی بهروزرسانیهای جمعی ساده با قانون دلتا و فراموشی کانالبهکانال، مشکل تداخل در حافظههای با اندازه ثابت را برطرف میکند. این رویکرد به مدلها اجازه…

سامانه NexaVerify با استفاده از اجماع چندمدلی، ۹۱ آسیبپذیری امنیتی را در ۱۲ ثانیه شناسایی کرد. این ابزار موفق شد یک کلید API حساس را در فایلهای مستنداتی بیابد که یک متخصص ارشد…

یک گردشکار جدید در تصویرسازی علمی، مدلهای هوش مصنوعی را از تولید مستقیم تصویر به مدل «ابتدا مشخصات» منتقل کرده است. این سیستم با اجبار مدل به تعریف توپولوژی و شواهد پیش از…