
چگونه Claude Fable 5 بازدهی مهاجرت کد را از دو ماه به یک روز رساند؟
شرکت Anthropic مدلهای Fable 5 و Mythos 5 را برای پیشبرد قابلیتهای عاملمحور در برنامهنویسی و پژوهشهای علمی عرضه کرد. این سیستم اکنون از سازوکار «جایگزین» (fallback) برای…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۷ مقاله منتشر شده

شرکت Anthropic مدلهای Fable 5 و Mythos 5 را برای پیشبرد قابلیتهای عاملمحور در برنامهنویسی و پژوهشهای علمی عرضه کرد. این سیستم اکنون از سازوکار «جایگزین» (fallback) برای…

چارچوب جدید A11 با ایجاد لایههای استدلالی، مانع از آن میشود که مدلهای هوش مصنوعی مشاهدات را با فرضها اشتباه بگیرند. هدف این سیستم بهجای رسیدن به حقیقت مطلق، کاهش خطاهای…

تحلیل فنی هشت مدل پیشرو در ژوئن ۲۰۲۶ نشاندهنده شکاف میان قدرت کدنویسی خام و استقلال عاملمحور است. در حالی که Claude Opus 4.8 در بنچمارکهای عینی پیشتازی میکند، GPT-5.5 همچنان…

خطاهای سیستمهای هوش مصنوعی حقوقی، مانند استنادهای ساختگی، ریشه در نقص معماری و عدم تطابق بازیابی احتمالی با ساختار سلسلهمراتبی قوانین دارند. چارچوب پیشنهادی جدید با رویکرد…

چارچوب CARE یک لایه ایمنی مستقل از مدل است که ضمانتهای ریاضیاتی علیه توهمات و حذف دادههای حیاتی در خلاصههای پزشکی ارائه میدهد. این سیستم با کاهش چشمگیر هشدارهای غیرضروری و…

پژوهشگران بنچمارک OmniGameArena را برای اندازهگیری نحوه بهبود عاملهای مدل زبانی-دیداری از طریق بازتاب خودکار معرفی کردهاند. برخلاف تابلوهای امتیازات ایستا، این سیستم مسیر…

پژوهشگران دریافتند که توکنهای بصری در مدلهای چندوجهی پیش از رسیدن به لایههای نهایی اشباع میشوند. چارچوب DPVR-LF با مسیریابی این توکنها به یک شاخه جانبی، عملکرد مدل را با تنها…

محققان مجموعهدادهی ArtiFact را شامل بیش از ۶۵۰ هزار رکورد میراث فرهنگی منتشر کردند. این بنچمارک فاش میکند که سیستمهای فعلی هوش مصنوعی در تشخیص ناهماهنگیهای تاریخی ظریف و…

تحلیلی بر مدلهای بنیادی ویدیو نشان میدهد که V-JEPA در درک قوانین فیزیک شهودی را به مدلهای مبتنی بر انتشار و بازسازی پیشی میبرد. این یافتهها تأیید میکند که هدف پیشآموزش…

چارچوب ReCoVLA با استفاده از مدلهای چندوجهی برای هدایت پاداشها، توانایی رباتها در بازیابی از شکستها را بدون نیاز به بازآموزی سیاست اصلی افزایش میدهد. این روش نرخ موفقیت…

چارچوب Anything2Skill با تبدیل دانش خارجی پراکنده به قراردادهای مهارتی ساختاریافته، شکاف بین «خواندن مستندات» و «اجرای وظیفه» را پر میکند. این رویکرد باعث افزایش نرخ موفقیت…

پژوهشگران ابزاری به نام AGENTSERVESIM را معرفی کردهاند که امکان شبیهسازی دقیق عملکرد سختافزاری عاملهای هوش مصنوعی را روی پردازندههای معمولی (CPU) فراهم میکند. این ابزار با…