
استدلال Gemini در برابر داشبوردهای ایستا برای مدیریت تجمعات
یک توسعهدهنده ابزاری به نام FlowOps AI طراحی کرده است که دادههای خام حسگرهای استادیوم را به دستورات عملیاتی تبدیل میکند. این سیستم بهجای نمایش داشبوردهای ایستا، از استدلال هوش…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۷ مقاله منتشر شده

یک توسعهدهنده ابزاری به نام FlowOps AI طراحی کرده است که دادههای خام حسگرهای استادیوم را به دستورات عملیاتی تبدیل میکند. این سیستم بهجای نمایش داشبوردهای ایستا، از استدلال هوش…

شکست اکثر عاملهای AI در مرحله تولید ناشی از ضعف مدل نیست، بلکه نبود یک ساختار کنترلی (Harness) برای مدیریت اجرا و وضعیت است. برای دستیابی به پایداری، منطق اعتبارسنجی و حافظه باید…

پلتفرم LuisCore زیرساختی برای اجرای استنتاجهای چندمرحلهای فراهم میکند که از یک هسته مشترک و هستیشناسی باز برای مدیریت l-عاملها بهره میبرد. این سیستم هدفش تبدیل تعاملات سادهٔ…

پژوهشهای جامعه AGI Arrival نشان میدهد مدل وزنباز Kimi K3 در کدنویسی پیچیده و ممیزان امنیتی از GPT-5.6 و Claude Fable 5 پیشی گرفته است. با این حال، سختافزار سنگین و فقدان…

آزمایشی عملی با Hermes Agent نشان میدهد که معماری «ترکیبی از عاملها» (MoA) با استفاده از چندین مدل مشاور و یک مدل تجمیعکننده، کیفیت خروجی را در کارهای پیچیده افزایش میدهد. این…

مدل Kimi K3 متعلق به شرکت Moonshot AI با وجود محدودیتهای صادراتی GPUها، به سطح مدلهای پیشرو در کدنویسی عاملمحور رسید. این موفقیت نشان میدهد کارایی الگوریتمی میتواند کمبود…

یک دانشجوی فناوری اطلاعات روشی را ارائه داده که در آن ChatGPT بهجای ارائه پاسخهای سریع، در نقش یک مدرس سقراطی ظاهر میشود. این سیستم با تمرکز بر یادگیری فعال و قانون ۸۰/۲۰، هدفش…

آزمایشگاه چینی Moonshot AI مدل Kimi K3 را با ۲.۸ تریلیون پارامتر معرفی کرد که در کدنویسی و کارهای پیچیده از رقبای آمریکایی پیشی میگیرد. این مدل با قیمتگذاری جدید، گرانترین…

ابزار تخصصی zkao یک آسیبپذیری بحرانی (CVE-2026-46669) در کتابخانه OpenVM شناسایی کرد که امکان جعل برابریهای جفتسازی (Pairing) را فراهم میکرد. این یافته نشان میدهد مدلهای…

پژوهش جدیدی متد SEED را معرفی کرده است که عاملهای هوش مصنوعی را آموزش میدهد تا مسیرهای شکستخورده خود را تحلیل کرده و درسهای بهدستآمده را در سیاستهای رفتاری خود تثبیت کنند.…

محک جدید Spider 2.0 نشان میدهد عاملهای هوش مصنوعی که در محیطهای آزمایشگاهی موفق بودند، در مواجهه با پیچیدگیهای واقعی پایگاهدادههای سازمانی شکست میخورند. این شکاف عملکردی،…

پلتفرم Drift اکنون قادر است محیطهای پیچیده شبیهسازی، رباتهای متحرک و منطق ناوبری آنها را تنها با یک دستور متنی در موتور MuJoCo ایجاد کند. این ابزار فرآیند تست حلقههای…