
پروتکل لایهبندی شواهد؛ راهکار جدید برای توقف توهمات روایتی در سیستمهای
یک چارچوب ساختاری جدید برای سیستمهای معاملاتی هوش مصنوعی، «اعداد بد» (خطاهای عددی) را از «روایتهای بد» (ادعاهای بدون دلیل) تفکیک میکند. این پروتکل از ارتقای سطح ادعاها به…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۱۲ مقاله منتشر شده

یک چارچوب ساختاری جدید برای سیستمهای معاملاتی هوش مصنوعی، «اعداد بد» (خطاهای عددی) را از «روایتهای بد» (ادعاهای بدون دلیل) تفکیک میکند. این پروتکل از ارتقای سطح ادعاها به…

یادگیری تقویتی با پاداشهای قابلتأیید (RLVR) جایگزین بازخوردهای گرانقیمت انسانی شده و از تستهای واحد و اثباتهای ریاضی برای آموزش مدلها استفاده میکند. این سازوکار اجازه…

تحلیل کدهای Elden Ring نشان میدهد FromSoftware بهجای استفاده از مدلهای پیچیده هوش مصنوعی، از یک سیستم «پشته اهداف» (Goal Stack) برای کنترل دقیق رفتار باسها استفاده میکند. این…

شرکت Codex قابلیت Record & Replay را معرفی کرد تا نمایشهای دستی کاربر از یک تسک را به مهارتهای هوش مصنوعی تبدیل کند. این تغییر، مسیر حرکت از پرامپتهای متنی ساده به سمت…

شرکت IBM ابزار متنباز CUGA را برای جایگزینی مدیریت دستی زیرساخت با یک سیستم پیکربندیشده برای برنامهریزی و کنترل وضعیت عرضه کرد. این ابزار به توسعهدهندگان اجازه میدهد…

اوپن-ایآی با معرفی مدل GPT-5.5-Cyber و ابزار Codex Security، هدف خود را از «یافتن» باگها به «رفع خودکار» آنها تغییر داده است. این ابزارها میتوانند سرعت اصلاح نرمافزارها را به…

راهنمای عملی جدیدی نحوه ادغام مدل GLM-5.2 در جریانهای کاری پایتون را با استفاده از APIهای سازگار با OpenAI نشان میدهد. این پیادهسازی بر کنترل دقیق تلاش استدلالی، فراخوانی تابع…

شرکت Prime Intellect چارچوب متنباز prime-rl 0.6.0 را برای یادگیری تقویتی مدلهای ترکیب خبرهها (MoE) با مقیاس تریلیون پارامتر منتشر کرد. این سیستم با جداسازی زیرساخت آموزش و…

ابزار متنباز Sipcode با بهینهسازی بهداشت پنجرهٔ زمینه در Claude Code، نویزهای تکراری و خروجیهای طولانی ابزارها را حذف میکند. دادههای محصول نشان میدهد کاهش این تداخلات، منجر…

پروژه Dhi الگویی جامع برای ساخت محیط توسعه (IDE) مبتنی بر هوش مصنوعی ارائه میدهد که تماماً از ابزارهای متنباز استفاده میکند. این سیستم با ادغام مدلهای محلی و لایههای…

مدل GLM-5.2 با وجود قیمت پایینتر بهازای هر توکن، بهدلیل تولید حجم بالای توکنهای استدلالی داخلی، تنها ۳۰ تا ۳۵ درصد ارزانتر از رقبا تمام میشود. این تفاوت نشان میدهد که کاهش…

یک پروژه شبیهسازی شده نشان میدهد که یادگیری تقویتی عمیق چگونه میتواند تجارت باتریهای صنعتی را با پیشبینی جهشهای قیمتی بهینه کند. این سیستم با یادگیری روابط علی میان تقاضای…