
استدلالهای قابلدفاع در برابر پاسخهای سریع در تصمیمات حساس AI
در حالی که مدلهای جدیدی مانند Jev بر سرعت استثنایی و هزینه کم تمرکز دارند، شکافی عمیق در تصمیمات حساس و غیرقابلبازگشت وجود دارد. ظهور «داوران کند» مانند Decider نشاندهنده چرخش…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۶۹ مقاله منتشر شده

در حالی که مدلهای جدیدی مانند Jev بر سرعت استثنایی و هزینه کم تمرکز دارند، شکافی عمیق در تصمیمات حساس و غیرقابلبازگشت وجود دارد. ظهور «داوران کند» مانند Decider نشاندهنده چرخش…

پژوهشگران راهکاری برای تبدیل مدلهای زبانی عمومی به مدلهای تصمیمگیرنده با سرعت بسیار بالا یافتهاند. این روش بهجای تولید متن، توزیع احتمالات توکنها را میخواند و در مدل…

پلتفرم Oxlo.ai برای کاهش هزینههای پردازش متون طولانی، مدل پرداخت توکنی را با هزینه ثابت بهازای هر درخواست جایگزین کرد. این تغییر به توسعهدهندگان اجازه میدهد بدون نگرانی از…

یک بنچمارک مینیمال به نام p28-zero-diff معرفی شده است که توانایی مدلهای هوش مصنوعی در حل سادهترین اثباتهای ریاضی را میسنجد. این ابزار به جای چالشهای سخت، به عنوان یک «تست…

افزودن استقلال به نرمافزارها اغلب هزینهای از پیچیدگی، تأخیر و خطاهای پیشبینینشده ایجاد میکند بدون آنکه ارزش واقعی بیفزاید. کلید موفقیت در تفکیک ورودیهای مبهم (که به هوش…

پژوهشهای جدید نشان میدهد دسترسی به مدلهای زبانی، تمایل انسانها به پذیرش عدم قطعیت را بهطور کامل از بین میبرد. این اثر باعث افزایش شدید اعتمادبهنفس کاربران میشود، اما دقت…

مجموعهای از مهارتهای جدید Claude Code با ترکیب موتور Stockfish و تحلیل صوت کاربر، بازیهای شطرنج را به ویدیوهای تحلیلی تبدیل میکند. این سیستم بهجای ارائه صرفِ خطوط موتور،…

پلتفرم Oxlo.ai با استفاده از یک خط لوله تأیید چندمرحلهای و رایگیری مدلها، دقت عاملهای تشخیص شدت حوادث (Triage) را افزایش داد. این سیستم با ترکیب سختگیری در ساختار دادهها و…

شرکت TypeSafe با معرفی مدل Jev، تولید متن باز را با تصمیمات محدود و توزیعهای احتمالی جایگزین کرد. این رویکرد علاوه بر کاهش شدید هزینهها و تأخیر، مکانیزمی دقیق برای سنجش عدم…

شرکت Exa حالت Agent Ultra را معرفی کرد؛ یک API با محاسبات بالا که از تیمی از زیر-عاملها برای پژوهشهای جامع استفاده میکند. این سیستم در بنچمارکهای جمعآوری داده، مدلهای برتر…

مدل جدید OpenAI در شناسایی اشتباهات فیزیکی هنگام سرهم کردن وسایل خانه جهشی بزرگ داشته است. این دستاورد نشاندهنده پیشرفت جدی در استدلال بصری برای وظایف پیچیده دنیای واقعی است.

پژوهشهای سری AIRA در متا نشان میدهد که عملکرد عاملهای هوشمند بیش از آنکه به مدل وابسته باشد، به محیط تمرین و سیاستهای جستوجو بستگی دارد. این رویکرد منجر به کسب رتبه هشتم در…