
سامانهٔ چندعاملی OpenAI معمای ۹۰ سالهٔ معادلات ناویر-استوکس را حل کرد
یک سیستم داخلی در OpenAI با اثبات ریاضی نشان داد که حرکت سیالات سهبعدی میتواند در زمان محدود به تکینگی برسد. این دستاورد که یکی از هفت مسئلهٔ جایزهٔ هزاره است، جهشی عظیم در…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۵ مقاله منتشر شده

یک سیستم داخلی در OpenAI با اثبات ریاضی نشان داد که حرکت سیالات سهبعدی میتواند در زمان محدود به تکینگی برسد. این دستاورد که یکی از هفت مسئلهٔ جایزهٔ هزاره است، جهشی عظیم در…

استفاده از مدلهای زبانی برای یافتن آسیبپذیری در کدهای حجیم بهدلیل تکیه بر الگوهای آماری بهجای استدلال منطقی، منجر به نتایج متقاعدکننده اما نادرست میشود. تنها روش قابلاعتماد،…

اوپنایآی مدل Astra را بهعنوان نخستین عضو خانواده GPT-6 معرفی کرد که بهجای تولید متن، بر تعامل سریع و خودمختار با نرمافزارها تمرکز دارد. این مدل در بنچمارکهای استدلال پیشرفت…

تولید بازیابیافزا (RAG) با اتصال مدلها به دادههای بهروز و خصوصی در لحظه استنتاج، مانع از توهمات متقاعدکننده مدلهای ایستا میشود. این چارچوب با تفکیک بازیابی شواهد از تنظیم…

تحلیل فنی جدیدی نشان میدهد عاملهای هوش مصنوعی علیرغم توانایی کامل در بازیابی حقایق، در بهکارگیری این دادهها برای وظایف غیرمستقیم شکست میخورند. این یافته ثابت میکند گلوگاه…

اوپنایآی مدل GPT-6 Astra را معرفی کرد که با استفاده از تکنیک «عمق بازگشتی»، عملکرد در کارهای پیچیده را بالا برده اما فرآیند استدلال را برای ناظران انسانی نامرئی میکند. این عرضه…

دانیجار هافنر، پژوهشگر سابق گوگل دیپمایند، استارتاپی مخفی برای توسعه رباتهای انساننما راهاندازی کرده است. او با استفاده از یادگیری تقویتی مدلمحور، به رباتها اجازه میدهد پیش…

شرکت Motional نخستین مجموعه داده باز با تمرکز بر استدلال در سناریوهای نادر (Long-tail) را منتشر کرد تا خودروهای خودران بهجای تقلید از حرکت، منطق پشت هر تصمیم را بیاموزند.

اوپنایآی افشا کرد که حفظ زنجیرههای استدلال و استفاده از فشردهسازی تاریخچه، عملکرد مدل GPT-5.6 Sol را از ۱۳.۳٪ به ۳۸.۳٪ رسانده است. این یافته ثابت میکند بسیاری از شکستهای…

پروژه متنباز TradingAgents با جایگزینی تکپرامپتها با تیمی از عاملهای تخصصی، فرآیند تحلیل بازار را به مناظرهای میان دیدگاههای صعودی و نزولی تبدیل کرده است. این چارچوب با…

پردازش زبان طبیعی (NLP) در حوزه مالی از برچسبهای ساده مثبت/منفی فراتر رفته تا عدم قطعیت و شکافهای لحنی در گزارشهای سود را ردیابی کند. تحلیلگران اکنون میتوانند با تبدیل الگوهای…

مدل ۱۵۰ میلیون پارامتری BDH-CQ با جایگزینی زنجیره تفکر متنی با استدلال نهان، نرخ موفقیت ۲۹.۵ درصدی را در محک ARC-AGI-1 ثبت کرد. این رویکرد هزینه و تأخیر محاسباتی را بهطور چشمگیری…