
درون سازوکار آزمون و خطای سیستماتیک برای حل معماهای تاریخی
مدل Claude Fable 5.1 موفق شد معمای عددی «Cyphral Distich» را که از سال ۱۶۵۳ حلنشده مانده بود، رمزگشایی کند. این دستاورد بیش از آنکه نتیجهی رمزنگاری پیشرفته باشد، حاصل استمرار و…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۶ مقاله منتشر شده

مدل Claude Fable 5.1 موفق شد معمای عددی «Cyphral Distich» را که از سال ۱۶۵۳ حلنشده مانده بود، رمزگشایی کند. این دستاورد بیش از آنکه نتیجهی رمزنگاری پیشرفته باشد، حاصل استمرار و…

یک چارچوب جدید به نام ANSP با ترکیب یادگیری تقویتی و استدلال نمادین، مدیریت کاوشگرهای خودمختار سیارهای را متحول کرده است. این سیستم اجازه میدهد رباتها اهداف علمی را دنبال کنند…

متا مدل Muse Spark 1.3 را برای بهینهسازی گردشکارهای عاملمحور و مهندسی منتشر کرد. این بهروزرسانی مصرف توکن و ابزارها را کاهش داده و توانایی مدل در مدیریت دستورات پیچیده و…

مقایسه اشتراکهای ۲۰ دلاری آنتروپیک و اوپنایآی در سپتامبر ۲۰۲۶ نشان میدهد که کلود پرو در کدنویسی فنی و تحلیل اسناد طولانی پیشتاز است، در حالی که چتجیپیتی پلاس در تطبیقپذیری…

گوگل مدل Gemini 3.8 Flash و نسخه تخصصی Cyber را برای شناسایی خودکار آسیبپذیریها و وصلهزنی سریع عرضه کرد. این مدلها با قابلیت تنظیم سطح استدلال، هزینههای عملیاتی عاملهای…

صنعت هوش مصنوعی از مدلهای واکنشی که صرفاً محتوا تولید میکنند، به سمت سامانههای عاملمحور حرکت میکند که قادر به برنامهریزی، استفاده از ابزار و اصلاح خودکار خطاها هستند. این…

مدل باز Spark-X2.5-4B با وجود اندازه کوچک، در وظایف عاملمحور، ریاضیات و کدنویسی عملکردی مشابه مدلهایی با اندازه سه برابر خود نشان داد. این مدل در چندین محک کلیدی، رقبایی چون…

یادگیری تقویتی مدرن بر پایه حلقههای رفتاری است که روانشناسان بین سالهای ۱۸۹۸ تا ۱۹۴۹ کشف کردند. مفاهیمی چون پاداش، ارزش و وزنها، دههها پیش از ظهور اولین پردازندههای گرافیکی…

متا مدل Muse Spark 1.3 را برای بهینهسازی گردشهای کاری عاملمحور و وظایف مهندسی منتشر کرد. این بهروزرسانی با کاهش چشمگیر توکنها و فراخوانی ابزارها، پایداری مدل در اجرای دستورات…

استارتاپ Mostik روشی را ابداع کرده که مدلهای هوش مصنوعی بهجای تبادل متن، از طریق مقادیر ریاضی وزنها با یکدیگر ارتباط برقرار کنند. این تکنیک به مدلهای کوچک اجازه میدهد هوشمندی…

گوگل مدل اقتصادی Gemini 3.8 Flash را با عملکردی در سطح مدلهای گرانقیمت در کدنویسی و امنیت سایبری معرفی کرد. با وجود قیمت رقابتی، مصرف بالای توکن در استدلالهای پیچیده ممکن است…

مدل جدید Astra توانست آسیبپذیریهای ناشناختهای را شناسایی و به کد تخریبی تبدیل کند. با این حال، معماری جدید این مدل باعث شده است که فرآیند استدلال داخلی آن برای ناظران انسانی…