
چرا Gemini 2.5 Flash در پیشبینی دشواری وظایف شکست میخورد؟
ابزار جدیدی به نام کاوشگر فراشناختی نشان میدهد که مدلهای پیشرو میتوانند در یک بُعد از اطمینان دقیق باشند اما در بُعدی دیگر بهطور کامل شکست بخورند. این یافته نقطه کوری حیاتی در…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۳ مقاله منتشر شده

ابزار جدیدی به نام کاوشگر فراشناختی نشان میدهد که مدلهای پیشرو میتوانند در یک بُعد از اطمینان دقیق باشند اما در بُعدی دیگر بهطور کامل شکست بخورند. این یافته نقطه کوری حیاتی در…

مدلهای پیشرو در درک باورهای دیگران موفقاند اما در محیطهای سهبعدی نمیتوانند بر اساس این دانش عمل کنند. بنچمارک جدید EnactToM نشان میدهد هفت مدل برتر در تمامی وظایف دشوار…

شرکت AWS معماری چهارلایه جدیدی را برای پشتیبانی از «سه قانون مقیاسپذیری» مدلهای بنیادی معرفی کرد. این ساختار با ادغام پردازندههای NVIDIA Blackwell و شبکه EFAv4، تلاش میکند…

مدل Ernie 5.1 شرکت بایدو با کاهش ۹۴ درصدی هزینههای پیشآموزش، جایگاه چهارم جهانی را در جدول Arena Search به دست آورد. این مدل با استفاده از یک چارچوب آموزشی الاستیک، توانسته است…

سیستم جدید و عاملمحور گوگل دیپمایند با ثبت رکورد ۴۸ درصدی در بنچمارک FrontierMath، توانست به یک پروفسور آکسفورد در حل یک مسئلهی ریاضی دشوار کمک کند. این دستاورد نشان میدهد که…

چارچوب RRCM با استفاده از GRPO بهطور پویا تصمیم میگیرد چه زمانی از شواهد مشارکتی یا متادیتا برای توصیهها استفاده کند. این رویکرد عاملمحور با حذف نویز، عملکرد مدلهای زبانی با…

مدل Mythos شرکت Anthropic که با ادعای «قدرت خطرناک» در شناسایی حفرههای امنیتی معرفی شده بود، در آزمون واقعی روی کد curl شکست خورد. این مدل تنها یک آسیبپذیری جزئی یافت که عملکرد…

آنتروپیک مدل Claude Opus 4.7 را با تمرکز بر کنترل دقیق عاملهای خودکار و بینایی با رزولوشن بالا معرفی کرد. با وجود ثابت ماندن قیمت هر توکن، تغییر در توکنایزر باعث افزایش هزینههای…

گزارشها نشان میدهد مدلهای پیشرو مانند Claude Mythos اکنون قادرند عملیات پیچیده تست نفوذ یکساله را در ۲۱ روز به پایان برسانند. این تحول، هوش مصنوعی را از یک دستیار ساده به یک…

تیموتی گورز، برنده مدال فیلدز، گزارش میدهد که ChatGPT 5.5 Pro توانسته است مسائل باز در نظریه اعداد را با ایدههایی «کاملاً بدیع» حل کند. این دستاورد که توسط پژوهشگران تایید شده،…

مدل ChatGPT 5.5 Pro موفق شد مسئلهای پیچیده در نظریه اعداد را با ارائه ایدههایی بدیع حل کند. این دستاورد که توسط پژوهشگران MIT تأیید شده، نشان میدهد مدلهای زبانی اکنون قادر به…

جک کلارک، همبنیانگذار Anthropic، پیشبینی میکند که تا سال ۲۰۲۸ سیستمهای هوش مصنوعی قادر خواهند بود نسخههای برتری از خود را بهطور خودکار خلق کنند. این جهش، مرز بین ابزارهای…