
دقت ۹۰ درصدی AdaSTORM در استدلال گرافهای هزار-گرهای بدون ابزار خارجی
چارچوب AdaSTORM با استفاده از تقسیمبندی تطبیقی و معماری چند-عاملی، محدودیت مقیاسپذیری در استدلال گرافهای پویا را شکست. این سیستم بدون نیاز به ابزارهای خارجی، به دقت بیش از ۹۰…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۸ مقاله منتشر شده

چارچوب AdaSTORM با استفاده از تقسیمبندی تطبیقی و معماری چند-عاملی، محدودیت مقیاسپذیری در استدلال گرافهای پویا را شکست. این سیستم بدون نیاز به ابزارهای خارجی، به دقت بیش از ۹۰…

یک چارچوب معماری جدید پیشنهاد میدهد که «خرد» را از «هوش» جدا کند تا از بهینهسازی کورکورانه اهداف مضر جلوگیری شود. این سیستم از طریق یک لایه حاکمیتی و یک توپل ششمؤلفهای، پیش از…

پلتفرم StateGen با معرفی یک مدیریت وضعیت متمرکز و ساختار چهار-نقش، توهمات مربوط به نتایج ابزارها در عاملهای هوش مصنوعی را حذف کرده است. این معماری با تولید دادههای مصنوعی دقیق،…

رویکرد Latent Thought Flow با جایگزینی توکنهای متنی در زنجیره تفکر با مسیرهای پیوسته در فضای پنهان، دقت پاسخدهی را ۹.۵٪ افزایش داده است. این متدولوژی هزینه محاسباتی استنتاج را…

پژوهشگران با معرفی PAL-Bench نشان دادند که مدلهای هوش مصنوعی علیرغم توانایی در خلاصهسازی، در پیوند دادن هویتهای تکرارشونده در دادههای بلندمدت ناتواناند. این شکاف، تفاوت…

یک تحلیل تشخیصی جدید نشان میدهد توانایی یک مدل زبانی در حل مسائل پیچیده، تضمینکننده اثرگذاری آن در تدریس نیست. محققان با استفاده از MathTutorBench دریافتند که معیارهای «حل…

پژوهشگران چارچوب TimeVista را معرفی کردهاند که با بهرهگیری از مدلهای بینایی-زبانی (VLMs)، پیشبینیهای سریهای زمانی را از طریق تحلیل نمودارها ارزیابی میکند. این رویکرد در…

چارچوب استدلالی سبکوزن LiteOdyssey با تکیه بر سیاستهای همکاری انسان-ماشین، در تشخیص بیماریهای بسیار نادر از GPT-5.4 پیشی گرفت. این دستاورد نشان میدهد که ساختار استدلالی دقیق…

VibeThinker-3B مدلی با ۳ میلیارد پارامتر است که در تسکهای استدلالی قابلراستیآزمایی، عملکردی برابر با مدلهای بسیار بزرگتر مانند Gemini 3 Pro دارد. این مدل از یک خط لوله…

محققان با معرفی روش «تفکر مبنیساز»، مدلهای کوچک را قادر ساختند تا گامهای استدلالی خود را به نقاط دقیق تصویر متصل کنند. این رویکرد باعث شد مدل Gemma3-4B-IT در استدلالهای مکانی،…

مدلهای زبانی بزرگ در بنچمارکهای حقوقی نمرات بالایی کسب میکنند، اما در واقعیت منطق را اجرا نمیکنند. پژوهشی جدید نشان میدهد این مدلها با تقلید از نتایج حلکنندههای رسمی،…

شرکت Z.ai مدل GLM-5.2 را با پنجره متنی یک میلیون توکنی معرفی کرد تا امکان بارگذاری کامل مخازن کد در حافظه فعال فراهم شود. این مدل با ابزارهایی مثل Claude Code سازگار است و دایرهی…