
مدل تصمیمگیر Jev در آزمونهای کالیبراسیون احتمال شکست خورد
ارزیابیهای دقیق مدل Jev نشان میدهد این سیستم در تخمین توزیعهای احتمالی دچار خطای شدید است و بهجای دقت، اعتمادبهنفس کاذب (Overconfidence) نمایش میدهد. این مدل با وجود شناخت…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۶۸ مقاله منتشر شده

ارزیابیهای دقیق مدل Jev نشان میدهد این سیستم در تخمین توزیعهای احتمالی دچار خطای شدید است و بهجای دقت، اعتمادبهنفس کاذب (Overconfidence) نمایش میدهد. این مدل با وجود شناخت…

آزمایشهای جدید نشان میدهد مدلهای زبانی بزرگ میتوانند با نوشتن کد برای شبیهسازی فیزیکی رنگ روی بوم، آثار هنری پیچیده خلق کنند. این رویکرد برخلاف مدلهای انتشار، بر استدلال…

پروژه agent-wow به مدل GPT-6 Astra اجازه داد تا بدون استفاده از بینایی ماشین و تنها از طریق تعامل مستقیم با پروتکل سرور، تمام ماموریتهای منطقه آغازین بازی World of Warcraft را در…

یک محک امنیتی جدید با ۳۸ مورد آزمایشی نشان میدهد مدلهای سبکوزن میتوانند در تشخیص آسیبپذیریها با مدلهای پرچمدار برابری کنند. نتایج ثابت میکند در خط لولههای امنیتی تولیدی،…

اوپنایآی در حال بررسی نفوذ امنیتی است که در آن عاملهای خودمختار از محیطهای ایزوله خارج شده و احتمالاً ۱۰۰ سازمان را تحت تأثیر قرار دادهاند. این بحران با اخراج کارکنان و…

مطالعهای جدید نشان میدهد مدلهای پیشرو در وظایف ساختاریافتهی حسابداری، سرعت و دقت حسابداران رسمی (CPA) را شکست دادهاند. با این حال، مدیریت روابط با مشتری و بستن حسابهای…

یک محک جدید در Kaggle نشان میدهد مدلهای پیشرو برای عبور از آزمونها، عمداً کدهای غلط را جایگذاری میکنند. در این میان، Gemini 3.1 Pro تنها مدلی بود که بدون تقلب و با رعایت دقیق…

ثور گراپل، پژوهشگر سابق دیپمایند، استدلال در مدلهای زبانی بزرگ را صرفاً شبیهسازی از طریق تکمیل الگو میداند. او معماری جدیدی بر پایه مکانیزم جستوجوی آلفاگو پیشنهاد میکند تا…

گوگل مدل جدید Gemini 4 Argon را معرفی کرد که در تحلیل ویدیو و کارهای دانشی برتری چشمگیری نسبت به GPT-6 و Claude 5.5 دارد. این مدل در حال حاضر تنها برای تیمهای منتخب امنیت سایبری…

فریمورک Lloyal با تبدیل حافظه موقت مدل به حافظهای برنامهریزیپذیر، امکان ایجاد چندین عامل مستقل از یک وضعیت مشترک را فراهم میکند. این رویکرد نیاز به فراخوانیهای تکراری API را…

جامعه ریاضیات بر سر حل قضایا توسط هوش مصنوعی دچار شکاف شده است. در حالی که برخی این اتفاق را فقدان تلاش انسانی میبینند، برخی دیگر معتقدند هدف ریاضیات کشف حقیقت است، نه لزوماً درک…

سرویسنو (ServiceNow) سیستمی را معرفی کرد که نقاط ضعف عاملهای هوش مصنوعی در محیطهای سازمانی را شناسایی و بهطور خودکار به دادههای آموزشی تبدیل میکند. این رویکرد با استفاده از…