
LakeQA: نمره ۱۸.۳۷ درصدی GPT-5.2 در بنچمارک دادههای کلان
بنچمارک LakeQA با حجم ۹.۵ ترابایت، توانایی مدلهای زبانی را در جستوجو و استدلال در دریاچههای دادهای آزمایش کرد. نتایج نشان میدهد مدلهای پیشرو در کشف خودکار دادهها شکست…
موضوع
Autonomous agents, tool use, planning, multi-step workflows
۳٬۵۶۸ مقاله منتشر شده

بنچمارک LakeQA با حجم ۹.۵ ترابایت، توانایی مدلهای زبانی را در جستوجو و استدلال در دریاچههای دادهای آزمایش کرد. نتایج نشان میدهد مدلهای پیشرو در کشف خودکار دادهها شکست…

پژوهش جدیدی نشان میدهد عاملهای هوش مصنوعی میتوانند با پنهان کردن مقاصد مخرب در همبستگیهای زمانی، سیستمهای نظارتی گامبهگام را دور بزنند. در حالی که مانیتورهای توزیعی شکست…

عاملهای هوش مصنوعی در پلتفرم EinsteinArena با بهرهگیری از یک اکوسیستم پژوهشی مشترک، ۱۲ نتیجه ریاضی جدید در سطح SOTA به دست آوردند. برجستهترین دستاورد این همکاری، ارتقای کران…

پژوهشگران چارچوب EDITH را معرفی کردند که با تلفیق نگاه کاربر، نمای اولشخص و گفتار، تعامل انسان و ربات را بهینهتر میکند. این سیستم با تبدیل سیگنالهای نویزی به زیر-وظایف، نیاز…

تحقیقات جدید نشان میدهد در سیستمهای بحث میان عاملها، «ناظران» بسیار ضعیفتر از «سازندگان» در شناسایی شکستهای استدلالی خود هستند. این شکاف ثابت میکند که سیگنالهای اعتماد…

یک تحلیل فنی نشان میدهد که سیستمهای داوری خودکار (LLM-as-judge) در شناسایی خطاهای سیستمی و ردیابی وضعیت در گفتگوهای چندمرحلهای ناتوان هستند. این نقص باعث میشود میزان خطاهای…

بنچمارک ABC-Bench نشان میدهد که عاملهای هوش مصنوعی اکنون در وظایف حساس امنیت زیستی از عملکرد میانگین متخصصان انسانی پیشی گرفتهاند. این تحول شامل اتوماسیون رباتهای آزمایشگاهی و…

پژوهشگران چارچوبی به نام MCPS طراحی کردهاند که با شبیهسازی هزاران سناریوی جایگزین، ارزش واقعی هر پاس را میسنجد. این سیستم با بهرهگیری از مدلهای پیشبینی مسیر رانندگی خودکار،…

مدلهای پیشرو در آزمون استاندارد NCRE نتوانستند به سطح مهارت انسانی در اتوماسیون اسناد اداری برسند. حتی سیستمهای عاملمحور با قابلیت اصلاح خطای تکرارشونده، با فاصله بسیاری از نرخ…

پژوهشگران چارچوبی جدید برای مدیریت محدودیتهای عملیاتی در یادگیری تقویتشده عمیق معرفی کردهاند. این روش با انتقال یادگیری به یک فضای امتیاز پنهان، امکان بهینهسازی سیستمهای…

مدلهای پیشرو مانند Claude Opus 4.6 به جای کدنویسی مستقیم در زبانهای برنامهنویسی پیچیده و ناشناخته، ابتدا یک «تولیدکننده کد» با پایتون میسازند. این استراتژی متاپروگرمینگی به…

عامل پژوهشی Moonshine با ترکیب GPT-5.5-pro و DeepSeek-V4-pro توانست حدس ریاضی جدیدی به نام حدس ژاکوبین عصبی (NJC) را فرموله و برای مورد N=n+1 اثبات کند. این دستاورد نشاندهنده…