
افزایش ۱۳.۳۴ درصدی دقت استدلال ریاضی در AIME ۲۰۲۵ با چارچوب EXPO
چارچوب بهینهسازی جدیدی به نام EXPO با جایگزینی جریمههای ثابت KL و نمونهبرداری یکنواخت، توانست عملکرد مدلهای Qwen در استدلال ریاضی را بهطور چشمگیری ارتقا دهد. این دستاورد نشان…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۶۹۱ مقاله منتشر شده

چارچوب بهینهسازی جدیدی به نام EXPO با جایگزینی جریمههای ثابت KL و نمونهبرداری یکنواخت، توانست عملکرد مدلهای Qwen در استدلال ریاضی را بهطور چشمگیری ارتقا دهد. این دستاورد نشان…

پژوهشگران چارچوب RADAR را معرفی کردند که با استفاده از مدلهای انتشار گراف، ساختار ارتباطی سیستمهای چندعاملی را بهصورت پویا تولید میکند. این روش با تطبیق توپولوژی شبکه با هر…

بنچمارک جدید KnotBench نشان میدهد مدلهای پیشرو در استدلال دیاگرامی گرهها، عملکردی نزدیک به حدس تصادفی دارند. این مطالعه یک «شکاف ادراکی-عملیاتی» حیاتی را شناسایی کرده است که در…

رویکرد جدید M2A با ادغام پارامترها در فضای تهی، توانایی استدلال ریاضی را به عاملهای هوش مصنوعی تزریق میکند بدون آنکه نیاز به آموزش مجدد باشد. این متد نرخ حل مسائل SWE-Bench در…

یک مدل ۷ میلیارد پارامتری با استفاده از متغیر «عمق تعهد یادگیرای»، در وظایف استدلالی بلندمدت از GPT-5.5 و Claude Sonnet پیشی گرفت. این رویکرد با بهینهسازی زمان بازطراحی…

یک چارچوب نظری جدید مفهومی به نام «سوگیری رویهای» را معرفی میکند که در آن مدلها نتایجی عادلانه تولید میکنند اما بر اساس منطقی تبعیضآمیز. این پژوهش متدی برای حسابرسی و تضمین…

ابزار جدیدی به نام کاوشگر فراشناختی نشان میدهد که مدلهای پیشرو میتوانند در یک بُعد از اطمینان دقیق باشند اما در بُعدی دیگر بهطور کامل شکست بخورند. این یافته نقطه کوری حیاتی در…

مدلهای پیشرو در درک باورهای دیگران موفقاند اما در محیطهای سهبعدی نمیتوانند بر اساس این دانش عمل کنند. بنچمارک جدید EnactToM نشان میدهد هفت مدل برتر در تمامی وظایف دشوار…

هوش مصنوعی از یک ابزار کمکی به عاملهای خودکاری تبدیل شده که قادر به تکثیر سریع و حتی بازنویسی درایورهای سیستم هستند. این تحول، معماری مراکز داده را به سمتی میبرد که در آن…

شرکت AWS معماری چهارلایه جدیدی را برای پشتیبانی از «سه قانون مقیاسپذیری» مدلهای بنیادی معرفی کرد. این ساختار با ادغام پردازندههای NVIDIA Blackwell و شبکه EFAv4، تلاش میکند…

سازمان OWASP ابزاری متنباز برای مقابله با «مسمومیت حافظه» در عاملهای هوش مصنوعی معرفی کرد. این اسکنر دستورات مخربی را که در حافظه بلندمدت ذخیره شده و در جلسات آینده فعال…

دارون عجماوغلو، برنده جایزه نوبل اقتصاد، معتقد است عاملهای هوش مصنوعی بهدلیل فقدان مهارت «ارکستراسیون» یا مدیریت وظایف متنوع، نمیتوانند جایگزین انسان شوند. او هشدار میدهد که…