DeepSWE: نرخ خطای ۳۲ درصدی در سامانه تأیید SWE-bench Pro
بنچمارک جدید DeepSWE با هدف حذف آلودگی دادهها، شکاف عملکردی عاملهای کدنویسی در وظایف پیچیده و بلندمدت را آشکار کرد. این مطالعه نشان میدهد مدلهای پیشرو در بسیاری از موارد، به…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۳ مقاله منتشر شده
بنچمارک جدید DeepSWE با هدف حذف آلودگی دادهها، شکاف عملکردی عاملهای کدنویسی در وظایف پیچیده و بلندمدت را آشکار کرد. این مطالعه نشان میدهد مدلهای پیشرو در بسیاری از موارد، به…
آندری کارپاتی سیستم autoresearch را معرفی کرد که حلقههای پژوهشی خودکار را بر اساس معیارهای انسانی اجرا میکند. این ابزار نقش متخصص را از «اجراکننده آزمایش» به «طراح فضای جستوجو…
پژوهشی جدید مکانیسمی شبیه به «خواب» را برای مدلهای زبانی پیشنهاد میدهد که با تبدیل بافت متنی به وزنهای دائمی، مشکل مقیاسپذیری حافظه را حل میکند. این روش باعث کاهش تأخیر در…
نسخه Cursor Composer 2.5 با معرفی یادگیری تقویتشده مبتنی بر بازخورد متنی هدفمند، مشکل «تخصیص اعتبار» در جلسات طولانی را حل کرده است. این روش با جایگزینی پاداشهای کلی با…
یک خط لوله (Pipeline) جدید برای آموزش مدلهای بینایی-زبانی معرفی شده است که به جای تکیه بر حدسهای هوش مصنوعی، از اثباتهای ریاضی برای پاداشدهی استفاده میکند. این روش با ترکیب…
چارچوب جدید SkillOpt مایکروسافت مهارتهای عاملهای هوش مصنوعی را بهجای تغییر وزنهای مدل، از طریق توصیفات متنی بهینه میکند. این روش در ۵۲ محیط مختلف، نتایجی برابر یا بهتر از…
اپل برای ارتقای سیری از یک مدل سفارشی ۱.۲ تریلیون پارامتری گوگل استفاده میکند. این سیستم وظایف را بین پردازش محلی برای کارهای ساده و استنتاج ابری برای درخواستهای پیچیده تقسیم…
شرکت Hugging Face یک چارچوب فنی برای استانداردسازی مفاهیم عاملهای هوش مصنوعی معرفی کرد. این مدل با تفکیک مدل از لایههای اجرایی، دیدگاهی دقیق برای طراحی و آموزش سیستمهای…
سیستم AlphaProof Nexus گوگل توانست ۹ مسئلهی ریاضی دشوار Erdős را با استفاده از یک حلقهی تأیید رسمی حل کند. این دستاورد ثابت میکند که عاملهای سادهی متصل به کامپایلر میتوانند…
جورج هاتز هشدار میدهد که عاملهای کدنویس تنها تقلیدکنندههای آماری هستند و با ایجاد باگهای پنهان، هزینههای سنگینی ایجاد میکنند. در حالی که کارپاتی بهرهوری ۱۰ برابری را…
پژوهشگران با معرفی بنچمارک CiteVQA، پدیدهی «توهم استنادی» را شناسایی کردند؛ وضعیتی که در آن مدلها پاسخ درست میدهند اما منبع اشتباهی را ذکر میکنند. نتایج نشان میدهد حتی…
مدل استدلالی جدید OpenAI توانست معمای هندسی ۸۰ سالهای را که توسط پل اردوش مطرح شده بود، بهطور مستقل حل و باطل کند. این دستاورد که توسط ریاضیدانان برجسته تأیید شده، نشاندهندهی…