بنچمارک ITBench-AA: نرخ موفقیت مدلهای پیشرو در وظایف SRE کمتر از ۵۰٪ است
یک بنچمارک جدید از IBM و Artificial Analysis نشان میدهد که پیشرفتهترین مدلهای هوش مصنوعی در عیبیابی زیرساختهای سازمانی شکست میخورند. یافتهها حاکی از یک رابطه معکوس…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۳ مقاله منتشر شده
یک بنچمارک جدید از IBM و Artificial Analysis نشان میدهد که پیشرفتهترین مدلهای هوش مصنوعی در عیبیابی زیرساختهای سازمانی شکست میخورند. یافتهها حاکی از یک رابطه معکوس…
موتور استنتاج TokenSpeed با بهینهسازی حافظه و ادغام کرنلها، رکورد ۵۸۰ توکن در ثانیه را برای مدل Qwen3.5-397B روی پردازندههای NVIDIA Blackwell ثبت کرد. این پیشرفت بهویژه برای…
بنچمارک جدید DeepSWE با هدف حذف آلودگی دادهها، شکاف عملکردی عاملهای کدنویسی در وظایف پیچیده و بلندمدت را آشکار کرد. این مطالعه نشان میدهد مدلهای پیشرو در بسیاری از موارد، به…
آندری کارپاتی سیستم autoresearch را معرفی کرد که حلقههای پژوهشی خودکار را بر اساس معیارهای انسانی اجرا میکند. این ابزار نقش متخصص را از «اجراکننده آزمایش» به «طراح فضای جستوجو…
پژوهشی جدید مکانیسمی شبیه به «خواب» را برای مدلهای زبانی پیشنهاد میدهد که با تبدیل بافت متنی به وزنهای دائمی، مشکل مقیاسپذیری حافظه را حل میکند. این روش باعث کاهش تأخیر در…
نسخه Cursor Composer 2.5 با معرفی یادگیری تقویتشده مبتنی بر بازخورد متنی هدفمند، مشکل «تخصیص اعتبار» در جلسات طولانی را حل کرده است. این روش با جایگزینی پاداشهای کلی با…
یک خط لوله (Pipeline) جدید برای آموزش مدلهای بینایی-زبانی معرفی شده است که به جای تکیه بر حدسهای هوش مصنوعی، از اثباتهای ریاضی برای پاداشدهی استفاده میکند. این روش با ترکیب…
چارچوب جدید SkillOpt مایکروسافت مهارتهای عاملهای هوش مصنوعی را بهجای تغییر وزنهای مدل، از طریق توصیفات متنی بهینه میکند. این روش در ۵۲ محیط مختلف، نتایجی برابر یا بهتر از…
اپل برای ارتقای سیری از یک مدل سفارشی ۱.۲ تریلیون پارامتری گوگل استفاده میکند. این سیستم وظایف را بین پردازش محلی برای کارهای ساده و استنتاج ابری برای درخواستهای پیچیده تقسیم…
شرکت Hugging Face یک چارچوب فنی برای استانداردسازی مفاهیم عاملهای هوش مصنوعی معرفی کرد. این مدل با تفکیک مدل از لایههای اجرایی، دیدگاهی دقیق برای طراحی و آموزش سیستمهای…
سیستم AlphaProof Nexus گوگل توانست ۹ مسئلهی ریاضی دشوار Erdős را با استفاده از یک حلقهی تأیید رسمی حل کند. این دستاورد ثابت میکند که عاملهای سادهی متصل به کامپایلر میتوانند…
جورج هاتز هشدار میدهد که عاملهای کدنویس تنها تقلیدکنندههای آماری هستند و با ایجاد باگهای پنهان، هزینههای سنگینی ایجاد میکنند. در حالی که کارپاتی بهرهوری ۱۰ برابری را…