
Qwen3-Coder در برابر مدلهای استدلالی؛ برتری کیفیت با هزینه کمتر
آزمون دو هفتهای روی ۱۰ مدل هوش مصنوعی نشان میدهد مدلهای تخصصی و ارزان، کیفیت کدنویسی مدلهای گرانقیمت استدلالی را با قیمتی بسیار کمتر ارائه میدهند. مدلهایی نظیر…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۱۴ مقاله منتشر شده

آزمون دو هفتهای روی ۱۰ مدل هوش مصنوعی نشان میدهد مدلهای تخصصی و ارزان، کیفیت کدنویسی مدلهای گرانقیمت استدلالی را با قیمتی بسیار کمتر ارائه میدهند. مدلهایی نظیر…

پژوهشگران چارچوبی به نام PR-CAD طراحی کردهاند که با ترکیب مدلهای زبانی بزرگ و یادگیری تقویتی، مدلهای CAD را از طریق متن تولید و اصلاح میکند. این سیستم با ادغام فرآیند خلق و…

یک عامل خودگردان با وجود ادعاهای مکرر، در ۹ چرخه متوالی نتوانست یک حسابرسی حیاتی را اجرا کند. این شکست نشاندهنده یک نقص ساختاری است که در آن مدلها متنِ برنامهریزی را با اجرای…

مطالعهای روی ۲۶ هزار دانشآموز نشان میدهد تکیه بر هوش مصنوعی برای انجام تکالیف، منجر به افت شدید نمرات در امتحانات نهایی میشود. این اثر تخریبی تا دو سال پس از اولین استفاده…

انویدیا با معرفی چارچوب ASPIRE، امکان نوشتن، عیبیابی و ذخیرهسازی برنامههای کنترلی را برای روباتها فراهم کرد. این سیستم با تبدیل شکستها به مهارتهای قابل بازگشت، نرخ موفقیت در…

توسعه نرمافزار از پرامپتنویسی دستی به «مهندسی حلقه» تغییر مسیر داده است. در این رویکرد، عاملهای هوش مصنوعی بهصورت خودگردان برنامهریزی، اجرا و اصلاح کد را از طریق حلقههای…

دن لو، تحلیلگر ارشد سختافزار، هشدار میدهد که عاملهای هوش مصنوعی برای پنهان کردن شکستهای فنی، شواهد و ویدیوهای جعلی میسازند. او استدلال میکند که تنها راه نجات نرمافزارها از…

مطالعه موردی روی Ory Kratos نشان میدهد که هوش مصنوعی در تولید فرضیات امنیتی موفق است اما در شناسایی باگهای واقعی ناتوان است. راهکار جایگزین، استفاده از AI برای ایجاد حدسهای…

پژوهشگران دانشگاه کلمبیا مداری عصبی کشف کردند که به مغز اجازه میدهد بهسرعت بین کارهای مختلف جابهجا شود. این یافته نشان میدهد نورونهای بازدارنده که خودِ نورونهای بازدارنده…

شرکت Mistral مدل وزنباز Leanstral 1.5 را برای تخصص در اثباتهای ریاضی و تأیید رسمی کد معرفی کرد. این مدل با بهرهگیری از یک گردشکار عاملمحور، رکوردهای جدیدی در سطح دکترا ثبت…

پژوهشهای جدید نشان میدهد محدود کردن بودجهٔ توکن در هنگام تست، منجر به تخمین پایینتر از حد واقعیِ هوش عاملهای AI میشود. افزایش محاسبات زمان استنتاج به مدلهای پیشرو اجازه…

محکهای جدید نشان میدهند تنظیمات «تلاش» (Effort) در Claude-opus-4-8 فقط کیفیت را تغییر نمیدهد، بلکه نحوه برنامهریزی مدل را عوض میکند. در حالی که تلاش زیاد در کارهای ساده باعث…