
حذف دو-سوم دستورات پرامپت بازدهی مدلهای زبانی را افزایش داد
بررسی ۱۴٬۴۰۰ مورد نشان میدهد حذف قوانین متضاد، بهینهترین راه برای کاهش خطای پرامپت است. این استراتژی ساده، دقتی مشابه با اصلاحات پیچیده دارد اما هزینهی توکنها را بهشدت کاهش…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۹ مقاله منتشر شده

بررسی ۱۴٬۴۰۰ مورد نشان میدهد حذف قوانین متضاد، بهینهترین راه برای کاهش خطای پرامپت است. این استراتژی ساده، دقتی مشابه با اصلاحات پیچیده دارد اما هزینهی توکنها را بهشدت کاهش…

تحلیلی جدید نشان میدهد اجبار عاملهای هوش مصنوعی به مواجهه با خطاهای صریح در فراخوانی ابزارها، شکستهای «ساکت» را بهشدت کاهش میدهد. این رویکرد به توسعهدهندگان اجازه میدهد…

توسعه هوش مصنوعی از دستورات دستی به سمت «مهندسی حلقه» و «مهندسی گراف» حرکت میکند تا عاملها بتوانند اهداف پیچیده را در چرخههای خودکار اجرا کنند. این تغییر اجازه میدهد مدلها…

آنتروپیک با معرفی حالت Auto در Claude Code، تاییدات دستی را با یک مدل طبقهبندی جایگزین کرد تا عاملهای مهندسی بتوانند ساعتها بدون توقف کار کنند. یک مهندس Nuro با این قابلیت…

مدلهای زبانی بزرگ بهجای اجرای محاسبات قطعی، به دنبال تکمیل الگوهای متنی هستند. این نقص ساختاری در کنار توکنسازی که ارزش مکانی اعداد را از بین میبرد، باعث تولید پاسخهای…

تحلیل جدید Prime Intellect روی ۱۸ مدل پیشرو نشان میدهد Fable 5 در حال حاضر پیشروترین عامل در بهینهسازی خودکار است. این نتایج شکاف عمیقی را میان عاملهای سطح اول و سایر مدلهای…

استارتاپ لندنی Inherent با معرفی عامل هوش مصنوعی Faraday، ثابت کرد که مدلهای کوچکتر میتوانند در بازتولید یافتههای علمی از مدلهای غولپیکر پیشی بگیرند. این موفقیت بهجای تکیه…

آزمونهای میدانی روی موتور PlannerCritic نشان میدهد که مدلهای بزرگتر همچنان در منطق وابستگیها شکست میخورند. برای تضمین اجرای برنامهها، جایگزینی پارامترهای بیشتر با…

شکست بسیاری از عاملهای هوش مصنوعی نه به دلیل ضعف مدل، بلکه به دلیل نبود زیرساختهای حمایتی است. رویکرد «مهندسی شاسی» با تمرکز بر پایداری وضعیت و تأیید سختگیرانه، تولیدکنندههای…

آزمونهای مقایسهای نشان میدهد ChatGPT همچنان ابزاری برتر برای کارهای ساختاریافته و یکپارچگی فایلهاست، در حالی که Grok در تحلیل دادههای لحظهای شبکههای اجتماعی و استدلالهای…

مدل جدید و بازمتن علیبابا در وظایف کدنویسی عاملمحور و کنترل رایانه، مدلهای ابری پیشرو را شکست داد. این مدل با معماری توجه ترکیبی، پردازش تا یک میلیون توکن را روی سختافزارهای…

گوگل دیپمایند با مدلسازی ریاضی مسیریابی مدلها به عنوان مسئله «جعبه پانجورا»، هزینههای محاسباتی انتخاب مدل بهینه را به شدت کاهش داده است. این چارچوب بهصورت پویا تصمیم میگیرد…