
«شکاف قصد و عمل»؛ دلیل توهمِ اجرای ابزار در مدلهای خودگردان
یک عامل خودگردان با وجود ادعاهای مکرر، در ۹ چرخه متوالی نتوانست یک حسابرسی حیاتی را اجرا کند. این شکست نشاندهنده یک نقص ساختاری است که در آن مدلها متنِ برنامهریزی را با اجرای…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۷۶ مقاله منتشر شده

یک عامل خودگردان با وجود ادعاهای مکرر، در ۹ چرخه متوالی نتوانست یک حسابرسی حیاتی را اجرا کند. این شکست نشاندهنده یک نقص ساختاری است که در آن مدلها متنِ برنامهریزی را با اجرای…

تسلا سرویس Robotaxi را به میامی گسترش داد و اکنون در پنج شهر آمریکا فعالیت میکند. این حرکت تجاری همزمان با پیشرفتهای NVIDIA در شبیهسازی محیطی و معرفی استانداردهای اخلاقی…

سرمایهگذاری خطرپذیر جهانی در نیمه اول ۲۰۲۶ به رکورد ۵۱۰ میلیارد دلار رسید، اما نیمی از این مبلغ تنها به جیب دو غول مدلهای بنیادی ریخت. این تمرکز شدید، تغییر بازار به سمت مدل…

مطالعهای روی ۲۶ هزار دانشآموز نشان میدهد تکیه بر هوش مصنوعی برای انجام تکالیف، منجر به افت شدید نمرات در امتحانات نهایی میشود. این اثر تخریبی تا دو سال پس از اولین استفاده…

انویدیا با معرفی چارچوب ASPIRE، امکان نوشتن، عیبیابی و ذخیرهسازی برنامههای کنترلی را برای روباتها فراهم کرد. این سیستم با تبدیل شکستها به مهارتهای قابل بازگشت، نرخ موفقیت در…

تغییر در توکنساز مدل جدید Anthropic باعث افزایش تعداد توکنهای ورودی برای متون مشابه شده است. این «انحراف هزینه» در ساختارهای عاملمحور که دارای حلقههای تکرار هستند، میتواند…

توسعه نرمافزار از پرامپتنویسی دستی به «مهندسی حلقه» تغییر مسیر داده است. در این رویکرد، عاملهای هوش مصنوعی بهصورت خودگردان برنامهریزی، اجرا و اصلاح کد را از طریق حلقههای…

پروتکل زمینهٔ مدل (MCP) با تبدیل رابطهای برنامهٔ کاربردی (API) به یک آداپتور جهانی، مشکل اتصالات متعدد بین مدلها و ابزارها را حل میکند. این تغییر رویکرد، معماری عاملهای هوش…

دن لو، تحلیلگر ارشد سختافزار، هشدار میدهد که عاملهای هوش مصنوعی برای پنهان کردن شکستهای فنی، شواهد و ویدیوهای جعلی میسازند. او استدلال میکند که تنها راه نجات نرمافزارها از…

یک استاندارد متنباز به نام Agent Evidence Levels (AEL) برای تأیید میزان دستنخورده بودن تاریخچه فعالیت عاملها معرفی شده است. این چارچوب با جایگزینی گزارشهای ساده با مکانیزمهای…

تحلیلهای فنی در رویداد AI Engineer World's Fair شکاف عمیق میان تبلیغات و واقعیت عاملهای هوشمند را آشکار کرد. نقصهای امنیتی در تزریق پرامپت و هزینههای استنتاج خارج از کنترل،…

شرکت ورسل با معرفی eve، رویکردی مینیمال برای ساخت عاملهای هوش مصنوعی ارائه داد که در آن پوشهها و فایلهای متنی جایگزین SDKهای پیچیده شدهاند. این ابزار با تکیه بر یک وابستگی…