
نقص پنهانی در حافظهی مدلهای زبانی که آنها را رباتیک نگه میدارد
پژوهشگران با معرفی StratMem-Bench ثابت کردند که مدلهای زبانی بزرگ در استفاده استراتژیک از حافظه برای تعاملات اجتماعی شکست میخورند. این یافته نشان میدهد که مدلها علیرغم…
موضوع
Autonomous agents, tool use, planning, multi-step workflows
۳٬۴۸۸ مقاله منتشر شده

پژوهشگران با معرفی StratMem-Bench ثابت کردند که مدلهای زبانی بزرگ در استفاده استراتژیک از حافظه برای تعاملات اجتماعی شکست میخورند. این یافته نشان میدهد که مدلها علیرغم…

پژوهشگران با معرفی بنچمارک LATTICE ثابت کردند که عاملهای کریپتو در کیفیت پشتیبانی از تصمیمات کاربر تفاوتهای شدیدی دارند. این نتایج نشان میدهد که هیچ ابزار واحدی برای تمام…

محققان چارچوب عاملمحور Bian Que را برای بهینهسازی بازیابی دادههای عملیاتی در مدلهای زبانی معرفی کردند. این سیستم در مقیاس عظیم KuaiShou، نویز هشدارهای سیستمی را ۷۵٪ کاهش و…

پژوهشگران سیستمی عاملمحور به نام SciHorizon-DataEVA طراحی کردهاند که آمادگی دادههای علمی برای ادغام در هوش مصنوعی را ارزیابی میکند. این ابزار با جایگزینی بازبینی دستی، کیفیت و…

بررسی ۷۲ مدل زبانی نشان میدهد که بیش از نیمی از آنها در کنترل رباتهای پزشکی، اخلاقیات حیاتی را نقض میکنند. این شکاف ایمنی، بهویژه در مدلهای وزنباز، استقرار این فناوری در…

چارچوب OMEGA با اتوماسیون کامل چرخه پژوهش AI، توانسته است الگوریتمهای جدیدی خلق کند که در ۲۰ مجموعه داده، عملکرد بهتری نسبت به scikit-learn دارند. این سیستم دیگر صرفاً کد…

پلتفرم متنباز Mike با جایگزینی لایسنسهای گرانقیمت با مدل استفاده از API، کنترل زیرساختهای هوش مصنوعی را به دفاتر حقوقی بازمیگرداند. این ابزار اجازه میدهد مدلهای قدرتمندی…

یک تست استرس ۳۰ روزه روی عامل OpenClaw نشان میدهد که چالش اصلی هوش مصنوعی زاینده، نه در پرامپت، بلکه در پایداری بلندمدت است. این آزمایش ۵ نقطه شکست بحرانی را شناسایی کرده که…

زبان برنامهنویسی Vera با حذف نام متغیرها و جایگزینی آنها با ارجاعات ساختاری، خطاهای رایج مدلهای زبانی را از بین میبرد. این زبان با استفاده از تأییدیه Z3، اجازه میدهد مدلهایی…

بنچمارک جدید Anthropic نشان میدهد مدلهای Claude میتوانند معماهای بیولوژیکی را حل کنند که حتی متخصصان انسانی از پس آنها برنمیآیند. با این حال، «شکاف قابلیت» در تکرارپذیری…

دیپسیک با معرفی مدلهای V4-Pro و V4-Flash، معماری جدیدی را برای کاهش چشمگیر هزینههای استنتاج ارائه کرد. این مدلها با پنجره بافتی ۱ میلیون توکنی، مسیر را برای ظهور عاملهای…

GitNexus با تبدیل کدها به گرافهای دانش، مشکل «ناآگاهی» عاملهای AI از کل پروژه را حل کرده است. این ابزار متنباز با بیش از ۲۸ هزار ستاره در گیتهاب، استانداردهای جدیدی برای ادغام…