
Autopilot: کاهش نرخ توهم در عاملهای هوش مصنوعی از ۳۳.۷٪ به ۰.۶۷٪
مدل Autopilot با بهکارگیری ماشین حالت متناهی (FSM)، ادعاهای نادرست عاملها درباره اتمام موفقیتآمیز کار را حذف کرد. این معماری در بنچمارک SWE-bench Lite توانست نرخ توهم را از…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۳۶ مقاله منتشر شده

مدل Autopilot با بهکارگیری ماشین حالت متناهی (FSM)، ادعاهای نادرست عاملها درباره اتمام موفقیتآمیز کار را حذف کرد. این معماری در بنچمارک SWE-bench Lite توانست نرخ توهم را از…

پژوهشگران با تحلیل داخلی مدل Walrus دریافتند که موفقیت این مدل در پیشبینی پدیدههای فیزیکی، ناشی از درک قوانین طبیعت نیست، بلکه نتیجهی تقریبهای آماری پیچیده است. این یافته نشان…

پژوهشگران با معرفی روش **Runtime Skill Audit** (RSA)، سیستمی برای شناسایی رفتارهای مخرب در **عاملهای هوش مصنوعی** (AI Agents) توسعه دادهاند که از چشمان تحلیلهای استاتیک پنهان…

پژوهشهای جدید نشان میدهد مدلهای زبانی بزرگ توانایی استدلال اخلاقی بسیار بالاتری از آنچه تصور میشد دارند. این پیشرفت از طریق تغییر متدولوژی ارزیابی — از پاسخهای باز به تولید…

پلتفرم Argus با جایگزینی مدلهای مرجع تک-تصویری با یک موزاییک پویا و ۳x۳، مشکل تغییر هویت سوژه در ویدیوهای ساختهشده با هوش مصنوعی را حل کرده است. این رویکرد باعث میشود چهرهها…

پژوهشگران چارچوبی همافزا برای ادغام مدلهای زبانی بزرگ با دادههای گرافساختار را پیشنهاد دادهاند تا شکافهای استدلالی در تحلیلهای چندمرحلهای را برطرف کنند. این رویکرد…

چارچوب TAROT با تبدیل مدلهای زبانی از پیشبین به معمار گرافهای معنایی، دقت پیشبینی در مجموعهدادههای جدولی کوچک را افزایش داده است. این سیستم با فیلتر کردن توهمات مدل زبانی،…

پژوهشگران چارچوب AVIS را معرفی کردند که با مقیاسگذاری تطبیقی توکنهای بصری و مراحل استدلال، هزینه استنتاج مدلهای چندوجهی را کاهش میدهد. این سیستم بدون نیاز به آموزش مجدد، تعادل…

یک چارچوب جدید با استفاده از مدلهای زبانی برای استخراج قوانین فیزیکی از متون علمی و تبدیل آنها به شبکههای عصبی سبک برای محیطهای صنعتی طراحی شده است. این روش امکان پیشبینی…

یک سامانه جدید یادگیری فدرال برای تشخیص ناهنجاریهای ECG، با ترکیب حریم خصوصی تفاضلی و کوانتیزاسیون INT8، دقت بالای مدل را در سختافزارهای لبه حفظ میکند. این سیستم روی Raspberry…

یک قضیه ریاضی جدید ثابت میکند که هیچ استراتژی آموزشی مبتنی بر مشاهدهی رفتار نمیتواند صداقت مطلق یک مدل را تضمین کند. این پژوهش نشان میدهد عاملها تمایل دارند پاسخهایی دهند که…

یک چارچوب عاملمحور جدید با استفاده از AutoGen، طراحی موانع بتنی بزرگراهها را با دقت ۹۸٪ خودکار کرده است. این پژوهش ثابت میکند مدلهای ۸ میلیاردی در صورت مدیریت در یک سیستم…