
بنچمارک FINAL-Bench: مدلهای زبانی در اصلاح خطاهای خود شکست میخورند
چارچوب ارزیابی FINAL-Bench نشان میدهد مدلهای زبانی بزرگ اغلب در شناسایی و اصلاح خطاهای استدلالی خود ناتواناند و حتی پاسخهای درست را به غلط تبدیل میکنند. این «تنگنای…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۷۱ مقاله منتشر شده

چارچوب ارزیابی FINAL-Bench نشان میدهد مدلهای زبانی بزرگ اغلب در شناسایی و اصلاح خطاهای استدلالی خود ناتواناند و حتی پاسخهای درست را به غلط تبدیل میکنند. این «تنگنای…

چارچوب جدید Human-Aligned Decision Transformers (HADT) به ماهوارهها اجازه میدهد حتی در زمان قطع کامل ارتباطات، به ناهنجاریهای بحرانی پاسخ دهند. این سیستم با جایگزینی یادگیری…

بررسی نقش حیاتی تحلیل اهمیت ویژگیها در مدلهای درخت تصمیم برای افزایش تفسیرپذیری و بهینهسازی دادهها. این رویکرد اجازه میدهد تا فرآیند رسیدن مدل به یک پیشبینی، از حالت جعبه…

عاملهای هوش مصنوعی در پروژههای قدیمی بهدلیل ناهماهنگی در نامگذاری و ساختار کد دچار خطا میشوند. استفاده از متدولوژی طراحی دامنه-محور (DDD) با ایجاد واژهنامههای دقیق، بستری…

تنسنت مدل پیشنمایش Hy4 را برای کاربردهای تخصصی در کدنویسی، علوم و مالی منتشر کرد. این مدل با پنجره متنی میلیونی و قابلیت بهینهسازی خودکار زیرساخت استنتاج، استانداردهای مدلهای…

پژوهشگران دانشگاه UCLA در حال توسعه Prela هستند؛ زبانی برای پرسوجو که با تکیه بر روابط دوتایی، پیچیدگی استخراج داده را بهشدت کاهش میدهد. این زبان با تبدیل روابط به توابع…

Triton جایگزینی پایتونمحور برای CUDA است که به جای مدیریت تکتک رشتهها، بر جابهجایی بلوکهای داده تمرکز میکند. این رویکرد با کاهش ترافیک حافظه و افزایش بازاستفاده از دادهها،…

یک کتابخانه جدید به مدلهای زبانی اجازه میدهد بهجای تولید کد HTML، رابطهای کاربری آنگولار را از طریق استریم یک مشخصات JSON محدود بسازند. این روش امنیت XSS را تضمین کرده و…

عاملهای هوش مصنوعی برای عبور از مرحله دستیار به مهندس مستقل، به چیزی فراتر از هوش خام نیاز دارند. چارچوب NAEOS با معرفی یک «قانون اساسی مهندسی» ماشینخوان، محدودیتهای سازمانی و…

پلتفرم ReclaimLLM با استفاده از معماری مستقل از ابزار، مشکل «نقاط کور» در مشاهدهپذیری سازمانی AI را حل کرده است. این ابزار با بهکارگیری قلابهای بومی، خروجیهای ترمینال و…

پژوهشهای جدید نشان میدهد مدلهای زبانی بزرگ بهجای ایفای نقش چتبات، باید بهعنوان لایهی زمینهی وضعیت جهان در VR عمل کنند. این رویکرد با تمرکز بر ارکستراسیون ساختاریافته،…

دولت ایالات متحده با هدف مهار تسلیحات خودمختار و جنگهای اطلاعاتی، شبکه A/I Collective را تحریم کرد. این نخستین بار است که یک مجموعه شرکت هوش مصنوعی بهجای یک دولت، بهعنوان تهدید…