
ابزار laya-evals هزینه ارزیابی مدلهای زبانی را به صفر رساند
ابزار متنباز laya-evals امکان اجرای ارزیابیهای مبتنی بر مدل را بهصورت محلی و رایگان فراهم میکند. تمرکز این ابزار بر کالیبراسیون است تا اطمینان حاصل شود سطح اعتماد مدل با دقت…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۶۱ مقاله منتشر شده

ابزار متنباز laya-evals امکان اجرای ارزیابیهای مبتنی بر مدل را بهصورت محلی و رایگان فراهم میکند. تمرکز این ابزار بر کالیبراسیون است تا اطمینان حاصل شود سطح اعتماد مدل با دقت…

تغییری بنیادین در معماری دستیارهای کدنویسی، آنها را از جلسات موقت به محیطهای کاری پایدار تبدیل میکند که از هر تعامل میآموزند. این سیستمها با استفاده از گرافهای حافظه، نیاز…

شرکت Perplexity با همکاری turbopuffer مدل pplx-embed-v2-context-9b-preview را معرفی کرد. این مدل با تغییر رویکرد آموزش از «بخشهای طلایی» به «تأیید پاسخ»، دقت بازیابی مستندات در…

یک محک جدید نشان میدهد مدلهای پیشرو در صورت فشار کاربر، پاسخهای صحیح خود را تغییر میدهند. این مطالعه شکاف عمیقی را میان توانایی مدل در یافتن پاسخ درست و تواناییاش در دفاع از…

چارچوب R.A.H.S.I با معرفی مفهوم «یکپارچگی اجرا»، از تکرار عملیات و فساد دادهها در عاملهای هوش مصنوعی جلوگیری میکند. این سیستم روشی برای تطبیق زمانهای انتظار (Timeout) و مدیریت…

چارچوب R.A.H.S.I. رویکردی ساختاریافته برای جلوگیری از شکستهای فاجعهبار در عاملهای سازمانی است. این مدل تمرکز را از نرخ خطای ساده به «شعاع تخریب» تغییر میدهد تا اثرات یک نقص…

ابزار متنباز runtape با حذف سیستماتیک بخشهای مختلف پرامپت، دقیقترین جملهای که باعث خطای عاملهای هوش مصنوعی میشود را شناسایی میکند. این ابزار حدس و گمان در دیباگینگ را با…

یک چارچوب معماری جدید با ترکیب هوش مصنوعی عاملمحور و ابزارهای مشاهدهپذیری، فرآیند بررسی و رفع حوادث زیرساختی را خودکار میکند. این سیستم بهجای دسترسی مستقیم به محیط عملیاتی، از…

پروژه متنباز Botropolis با جایگزینی پرامپتهای تکبعدی، ۲۰ عامل متخصص را در یک سلسلهمراتب سازمانی با دپارتمانهای مجزا و یک مدیرعامل سازماندهی کرده است. این سیستم شامل خط لوله…

مدل Google_SAI-FluEns در رقابت FluSight سازمان CDC، از ۳۸ مدل دیگر پیشی گرفت. این سامانه با استفاده از یک فرآیند خودکار مبتنی بر مدلهای زبانی بزرگ، نرمافزارهای پیشبینی را…

اتحاد هوش مصنوعی (AI Alliance) نخستین گام فنی پروژه Tapestry را برای آموزش مدلهای بنیادی بدون اشتراکگذاری دادههای خام به پایان رساند. هند و ویتنام اکنون از این زیرساخت برای…

گوگل مدل جدید Gemini 4 Argon را که برای مهندسی نرمافزار و امنیت سایبری بهینه شده، معرفی کرد. برای جلوگیری از سوءاستفاده و حملات تزریق پرامپت، دسترسی اولیه تنها به گروهی از…