
نرخ موفقیت در برابر هزینه؛ چالش استقرار عاملهای مهندسی نرمافزار
تحلیل جدید FrontierHarness نشان میدهد هزینهٔ عملیاتی عاملهای مهندسی نرمافزار با نرخ موفقیت آنها فاصله گرفته است. در حالی که برخی مدلها تسکهای بیشتری را پاس میکنند، هزینهٔ…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۶ مقاله منتشر شده

تحلیل جدید FrontierHarness نشان میدهد هزینهٔ عملیاتی عاملهای مهندسی نرمافزار با نرخ موفقیت آنها فاصله گرفته است. در حالی که برخی مدلها تسکهای بیشتری را پاس میکنند، هزینهٔ…

یک حسابرسی فنی نشان میدهد بیش از یکسوم ارجاعات عددی Perplexity به صفحاتی ختم میشوند که یا باز نمیشوند یا حاوی اعداد ذکر شده نیستند. این مطالعه حاکی از آن است که مدلها بهجای…

یک روال بهینهسازی جدید با استفاده از هوش مصنوعی، نقصهای تخلخل در تولید افزایشی فلزات را ۳۰٪ کاهش داده است. این سیستم کالیبراسیون دستی را با عملیاتی تککلیکی بر اساس دادههای…

افزایش پنجرهٔ زمینه به میلیونها توکن، مشکل بازیابی اطلاعات و وضعیت بلندمدت را حل نمیکند. پژوهشها نشان میدهند مدلها همچنان دچار سوگیری «گمشدن در میانه» و هزینههای عملیاتی…

یک تحلیل فارنزیک نشان میدهد تقریباً تمام فایلهای آزمون در بنچمارک SWE-bench پیش از اعمال اصلاحات، بهصورت عمومی در گیتهاب در دسترس بودهاند. این یعنی مدلهای پیشرو احتمالاً…

پژوهشگران چارچوب BenchMIRT را برای تفکیک سیگنالهای متناقض در ارزیابیهای مدلهای زبانی معرفی کردند. این ابزار نشان میدهد بسیاری از محکهای «ایمنی» در واقع توان استدلال کلی را…

آزمونهای مدل Tsubaki.3 نشان میدهد که با افزایش تعداد پنلها در یک تصویر، جزئیات ظریف شخصیتها حذف میشوند. این یافتهها ثابت میکند که مدلهای تبدیل متن به تصویر با محدودیت…

شرکت Hugging Face کتابخانه @huggingface/kernels را شامل ۲۰۷ کرنل بهینهشده برای WebGPU منتشر کرد تا سرعت اجرای مدلهای هوش مصنوعی در مرورگر را بهشدت افزایش دهد. این سیستم با…

تفکیک سختگیرانه دادههای آموزش، اعتبارسنجی و آزمون تنها راه تضمین تعمیمپذیری مدلهای هوش مصنوعی است. بدون این مرزها، «نشت داده» باعث ایجاد موفقیتهای کاذب در آزمایشگاه میشود که…

ابزار متنباز aimock با جایگزینی پاسخهای واقعی مدلهای زبانی با فایلهای JSON، هزینههای توکن و ناپایداری API را حذف میکند. این زیرساخت به توسعهدهندگان اجازه میدهد…

ساخت مجموعه دادههای ارزیابی باکیفیت برای عاملهای هوش مصنوعی نیازمند تحلیل شکستهای واقعی انسانی است، نه تولید انبوه دادههای مصنوعی. یک مجموعه کوچک و مورد توافق از ۲۰ نمونه،…

بازبینی بصری تصاویر تولیدشده توسط هوش مصنوعی برای نرمافزارهای تجاری کافی نیست. این راهنما یک خط لوله ماشینخوان را معرفی میکند که با استفاده از OCR و تأکیدات سختگیرانه، صحت متن…