پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۲۶ مقاله منتشر شده

بسته شواهد تأیید عامل کدنویسی شامل چه مواردی است؟
آموزش کاربردی

آیا CodeVetter می‌تواند ابهام در گزارشات عامل‌های کدنویس را حذف کند؟

پلتفرم CodeVetter چارچوبی برای ایجاد «بسته‌های شواهد تأیید» معرفی کرد تا جایگزین خلاصه‌های مبهم هوش مصنوعی شود. این سیستم تضمین می‌کند هر تغییر کد توسط یک رکورد ماشین‌خوان از محیط…

۲ دقیقه خواندن
ددلاین را از دست دادم — بنابراین خودم بنچمارک را اجرا کردم تا برای بازگشایی آماده شوم
آموزش کاربردی

سیستم Muninn تأخیر بازیابی حافظه در عامل‌های AI را به ۳ ثانیه رساند

سیستم حافظه ترکیبی Muninn توانسته است بدون کاهش چشم‌گیر دقت، زمان پاسخ‌دهی عامل‌های هوش مصنوعی را از چندین دقیقه به زیر ۳ ثانیه کاهش دهد. توسعه‌دهنده این سیستم بر تضاد میان…

۵ دقیقه خواندن۳
عوامل کدنویسی وقتی به حقایق دسترسی ندارند، آنها را اختراع می‌کنند. هر ۴ آزمایش من نتیجه‌ی صفر نادرست داد.

عامل‌های کدنویس با جعل داده‌ها شکاف‌های اطلاعاتی را می‌پوشانند

پژوهشی جدید نشان می‌دهد عامل‌های هوش مصنوعی هنگام مواجهه با کمبود داده، به‌جای پذیرش نادانی، اطلاعاتی باورپذیر اما ساختگی تولید می‌کنند. این «بدهی انسجام» باعث می‌شود ابزارهای…

۹ دقیقه خواندن۳
تصویر: صفحه‌ای از فیلم اشتباه کردم که نشان‌دهنده حذف آن و تکرار پاسخ توسط سه سرویس هوش مصنوعی است.
آموزش کاربردی

ThoughtDAG: حذف پیام‌های خطا اثرات زنجیره‌ای را در LLM پاک نمی‌کند

محک جدید ThoughtDAG نشان می‌دهد حذف یک پیام اشتباه از تاریخچهٔ گفتگو، لزوماً اثر آن خطا را از حافظهٔ مدل پاک نمی‌کند. «پژواک» این اشتباهات در پاسخ‌های بعدی باقی می‌ماند، مگر آنکه…

۵ دقیقه خواندن
مدل‌های پیشرو ۳ تا ۱۵ درصد در بازیابی ایده‌های پژوهشی از فهرست منابع موفقند. ارزش دانستن دارد.

آیا مدل‌های پیشرو توانایی استخراج ایده‌های نو از مراجع پژوهشی را دارند؟

یک محک جدید نشان می‌دهد مدل‌های پیشرو هوش مصنوعی در استخراج ایده‌های پژوهشی از کتاب‌شناسی‌ها به‌شدت ناتوان‌اند. حتی با استفاده از سامانه‌های چندعاملی، نرخ موفقیت به ۴۲٪ می‌رسد که…

۳ دقیقه خواندن۲
آزمایش رگرسیون هرمتیک: یخ‌زدن خطاهای تولید با CI/CD برای هوش مصنوعی عاملی
آموزش کاربردی

Tracely-ai: تبدیل ۱۰۰٪ خطاهای واقعی به رگرسیون تست برای پایداری عامل‌ها

پلتفرم متن‌باز Tracely-ai با تبدیل خطاهای واقعی عامل‌های هوش مصنوعی به تست‌های غیرقابل‌تغییر، از بازگشت باگ‌های محیط عملیاتی جلوگیری می‌کند. این سیستم با مسدود کردن استقرار…

۵ دقیقه خواندن۱
ثبت هر تصمیم مدل عامل تری‌اژ: لاگ، محصول واقعی بود.
آموزش کاربردی

ثبت «رسید» تصمیمات هوش مصنوعی خطای منطقی خط لوله را افشا کرد

یک توسعه‌دهنده با ثبت تمامی تصمیمات یک عامل طبقه‌بندی در قالب فایل‌های JSONL، متوجه خطایی در منطق اجرای برنامه شد که در داشبوردهای تحلیلی معمولی پنهان می‌ماند. این رویکرد نشان…

۵ دقیقه خواندن
مصاحبه با ابزارهای کدنویسی هوش مصنوعی به جای ارزیابی‌های استاندارد
آموزش کاربردی

متدولوژی جدید: مصاحبه با AI دقت ارزیابی ابزارهای کدنویسی را بالا برد

یک متدولوژی جدید پیشنهاد می‌کند برنامه‌نویسان به‌جای تکیه بر جدول‌های رتبه‌بندی (Leaderboards)، ابزارهای AI را با استفاده از کدبیس واقعی خود و بودجه‌ای محدود از توکن‌ها «مصاحبه»…

۵ دقیقه خواندن
حذف دو سوم پرامپت، ۱۸۳ مورد از ۱۴۴۰۰ را مثل راه‌حل دقیق حل می‌کند: ۷۴/۵ در برابر ۲۲۹/۷ توکن
آموزش کاربردی

حذف دو-سوم دستورات پرامپت بازدهی مدل‌های زبانی را افزایش داد

بررسی ۱۴٬۴۰۰ مورد نشان می‌دهد حذف قوانین متضاد، بهینه‌ترین راه برای کاهش خطای پرامپت است. این استراتژی ساده، دقتی مشابه با اصلاحات پیچیده دارد اما هزینه‌ی توکن‌ها را به‌شدت کاهش…

۳ دقیقه خواندن۱
امتیاز قطع‌کردن ۱.۰۰ در هر معیار محاسبه‌شده توسط بازآفرین، و حفظ ۰٪ نتیجه‌گیری
آموزش کاربردی

برش سادهٔ متن در بازنشر محتوا از بازنویسی هوش مصنوعی موثرتر است

یک ابزار متن‌باز جدید نشان می‌دهد که کوتاه کردن سادهٔ متن (Truncation) در معیارهای اعتبار داخلی، نمرات بالاتری نسبت به بازنویسی پیچیده توسط هوش مصنوعی کسب می‌کند. این یافته شکافی…

۳ دقیقه خواندن۴