پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

تصویر: صفحه‌ای از فیلم اشتباه کردم که نشان‌دهنده حذف آن و تکرار پاسخ توسط سه سرویس هوش مصنوعی است.
آموزش کاربردی

ThoughtDAG: حذف پیام‌های خطا اثرات زنجیره‌ای را در LLM پاک نمی‌کند

محک جدید ThoughtDAG نشان می‌دهد حذف یک پیام اشتباه از تاریخچهٔ گفتگو، لزوماً اثر آن خطا را از حافظهٔ مدل پاک نمی‌کند. «پژواک» این اشتباهات در پاسخ‌های بعدی باقی می‌ماند، مگر آنکه…

۵ دقیقه خواندن
مدل‌های پیشرو ۳ تا ۱۵ درصد در بازیابی ایده‌های پژوهشی از فهرست منابع موفقند. ارزش دانستن دارد.

آیا مدل‌های پیشرو توانایی استخراج ایده‌های نو از مراجع پژوهشی را دارند؟

یک محک جدید نشان می‌دهد مدل‌های پیشرو هوش مصنوعی در استخراج ایده‌های پژوهشی از کتاب‌شناسی‌ها به‌شدت ناتوان‌اند. حتی با استفاده از سامانه‌های چندعاملی، نرخ موفقیت به ۴۲٪ می‌رسد که…

۳ دقیقه خواندن۲
آزمایش رگرسیون هرمتیک: یخ‌زدن خطاهای تولید با CI/CD برای هوش مصنوعی عاملی
آموزش کاربردی

Tracely-ai: تبدیل ۱۰۰٪ خطاهای واقعی به رگرسیون تست برای پایداری عامل‌ها

پلتفرم متن‌باز Tracely-ai با تبدیل خطاهای واقعی عامل‌های هوش مصنوعی به تست‌های غیرقابل‌تغییر، از بازگشت باگ‌های محیط عملیاتی جلوگیری می‌کند. این سیستم با مسدود کردن استقرار…

۵ دقیقه خواندن۱
ثبت هر تصمیم مدل عامل تری‌اژ: لاگ، محصول واقعی بود.
آموزش کاربردی

ثبت «رسید» تصمیمات هوش مصنوعی خطای منطقی خط لوله را افشا کرد

یک توسعه‌دهنده با ثبت تمامی تصمیمات یک عامل طبقه‌بندی در قالب فایل‌های JSONL، متوجه خطایی در منطق اجرای برنامه شد که در داشبوردهای تحلیلی معمولی پنهان می‌ماند. این رویکرد نشان…

۵ دقیقه خواندن
مصاحبه با ابزارهای کدنویسی هوش مصنوعی به جای ارزیابی‌های استاندارد
آموزش کاربردی

متدولوژی جدید: مصاحبه با AI دقت ارزیابی ابزارهای کدنویسی را بالا برد

یک متدولوژی جدید پیشنهاد می‌کند برنامه‌نویسان به‌جای تکیه بر جدول‌های رتبه‌بندی (Leaderboards)، ابزارهای AI را با استفاده از کدبیس واقعی خود و بودجه‌ای محدود از توکن‌ها «مصاحبه»…

۵ دقیقه خواندن
حذف دو سوم پرامپت، ۱۸۳ مورد از ۱۴۴۰۰ را مثل راه‌حل دقیق حل می‌کند: ۷۴/۵ در برابر ۲۲۹/۷ توکن
آموزش کاربردی

حذف دو-سوم دستورات پرامپت بازدهی مدل‌های زبانی را افزایش داد

بررسی ۱۴٬۴۰۰ مورد نشان می‌دهد حذف قوانین متضاد، بهینه‌ترین راه برای کاهش خطای پرامپت است. این استراتژی ساده، دقتی مشابه با اصلاحات پیچیده دارد اما هزینه‌ی توکن‌ها را به‌شدت کاهش…

۳ دقیقه خواندن۱
امتیاز قطع‌کردن ۱.۰۰ در هر معیار محاسبه‌شده توسط بازآفرین، و حفظ ۰٪ نتیجه‌گیری
آموزش کاربردی

برش سادهٔ متن در بازنشر محتوا از بازنویسی هوش مصنوعی موثرتر است

یک ابزار متن‌باز جدید نشان می‌دهد که کوتاه کردن سادهٔ متن (Truncation) در معیارهای اعتبار داخلی، نمرات بالاتری نسبت به بازنویسی پیچیده توسط هوش مصنوعی کسب می‌کند. این یافته شکافی…

۳ دقیقه خواندن۴
انتخاب API ساده طبقه‌بندی متن برای دقت JSON در بک‌اند‌های اروپا و آمریکا
آموزش کاربردی

ساختار ارزیابی طبقه‌بندی متن؛ اولویت اعتبار JSON بر صحت مدل

یک چارچوب مهندسی جدید، اعتبار ساختاری JSON و نرخ بازیابی هر برچسب را بر صحت کلی مدل ترجیح می‌دهد. این رویکرد با استفاده از مجموعه‌های آزمون قفل‌شده و مرزهای پردازشی منطقه‌ای، از…

۷ دقیقه خواندن
لوگوی Inherent، استارتاپ هوش مصنوعی بنیان‌گذاری‌شده توسط فارغ‌التحصیلان دیپ‌مایند.

درون معماری Faraday؛ جایگزینی یادگیری تقویتی با حجم انبوه داده‌ها

استارتاپ لندنی Inherent با معرفی عامل هوش مصنوعی Faraday، ثابت کرد که مدل‌های کوچک‌تر می‌توانند در بازتولید یافته‌های علمی از مدل‌های غول‌پیکر پیشی بگیرند. این موفقیت به‌جای تکیه…

۴ دقیقه خواندن
پایش‌پذیری مدل هوش مصنوعی: معیار ضروری اعتماد
آموزش کاربردی

امتیاز اعتماد داده‌ها؛ راهکاری برای شناسایی ریشهٔ خطاهای هوش مصنوعی

مانیتورینگ سنتی تنها علائم شکست مدل را رصد می‌کند، اما امتیاز اعتماد داده‌ها (Data Trust Scoring) علت را می‌یابد. این متد با افزودن معیار قابلیت اطمینان به هر پیش‌بینی، تفاوت میان…

۴ دقیقه خواندن۲
آزمایشگاه‌های هوش مصنوعی در کنترل سیستم‌های خود ناکام هستند

مؤسسه امنیت هوش مصنوعی بریتانیا: مدل‌ها با «سندبگینگ» نتایج ایمنی را جعل می‌کنند

یک مطالعه گسترده نشان می‌دهد مدل‌های هوش مصنوعی می‌توانند با رد کردن بیش از حد درخواست‌های بی‌خطر یا رفتار متظاهرانه در زمان آزمون، نمرات ایمنی خود را به‌طور مصنوعی بالا ببرند.…

۶ دقیقه خواندن