پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۲۶ مقاله منتشر شده

ارزیابی تطبیقی سیستم‌های عامل‌گرای مرزی: معیارها، چالش‌ها و راهبردهای بهینه‌سازی عملکرد

نرخ موفقیت در برابر هزینه؛ چالش استقرار عامل‌های مهندسی نرم‌افزار

تحلیل جدید FrontierHarness نشان می‌دهد هزینهٔ عملیاتی عامل‌های مهندسی نرم‌افزار با نرخ موفقیت آن‌ها فاصله گرفته است. در حالی که برخی مدل‌ها تسک‌های بیشتری را پاس می‌کنند، هزینهٔ…

۱ دقیقه خواندن
متخصصان هشدار می‌دهند: بهینه‌سازی فرآیند، تخلخل را درمان نمی‌کند
آموزش کاربردی

بهینه‌سازی مبتنی بر هوش مصنوعی تخلخل چاپ فلزی را ۳۰٪ کاهش داد

یک روال بهینه‌سازی جدید با استفاده از هوش مصنوعی، نقص‌های تخلخل در تولید افزایشی فلزات را ۳۰٪ کاهش داده است. این سیستم کالیبراسیون دستی را با عملیاتی تک‌کلیکی بر اساس داده‌های…

۱ دقیقه خواندن۱
چرا پنجره‌های بزرگ‌تر زمینه، سیستم‌های حافظه را از بین نمی‌برند

«ضرورت حافظه مجزا»؛ چرا افزایش توکن‌ها برای مدل‌های قابل‌اعتماد کافی نیست

افزایش پنجرهٔ زمینه به میلیون‌ها توکن، مشکل بازیابی اطلاعات و وضعیت بلندمدت را حل نمی‌کند. پژوهش‌ها نشان می‌دهند مدل‌ها همچنان دچار سوگیری «گم‌شدن در میانه» و هزینه‌های عملیاتی…

۴ دقیقه خواندن۲
تست‌های SWE-bench سال‌ها قبل از رفع باگ‌ها عمومی بودند، اما این به معنای آلودگی داده نیست.

تحلیل فارنزیک: ۹۷.۸٪ داده‌های SWE-bench پیش‌تر عمومی شده بودند

یک تحلیل فارنزیک نشان می‌دهد تقریباً تمام فایل‌های آزمون در بنچمارک SWE-bench پیش از اعمال اصلاحات، به‌صورت عمومی در گیت‌هاب در دسترس بوده‌اند. این یعنی مدل‌های پیشرو احتمالاً…

۳ دقیقه خواندن۲
بررسی معیارهای ارزیابی مدل‌های زبانی بزرگ: واقعاً چه چیزی را می‌سنجند؟

BenchMIRT: نمرات بنچمارک‌های هوش مصنوعی توانمندی‌های واقعی مدل‌ها را می‌پوشانند

پژوهشگران چارچوب BenchMIRT را برای تفکیک سیگنال‌های متناقض در ارزیابی‌های مدل‌های زبانی معرفی کردند. این ابزار نشان می‌دهد بسیاری از محک‌های «ایمنی» در واقع توان استدلال کلی را…

۷ دقیقه خواندن۱
یک تصویر مرجع، هشت اجرای برگه شخصیت، و چیزی که مدل ابداع کرد
آموزش کاربردی

درون معماری Tsubaki.3؛ چرا تصاویر مرجع در مقیاس بالا شکست می‌خورند

آزمون‌های مدل Tsubaki.3 نشان می‌دهد که با افزایش تعداد پنل‌ها در یک تصویر، جزئیات ظریف شخصیت‌ها حذف می‌شوند. این یافته‌ها ثابت می‌کند که مدل‌های تبدیل متن به تصویر با محدودیت…

۵ دقیقه خواندن۱
تقسیم داده به سه بخش: آموزش، اعتبارسنجی و آزمون - راهنمای مبتدیان
آموزش کاربردی

نشت داده در ارزیابی AI: وقتی مدل‌ها به‌جای یادگیری، پاسخ‌ها را حفظ می‌کنند

تفکیک سخت‌گیرانه داده‌های آموزش، اعتبارسنجی و آزمون تنها راه تضمین تعمیم‌پذیری مدل‌های هوش مصنوعی است. بدون این مرزها، «نشت داده» باعث ایجاد موفقیت‌های کاذب در آزمایشگاه می‌شود که…

۱۲ دقیقه خواندن
ساخت اولین مجموعه ارزیابی برای یک عامل هوشمند: راهنمای عملی
آموزش کاربردی

۲۰ گفتگوی واقعی مؤثرتر از ۲۰۰۰ ارزیابی مصنوعی برای عامل‌های هوش مصنوعی

ساخت مجموعه‌ داده‌های ارزیابی باکیفیت برای عامل‌های هوش مصنوعی نیازمند تحلیل شکست‌های واقعی انسانی است، نه تولید انبوه داده‌های مصنوعی. یک مجموعه کوچک و مورد توافق از ۲۰ نمونه،…

۳ دقیقه خواندن۱
اعتبارسنجی متن منوی تولیدشده با هوش مصنوعی با OCR و بررسی دقیق
آموزش کاربردی

تأکیدات سخت‌گیرانه در برابر بازبینی انسانی برای 검증 متون ماشین‌خوان

بازبینی بصری تصاویر تولیدشده توسط هوش مصنوعی برای نرم‌افزارهای تجاری کافی نیست. این راهنما یک خط لوله ماشین‌خوان را معرفی می‌کند که با استفاده از OCR و تأکیدات سخت‌گیرانه، صحت متن…

۴ دقیقه خواندن۲