پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

تست‌های SWE-bench سال‌ها قبل از رفع باگ‌ها عمومی بودند، اما این به معنای آلودگی داده نیست.

تحلیل فارنزیک: ۹۷.۸٪ داده‌های SWE-bench پیش‌تر عمومی شده بودند

یک تحلیل فارنزیک نشان می‌دهد تقریباً تمام فایل‌های آزمون در بنچمارک SWE-bench پیش از اعمال اصلاحات، به‌صورت عمومی در گیت‌هاب در دسترس بوده‌اند. این یعنی مدل‌های پیشرو احتمالاً…

۳ دقیقه خواندن۲
بررسی معیارهای ارزیابی مدل‌های زبانی بزرگ: واقعاً چه چیزی را می‌سنجند؟

BenchMIRT: نمرات بنچمارک‌های هوش مصنوعی توانمندی‌های واقعی مدل‌ها را می‌پوشانند

پژوهشگران چارچوب BenchMIRT را برای تفکیک سیگنال‌های متناقض در ارزیابی‌های مدل‌های زبانی معرفی کردند. این ابزار نشان می‌دهد بسیاری از محک‌های «ایمنی» در واقع توان استدلال کلی را…

۷ دقیقه خواندن۱
یک تصویر مرجع، هشت اجرای برگه شخصیت، و چیزی که مدل ابداع کرد
آموزش کاربردی

درون معماری Tsubaki.3؛ چرا تصاویر مرجع در مقیاس بالا شکست می‌خورند

آزمون‌های مدل Tsubaki.3 نشان می‌دهد که با افزایش تعداد پنل‌ها در یک تصویر، جزئیات ظریف شخصیت‌ها حذف می‌شوند. این یافته‌ها ثابت می‌کند که مدل‌های تبدیل متن به تصویر با محدودیت…

۵ دقیقه خواندن۱
تقسیم داده به سه بخش: آموزش، اعتبارسنجی و آزمون - راهنمای مبتدیان
آموزش کاربردی

نشت داده در ارزیابی AI: وقتی مدل‌ها به‌جای یادگیری، پاسخ‌ها را حفظ می‌کنند

تفکیک سخت‌گیرانه داده‌های آموزش، اعتبارسنجی و آزمون تنها راه تضمین تعمیم‌پذیری مدل‌های هوش مصنوعی است. بدون این مرزها، «نشت داده» باعث ایجاد موفقیت‌های کاذب در آزمایشگاه می‌شود که…

۱۲ دقیقه خواندن
ساخت اولین مجموعه ارزیابی برای یک عامل هوشمند: راهنمای عملی
آموزش کاربردی

۲۰ گفتگوی واقعی مؤثرتر از ۲۰۰۰ ارزیابی مصنوعی برای عامل‌های هوش مصنوعی

ساخت مجموعه‌ داده‌های ارزیابی باکیفیت برای عامل‌های هوش مصنوعی نیازمند تحلیل شکست‌های واقعی انسانی است، نه تولید انبوه داده‌های مصنوعی. یک مجموعه کوچک و مورد توافق از ۲۰ نمونه،…

۳ دقیقه خواندن۱
اعتبارسنجی متن منوی تولیدشده با هوش مصنوعی با OCR و بررسی دقیق
آموزش کاربردی

تأکیدات سخت‌گیرانه در برابر بازبینی انسانی برای 검증 متون ماشین‌خوان

بازبینی بصری تصاویر تولیدشده توسط هوش مصنوعی برای نرم‌افزارهای تجاری کافی نیست. این راهنما یک خط لوله ماشین‌خوان را معرفی می‌کند که با استفاده از OCR و تأکیدات سخت‌گیرانه، صحت متن…

۴ دقیقه خواندن۲
تنظیمات یکسان دما، top_p و top_k در دو چارچوب اصلی معانی متفاوتی دارند
آموزش کاربردی

تفاوت در ترتیب اجرای پارامترها؛ دلیل شکست تنظیمات هوش مصنوعی در انتقال بین

تنظیمات رایج مانند Temperature و Top-p در پشته‌های نرم‌افزاری مختلف به دلیل تفاوت در ترتیب اجرا، نتایج متفاوتی تولید می‌کنند. این موضوع باعث ایجاد «شکست خاموش» می‌شود که در آن…

۲ دقیقه خواندن
متن کتاب درسی می‌گوید نمره‌گذاری دودویی. من چهار درجه‌ای نمره می‌دهم. آیا همیشه اشتباه می‌کردم؟
آموزش کاربردی

نام‌گذاری خطاهای هوش مصنوعی جایگزین امتیازات عددی در ارزیابی مدل‌ها شد

جایگزینی مقیاس‌های عددی با برچسب‌های توصیفی مانند «فاجعه‌بار» یا «بی‌ضرر»، امکان شناسایی دقیق نقاط شکست مدل‌های زبانی را فراهم می‌کند. این رویکرد به توسعه‌دهندگان اجازه می‌دهد…

۴ دقیقه خواندن