پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

کالیبراسیون سطح نویز در چارچوب ارزیابی مدل زبانی
آموزش کاربردی

مطالعه A/A: راهکار جدید برای تفکیک نویز نمونه‌گیری از بهبود واقعی مدل‌ها

بسیاری از تیم‌های هوش مصنوعی تغییرات تصادفی در خروجی مدل‌ها را با پیشرفت فنی اشتباه می‌گیرند. یک چارچوب کالیبراسیون جدید با استفاده از مطالعات A/A و پروب‌های ارزیاب، «کف نویز» را…

۷ دقیقه خواندن۲
اثری که نمی‌توانی بازپخش کنی، تنها یک گزارش است
آموزش کاربردی

تبدیل لاگ‌های گران‌قیمت عامل‌های هوش مصنوعی به تست‌های رایگان

یک متدولوژی جدید برای عیب‌یابی عامل‌های هوش مصنوعی، اجرای مجدد و هزینه‌بر مدل‌ها را با ضبط «کاست‌های» تصمیمات جایگزین می‌کند. توسعه‌دهندگان اکنون می‌توانند بدون صرف توکن، دقیقاً…

۷ دقیقه خواندن
سیمون ادواردز، مدیرعامل و بنیان‌گذار SE Labs – مصاحبه اختصاصی

برچسب «هوش مصنوعی» در امنیت سایبری؛ ابزار بازاریابی یا پیشرفت فنی؟

سایمون ادواردز، متخصص امنیت سایبری، هشدار می‌دهد که بسیاری از ادعاهای «AI-driven» صرفاً ترفندهای بازاریابی هستند. او خواستار تغییر رویکرد از بررسی ویژگی‌ها به سمت تست کامل زنجیره…

۱۲ دقیقه خواندن
«متا میوز» را تا زمانی که لایه کنترل عاملش در وضعیت تایم‌اوت قرار گرفت، تحت آزمایش فشار قرار دادم.

تست استرس Meta Muse: نرخ شکست ۷۲.۵ درصدی در مقیاس ۱۲۰ عامل

یک تست استرس روی عامل هوش مصنوعی Muse متعلق به متا نشان داد که این سیستم در مواجهه با تعداد زیاد عامل‌های هم‌زمان فرو می‌پاشد. علت این شکست نه محدودیت‌های مدل زبانی، بلکه خطاهای…

۱۸ دقیقه خواندن۲
نمودار میله‌ای: صفر درصد مثبت کاذب. مخرج کسر هشت بود.
آموزش کاربردی

درون محاسبات آماری؛ علت خطای نرخ مثبت کاذب در تست‌های AI

ادعای «نرخ مثبت کاذب صفر درصد» اغلب نتیجهٔ تست روی تعداد بسیار کمی از داده‌هاست، نه دقت واقعی مدل. این مقاله بررسی می‌کند که چگونه مخرج کسر کوچک در محاسبات آماری، خطاهای سیستماتیک…

۳ دقیقه خواندن۱
امتیاز استخراج من ۰٫۰۸ بود و مدل بی‌گناه: بازسازی خط‌کش
آموزش کاربردی

درون CauterRule؛ تضاد میان تطابق توکنی و درک معنایی در ارزیابی AI

چارچوب متن‌باز CauterRule دریافت که معیارهای سخت‌گیرانهٔ تطابق توکنی، مدل‌های هوش مصنوعی را به‌دلیل بازنویسی درستِ قوانین جریمه می‌کنند. با تغییر رویکرد به تطابق معنایی، مشخص شد…

۸ دقیقه خواندن۴
شش بررسی قبل از اعتماد به عدد تولیدشده توسط سیستم خود
آموزش کاربردی

۶ گام برای شناسایی خطاهای «چاپلوس» در سامانه‌های ارزیابی هوش مصنوعی

یک توسعه‌دهنده ارشد فاش کرد که چگونه ۱۰ باگ پنهان در ابزار اندازه‌گیری، نتایج مدل‌های AI را به‌طور مصنوعی بهبود بخشیده بود. این گزارش یک چک‌لیست ۶ مرحله‌ای برای شناسایی شکست‌هایی…

۱۰ دقیقه خواندن
ساخت یک آزمایشگاه شاهد کوچک برای یادگیری ارزیابی مالکیت
آموزش کاربردی

جداسازی مدل نویسنده از سیستم ارزیابی؛ راهکاری برای جلوگیری از تقلب AI در کدنویسی

یک متد عملیاتی جدید با تفکیک مدل تولید کد از مکانیسم نمره‌دهی، مانع از حفظ کردن پاسخ‌ها توسط هوش مصنوعی می‌شود. با محلی نگه داشتن تست‌ها و پنهان کردن آن‌ها از پرامپت،…

۹ دقیقه خواندن۱
ابزارهای کمی مالی: مزیت ضروری متن‌باز
آموزش کاربردی

«دسترسی همگانی به بک‌تستینگ»؛ هدف جدید AI-QUANT در معاملات سیستماتیک

چارچوب‌های متن‌باز با ارائه ابزارهای حرفه‌ای مدیریت ریسک و بک‌تستینگ، دسترسی پژوهشگران مستقل به زیرساخت‌های مالی سیستماتیک را تسهیل کرده‌اند. این تغییر رویکرد، استراتژی‌های…

۳ دقیقه خواندن۲