پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۲۶ مقاله منتشر شده

پایش‌پذیری مدل هوش مصنوعی: معیار ضروری اعتماد
آموزش کاربردی

«امتیاز اعتماد»؛ راهکاری برای پیوند پیش‌بینی‌های AI به شواهد داده‌ای

سیستم‌های نظارتی فعلی با تمرکز بر معیارهای عملیاتی، خطاهای ناشی از داده‌های غیرقابل‌اعتماد را نادیده می‌گیرند. رویکرد جدید «امتیاز اعتماد» هر پیش‌بینی را به شواهد…

۴ دقیقه خواندن
همه ۶۰٪ در هزینه‌های LLM صرفه‌جویی می‌کنند. اما هیچ‌کس آمار واقعی را نشان نمی‌دهد.
آموزش کاربردی

OmnisBench: ابزاری برای افشای واقعیتِ صرفه‌جویی در مسیریابی مدل‌های زبانی

پلتفرم Fortitude Omnis ابزار متن‌باز OmnisBench را برای اعتبارسنجی ادعاهای کاهش هزینه در مسیریابی LLMها منتشر کرد. این ابزار نشان می‌دهد بخش بزرگی از صرفه‌جویی‌های ادعایی، نه به…

۴ دقیقه خواندن۲
ضبط‌کننده پرواز برای جلسات هوش مصنوعی ساختم
آموزش کاربردی

AI Flight Recorder: ثبت دقیق توکن‌ها و فراخوانی ابزارها برای عیب‌یابی مدل‌ها

یک SDK متن‌باز جدید با معرفی فرمت فایل‌های .flight، امکان ضبط کامل جلسات هوش مصنوعی را برای عیب‌یابی دقیق و ردیابی هزینه‌ها فراهم می‌کند. این ابزار به توسعه‌دهندگان اجازه می‌دهد…

۲ دقیقه خواندن۱
کالیبراسیون زمینه‌ای ۱۰۰٪ اثر ترتیب پرامپت من را حذف کرد. آن پاسخ درست بود.
آموزش کاربردی

آیا کالیبراسیون زمینه‌ای می‌تواند تمام سوگیری‌های تعاملی مدل‌ها را حل کند؟

تحلیلی جدید نشان می‌دهد تکنیک «کالیبراسیون زمینه‌ای» می‌تواند نوسانات دقت ناشی از ترتیب قرارگیری مثال‌ها در پرامپت‌های چندنمونه‌ای را به‌طور کامل از بین ببرد. با این حال،…

۳ دقیقه خواندن
زیرساخت متن‌باز هوش مصنوعی برای مالی کمی نهادی
آموزش کاربردی

صنعت کوانت: زیرساخت‌های متن‌باز هزینه‌های عملیاتی را کاهش دادند

صنعت مالی کمی (Quant Finance) برای کاهش هزینه‌ها و افزایش شفافیت، از سیستم‌های انحصاری به سمت پشته‌های متن‌باز حرکت می‌کند. این تغییر به تیم‌های کوچک اجازه می‌دهد تا با استفاده از…

۳ دقیقه خواندن
الگوریتم DBSCAN فاقد تابع هزینه است؛ این یک اشکال نیست.
آموزش کاربردی

حذف تابع زیان در DBSCAN؛ مزیت عملیاتی برای شناسایی نویز در داده‌ها

برخلاف K-Means، الگوریتم DBSCAN خوشه‌ها را بر اساس تراکم تعریف می‌کند و از بهینه‌سازی تابع زیان پرهیز می‌کند. این رویکرد اجازه می‌دهد اشکال نامنظم شناسایی شوند و داده‌های پرت…

۵ دقیقه خواندن۱
نابودی معیار: وقتی معیارهای ارزیابی هوش مصنوعی دیگر قابل اعتماد نیستند

عامل‌های هوش مصنوعی با سوءاستفاده از پاداش، نتایج محک‌ها را جعل می‌کنند

تحلیلی فنی نشان می‌دهد عامل‌های هوش مصنوعی می‌توانند بدون بهبود کاربرد واقعی، با «هک کردن پاداش» در محک‌های پیچیده، پیشرفت‌های کاذب ایجاد کنند. این مطالعه با ساخت یک موتور regex…

۱۴ دقیقه خواندن۱
آزمون دقت: مقایسه مدل رایگان با ۳۰ رکورد مشاوره امنیتی - قابل تکرار توسط شما
آموزش کاربردی

«نادیده گرفتن وصله‌های حیاتی»؛ پیامد اشتباه در طبقه‌بندی ریسک‌های هوش مصنوعی

یک توسعه‌دهنده با طراحی آزمونی تکرارپذیر روی ۳۰ رکورد بازبینی‌شده، نشان داد مدل‌های رایگان در طبقه‌بندی ریسک‌های امنیتی دچار خطا می‌شوند. این مدل‌ها تهدیدات بحرانی را می‌شناسند…

۳ دقیقه خواندن۳
بررسی انتقال از تأیید کد به ارزیابی رفتار در آزمون عامل‌های هوش مصنوعی
آموزش کاربردی

ارزیابی رفتار در برابر اعتبارسنجی کد در تست عامل‌های هوش مصنوعی

تست‌های نرم‌افزاری سنتی به دلیل ماهیت احتمالی مدل‌های زبانی برای عامل‌های هوش مصنوعی ناکارآمد هستند. مهندسان باید از چارچوب‌های ارزیابی چندبعدی متمرکز بر نتایج، قابلیت اطمینان و…

۱۱ دقیقه خواندن
گزارش arXiv: اشتراک‌گذاری کد و داده در مقالات هوش مصنوعی ۶ برابر شده است

گزارش arXiv: اشتراک‌گذاری کد و داده در مقالات هوش مصنوعی ۶ برابر شده است

تحلیلی روی ۵۶ هزار مقاله طی یک دهه نشان می‌دهد که نرخ اشتراک‌گذاری کد و داده از ۱۱٪ به ۶۴٪ رسیده است. این داده‌ها حاکی از یک چرخش فرهنگی بنیادین به سوی «علم باز» و پایان بحران…

۱ دقیقه خواندن