پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۲۷ مقاله منتشر شده

نمودار میله‌ای: صفر درصد مثبت کاذب. مخرج کسر هشت بود.
آموزش کاربردی

درون محاسبات آماری؛ علت خطای نرخ مثبت کاذب در تست‌های AI

ادعای «نرخ مثبت کاذب صفر درصد» اغلب نتیجهٔ تست روی تعداد بسیار کمی از داده‌هاست، نه دقت واقعی مدل. این مقاله بررسی می‌کند که چگونه مخرج کسر کوچک در محاسبات آماری، خطاهای سیستماتیک…

۳ دقیقه خواندن۱
امتیاز استخراج من ۰٫۰۸ بود و مدل بی‌گناه: بازسازی خط‌کش
آموزش کاربردی

درون CauterRule؛ تضاد میان تطابق توکنی و درک معنایی در ارزیابی AI

چارچوب متن‌باز CauterRule دریافت که معیارهای سخت‌گیرانهٔ تطابق توکنی، مدل‌های هوش مصنوعی را به‌دلیل بازنویسی درستِ قوانین جریمه می‌کنند. با تغییر رویکرد به تطابق معنایی، مشخص شد…

۸ دقیقه خواندن۴
شش بررسی قبل از اعتماد به عدد تولیدشده توسط سیستم خود
آموزش کاربردی

۶ گام برای شناسایی خطاهای «چاپلوس» در سامانه‌های ارزیابی هوش مصنوعی

یک توسعه‌دهنده ارشد فاش کرد که چگونه ۱۰ باگ پنهان در ابزار اندازه‌گیری، نتایج مدل‌های AI را به‌طور مصنوعی بهبود بخشیده بود. این گزارش یک چک‌لیست ۶ مرحله‌ای برای شناسایی شکست‌هایی…

۱۰ دقیقه خواندن
ساخت یک آزمایشگاه شاهد کوچک برای یادگیری ارزیابی مالکیت
آموزش کاربردی

جداسازی مدل نویسنده از سیستم ارزیابی؛ راهکاری برای جلوگیری از تقلب AI در کدنویسی

یک متد عملیاتی جدید با تفکیک مدل تولید کد از مکانیسم نمره‌دهی، مانع از حفظ کردن پاسخ‌ها توسط هوش مصنوعی می‌شود. با محلی نگه داشتن تست‌ها و پنهان کردن آن‌ها از پرامپت،…

۹ دقیقه خواندن۱
ابزارهای کمی مالی: مزیت ضروری متن‌باز
آموزش کاربردی

«دسترسی همگانی به بک‌تستینگ»؛ هدف جدید AI-QUANT در معاملات سیستماتیک

چارچوب‌های متن‌باز با ارائه ابزارهای حرفه‌ای مدیریت ریسک و بک‌تستینگ، دسترسی پژوهشگران مستقل به زیرساخت‌های مالی سیستماتیک را تسهیل کرده‌اند. این تغییر رویکرد، استراتژی‌های…

۳ دقیقه خواندن۲
مهندسی تمیز، اندازه‌گیری ناپایدار: شکست قابلیت اعتماد مشاهده‌گرهای جعبه‌سیاه LLM در نقاط پایانی مشترک

ناپایداری ۸ تا ۲۰ درصدی در محک‌های عامل‌های هوش مصنوعی

پژوهشی جدید نشان می‌دهد مدل‌های زبانی که به‌عنوان داور در ارزیابی عامل‌ها استفاده می‌شوند، حتی با ورودی‌های یکسان نتایج متناقضی می‌دهند. این ناپایداری که ناشی از به‌روزرسانی‌های…

۴ دقیقه خواندن۱
بررسی دیداری هوش مصنوعی نیازمند اجرای کنترلی است، وگرنه نویز را به‌جای حرکت گزارش می‌کنید
آموزش کاربردی

چرا تشخیص تغییرات واقعی در بازار تامین‌کنندگان LLM دشوار شده است؟

پژوهشی از Thicket AI نشان می‌دهد لیست تامین‌کنندگانی که مدل‌های زبانی پیشنهاد می‌دهند به‌شدت ناپایدار است. این نوسانات کوتاه‌مدت به‌قدری زیاد است که تشخیص تغییرات واقعی بازار از…

۹ دقیقه خواندن۱
درخواست بنچمارک هوش مصنوعی بازی از ChatGPT و Grok و اجرای کدها
آموزش کاربردی

تفاوت ChatGPT و Grok در بنچمارک؛ یکی ابزار ساخت و دیگری داده‌های جعلی

یک توسعه‌دهنده در آزمونی برای مقایسه الگوریتم‌های کلاسیک با مدل‌های زبانی، متوجه تفاوت بنیادین در صداقت دو مدل شد. در حالی که ChatGPT ابزاری کاربردی و صادق ارائه داد، Grok کدی…

۳ دقیقه خواندن۳
توسعه ابزار هوشمند توسط LLMها: فقط ۳۴ تغییر از ۶۴ مورد در HarnessDev بایت‌دانس قابل تعمیم است

«شکست در تعمیم»؛ نقطه ضعف عامل‌های هوش مصنوعی در محیط‌های جدید

پژوهشگران با معرفی چارچوب HarnessDev نشان دادند که مدل‌های زبانی بزرگ در طراحی محیط‌های اجرایی برای خود موفق‌اند، اما اکثر این بهبودها در مواجهه با وظایف جدید شکست می‌خورند. این…

۴ دقیقه خواندن۱
مقایسه بهترین دروازه‌های هوش مصنوعی ۲۰۲۶: بررسی تمام رتبه‌بندی‌های صفحه اول
آموزش کاربردی

۷۸٪ رتبه‌بندی‌های درگاه‌های هوش مصنوعی ابزاری برای بازاریابی هستند، نه محک

بررسی ۱۴ فهرست برتر درگاه‌های هوش مصنوعی نشان می‌دهد اکثر آن‌ها توسط خودِ فروشندگان نوشته شده و محصولشان را در رتبه اول قرار داده‌اند. این تضاد منافع، شکاف عمیق میان خدمات ابری و…

۱۱ دقیقه خواندن۱