پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۲۶ مقاله منتشر شده

یادگیری از برچسب‌های محدود در هوش مصنوعی صنعتی: جایی که بازخورد خبره اهمیت دارد
آموزش کاربردی

بهینه‌سازی زمان خبرگان؛ راهکار جدید برای حل بحران برچسب‌گذاری در AI صنعتی

سیستم‌های هوش مصنوعی صنعتی با پارادوکس «داده‌های انبوه اما برچسب‌های اندک» برای خطاهای نادر دست‌وپنجه نرم می‌کنند. چارچوب جدیدی با اولویت‌بندی زمان خبرگان از طریق یادگیری فعال،…

۵ دقیقه خواندن۲
نمایه مرتبط با تشخیص، واژه‌نامه‌ای کاربردی است.
آموزش کاربردی

شکاف زبانی در مستندات AI؛ چرا کاربران نمی‌توانند راهکارهای فنی را پیدا کنند؟

یک تست کور روی کاتالوگ خطاهای هوش مصنوعی نشان داد که استفاده از زبان «تشخیصی» به‌جای زبان «شکایت»، دسترسی کاربران به پاسخ‌ها را مختل می‌کند. راهکار این مشکل، ایجاد یک لایه واسط…

۶ دقیقه خواندن۱
پاکت‌های جلسه تعیین می‌کنند آیا عامل دلتا ارسال می‌شود یا خیر
آموزش کاربردی

«پایان شانس در بنچ‌مارک»؛ متدولوژی جدید برای سنجش واقعی کیفیت مدل

یک چارچوب ارزیابی جدید، نوسانات سرور مانند تأخیر در صف‌ها را به‌جای یادداشت‌های حاشیه‌ای، به عنوان عوامل رد صلاحیت در نظر می‌گیرد. با استفاده از «پوشه‌های نشست»، مهندسان می‌توانند…

۷ دقیقه خواندن۲
پاسخ زنده، آزمایش ثابت‌شده نیست: راهنمای پرسش‌های رایج برای افشای باورهای نادرست
آموزش کاربردی

یک پاسخ موفق هوش مصنوعی دلیل کافی برای تأیید یکپارچگی سیستم نیست

بسیاری از توسعه‌دهندگان یک پاسخ صحیح از مدل را به اشتباه به‌عنوان تأیید نهایی گردش‌کار می‌پذیرند. یک آزمون معتبر نیازمند ثبت هش پرامپت، لاگ دستورات و مستندسازی متغیرهای سخت‌افزاری…

۹ دقیقه خواندن
رد یک‌سوم وصله‌هایی که سایر تست‌ها قبول می‌کنند توسط SWE-Serve

«خوش‌بینی بیش از حد»؛ ارزیابی‌های فعلی از توان کدنویسی عامل‌های AI

محک جدید SWE-Serve نشان می‌دهد ۳۳٪ از کدهایی که در آزمون‌های استاندارد پذیرفته شده‌اند، هنگام استقرار در محیط واقعی با خطا مواجه می‌شوند. این یافته نشان می‌دهد ارزیابی‌های فعلی از…

۱ دقیقه خواندن
سپر سری: Regex ۰٪، Prompt Guard ۲ فقط ۱٪ از ۶۲۹ حمله پنهان‌شده در خروجی ابزار را شناسایی کرد.

مدل Prompt Guard 2 متا تنها ۱٪ از حملات تزریق پرامپت را شناسایی می‌کند

محک جدید AgentDojo نشان می‌دهد تشخیص‌دهنده‌های متن‌باز در برابر حملات تزریق پرامپت که در خروجی ابزارها پنهان شده‌اند، تقریباً ناتوان‌اند. مدل Prompt Guard 2 متا و فیلترهای مبتنی…

۷ دقیقه خواندن۲
ارزیابی را خارج از جعبه فرستادم. نرخ قبولی شروع به اندازه‌گیری سیم کرد.
آموزش کاربردی

تفکیک خطای شبکه از خطای مدل؛ راهکاری برای توقف اصلاحات اشتباه در عامل‌های AI

بسیاری از بنچمارک‌های عامل‌های هوش مصنوعی، خطاهای شبکه و تایم‌اوت‌ها را به اشتباه به‌عنوان شکست مدل ثبت می‌کنند. یک متدولوژی جدید با جداسازی «لایه انتقال» از «لایه استدلال»، دقت…

۹ دقیقه خواندن
جیو نمی‌تواند کالیبره شود

شکاف کالیبراسیون در مدل Jev؛ چرا امتیازات اطمینان در محیط عملیاتی شکست می‌خورند؟

تحلیل‌های فنی نشان می‌دهد مدل Jev شرکت TypeSafe نمی‌تواند احتمالات کالیبره‌شده را در توزیع‌های مختلف داده‌های کاربر حفظ کند. مهندسان باید امتیازات این مدل را به‌جای احتمال مطلق،…

۳ دقیقه خواندن
نوار ابزار ویندوز با دکمه‌های میکروفون و کیبورد، نشان‌دهنده فعال‌سازی صوتی Codex

تطابق شناسه‌ی مدل با خروجی ثابت نیست؛ شکافی خطرناک در حاکمیت هوش مصنوعی

یک توسعه‌دهنده کشف کرد که تثبیت شناسه‌ی مدل (Model ID) مانع از تغییر رفتار مدل در سمت سرور نمی‌شود. این یافته نشان می‌دهد که تأیید هویت مدل با تأیید صحت خروجی متفاوت است و…

۵ دقیقه خواندن
اجرای یک وظیفه Codex به مدت ۳۱ ساعت: بازماندن از راه‌اندازی مجدد و ساخت خط تولید کتاب درسی قابل‌حسابرسی
آموزش کاربردی

تولید بسته آموزشی ریاضی با Codex در یک اجرای ۳۱ ساعته و قابل‌حسابرسی

یک توسعه‌دهنده با استفاده از یک تسک بلندمدت در Codex، چارچوبی ریاضی را به یک بسته آموزشی نسخه‌بندی‌شده تبدیل کرد. این پروژه با جایگزینی حافظهٔ چت با آرتیفکت‌های نسخه‌بندی‌شده،…

۳ دقیقه خواندن۲