پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

پاسخ زنده، آزمایش ثابت‌شده نیست: راهنمای پرسش‌های رایج برای افشای باورهای نادرست
آموزش کاربردی

یک پاسخ موفق هوش مصنوعی دلیل کافی برای تأیید یکپارچگی سیستم نیست

بسیاری از توسعه‌دهندگان یک پاسخ صحیح از مدل را به اشتباه به‌عنوان تأیید نهایی گردش‌کار می‌پذیرند. یک آزمون معتبر نیازمند ثبت هش پرامپت، لاگ دستورات و مستندسازی متغیرهای سخت‌افزاری…

۹ دقیقه خواندن
رد یک‌سوم وصله‌هایی که سایر تست‌ها قبول می‌کنند توسط SWE-Serve

«خوش‌بینی بیش از حد»؛ ارزیابی‌های فعلی از توان کدنویسی عامل‌های AI

محک جدید SWE-Serve نشان می‌دهد ۳۳٪ از کدهایی که در آزمون‌های استاندارد پذیرفته شده‌اند، هنگام استقرار در محیط واقعی با خطا مواجه می‌شوند. این یافته نشان می‌دهد ارزیابی‌های فعلی از…

۱ دقیقه خواندن
سپر سری: Regex ۰٪، Prompt Guard ۲ فقط ۱٪ از ۶۲۹ حمله پنهان‌شده در خروجی ابزار را شناسایی کرد.

مدل Prompt Guard 2 متا تنها ۱٪ از حملات تزریق پرامپت را شناسایی می‌کند

محک جدید AgentDojo نشان می‌دهد تشخیص‌دهنده‌های متن‌باز در برابر حملات تزریق پرامپت که در خروجی ابزارها پنهان شده‌اند، تقریباً ناتوان‌اند. مدل Prompt Guard 2 متا و فیلترهای مبتنی…

۷ دقیقه خواندن۲
ارزیابی را خارج از جعبه فرستادم. نرخ قبولی شروع به اندازه‌گیری سیم کرد.
آموزش کاربردی

تفکیک خطای شبکه از خطای مدل؛ راهکاری برای توقف اصلاحات اشتباه در عامل‌های AI

بسیاری از بنچمارک‌های عامل‌های هوش مصنوعی، خطاهای شبکه و تایم‌اوت‌ها را به اشتباه به‌عنوان شکست مدل ثبت می‌کنند. یک متدولوژی جدید با جداسازی «لایه انتقال» از «لایه استدلال»، دقت…

۹ دقیقه خواندن
جیو نمی‌تواند کالیبره شود

شکاف کالیبراسیون در مدل Jev؛ چرا امتیازات اطمینان در محیط عملیاتی شکست می‌خورند؟

تحلیل‌های فنی نشان می‌دهد مدل Jev شرکت TypeSafe نمی‌تواند احتمالات کالیبره‌شده را در توزیع‌های مختلف داده‌های کاربر حفظ کند. مهندسان باید امتیازات این مدل را به‌جای احتمال مطلق،…

۳ دقیقه خواندن
نوار ابزار ویندوز با دکمه‌های میکروفون و کیبورد، نشان‌دهنده فعال‌سازی صوتی Codex

تطابق شناسه‌ی مدل با خروجی ثابت نیست؛ شکافی خطرناک در حاکمیت هوش مصنوعی

یک توسعه‌دهنده کشف کرد که تثبیت شناسه‌ی مدل (Model ID) مانع از تغییر رفتار مدل در سمت سرور نمی‌شود. این یافته نشان می‌دهد که تأیید هویت مدل با تأیید صحت خروجی متفاوت است و…

۵ دقیقه خواندن
اجرای یک وظیفه Codex به مدت ۳۱ ساعت: بازماندن از راه‌اندازی مجدد و ساخت خط تولید کتاب درسی قابل‌حسابرسی
آموزش کاربردی

تولید بسته آموزشی ریاضی با Codex در یک اجرای ۳۱ ساعته و قابل‌حسابرسی

یک توسعه‌دهنده با استفاده از یک تسک بلندمدت در Codex، چارچوبی ریاضی را به یک بسته آموزشی نسخه‌بندی‌شده تبدیل کرد. این پروژه با جایگزینی حافظهٔ چت با آرتیفکت‌های نسخه‌بندی‌شده،…

۳ دقیقه خواندن۲
اشکال‌زدایی یک پرامپت نادرست در محیط تولید
آموزش کاربردی

۳ گام سیستماتیک برای رفع خطاهای پرامپت در محیط عملیاتی

انتقال مدل‌های هوش مصنوعی به محیط عملیاتی اغلب خطاهای پیش‌بینی‌نشده‌ای را آشکار می‌کند. این راهنما چارچوبی سیستماتیک برای بازتولید، مکان‌یابی و رفع خطاهای پرامپت با استفاده از…

۶ دقیقه خواندن
بررسی وزن‌دهی توالی در مقیاس بزرگ

پژوهش Jane Street: اثر وزن‌دهی داده‌ها در مقیاس‌های مختلف غیرخطی است

محققان Jane Street دریافتند که تأثیر وزن‌دهی داده‌ها بر یادگیری مدل‌ها با تغییر مقیاس، تغییر می‌کند. در حالی که مدل‌های متوسط به وزن‌ها حساس‌اند، مدل‌های بسیار کوچک و بسیار بزرگ،…

۸ دقیقه خواندن۱
لوگوی UK AISI و EvalEval در کنار هم، نماد همکاری برای قابل‌تکرار کردن نتایج ارزیابی مدل‌های هوش مصنوعی

درون استراتژی AISI برای راستی‌آزمایی مدل‌های هوش مصنوعی پیشرو

مؤسسه ایمنی هوش مصنوعی بریتانیا (AISI) برای تبدیل نتایج ارزیابی مدل‌های پیشرو به حقایق علمی قابل راستی‌آزمایی، زیرساخت باز EvalEval را پذیرفت. این اقدام داده‌های سطح تراکنش را…

۴ دقیقه خواندن
ارزیابی عکس فوری، نه تماس زنده
آموزش کاربردی

ثبت خروجی‌های مدل در قالب Snapshot راهکار مقابله با خطاهای نامشخص ارزیابی است

ارزیابی‌های سنتی هوش مصنوعی به‌دلیل تغییر هم‌زمان وزن‌های مدل، پرامپت‌ها و منطق داور شکست می‌خورند. ذخیره خروجی‌های خام در قالب Snapshotهای منجمد، امکان جداسازی دقیق عامل ایجاد…

۷ دقیقه خواندن۲