پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۷۸۸ مقاله منتشر شده

ارزیابی عامل هوش مصنوعی: چگونه سیستم‌هایی با رفتار غیرقطعی را آزمایش کنیم
آموزش کاربردی

چرا تست‌های نرم‌افزاری سنتی برای ارزیابی عامل‌های هوش مصنوعی شکست می‌خورند؟

ارزیابی عامل‌های هوش مصنوعی نیازمند گذار از بررسی خروجی‌های ساده به استراتژی‌های لایه‌ای شامل تحلیل مسیر اجرا و شبیه‌سازی‌های چندمرحله‌ای است. به دلیل ماهیت غیرقطعی این سیستم‌ها،…

۲۰ دقیقه خواندن۳
ارزیابی RAG شما رسید را چک می‌کند، نه بیمار را

«مبنی‌سازی فریبنده»؛ حفره‌ای امنیتی در ارزیابی‌های سیستم‌های RAG

تحقیقات جدید نشان می‌دهد مدل‌های AI می‌توانند با ارجاع درست به منابع واقعی اما برای موجودیت‌های اشتباه، سیستم‌های ارزیابی را دور بزنند. این نقص که «مبنی‌سازی فریبنده» نام دارد، در…

۴ دقیقه خواندن
کنترل ایده‌ها، نه کدها
زندگی با AI

خالق Redis: مهندسان باید کنترل ایده‌ها را جایگزین بررسی خط‌به‌خط کد کنند

سلواتوره سانفیلیپو (antirez) معتقد است در عصر مدل‌های زبانی پیشرفته، تمرکز بر بازبینی دستی هزاران خط کد اتلاف هوش انسانی است. او پیشنهاد می‌کند توسعه‌دهندگان نقش خود را از…

۶ دقیقه خواندن۲
یک جمله احساسی، هوش مصنوعی را برای تلاش بیشتر تحریک می‌کند.
آموزش کاربردی

جملات احساسی کیفیت پاسخ‌های مدل‌های زبانی را به‌طور محسوس افزایش می‌دهند

افزودن یک جمله با بار احساسی به پرامپت‌ها می‌تواند باعث تولید پاسخ‌های دقیق‌تر، مفصل‌تر و سازمان‌یافته‌تر شود. این تکنیک به‌جای تحریک احساسات مدل، از همبستگی‌های آماری موجود در…

۴ دقیقه خواندن