پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۸ مقاله منتشر شده

نگهداری گزینه‌های ردشده در سیاهه تصمیم عامل هوشمند
آموزش کاربردی

ثبت گزینه‌های ردشده؛ راهکاری برای بازگشت سریع عامل‌های AI به مسیر درست

یک پیشنهاد فنی جدید برای ثبت وقایع عامل‌های هوش مصنوعی، توصیه می‌کند به جای ثبت صرفِ مسیر طی‌شده، دلایل رد گزینه‌های جایگزین نیز ذخیره شوند. این رویکرد اجازه می‌دهد انسان‌ها مرز…

۳ دقیقه خواندن۱
شبیه‌ساز مورفیوس: بنچمارک یادگیری تقویتی پیوسته در محیط‌های سازمانی غیرایستا

بِنچمارک MORPHEUS: عامل‌های یادگیری تقویتی در محیط‌های پویا شکست می‌خورند

پلتفرم MORPHEUS نشان داد که الگوریتم‌های رایج یادگیری تقویتی هنگام مواجهه با تغییرات محیطی در سازمان‌ها، توانایی تطبیق ندارند. این نتایج شکاف عمیقی را در قابلیت‌های یادگیری مستمر…

۵ دقیقه خواندن
جاکارد: زبان برنامه‌نویسی کوچک برای دورانی که بیشتر کدها توسط مدل‌های یادگیری ماشین نوشته و توسط انسان‌ها بازبینی می‌شوند.
آموزش کاربردی

Jacquard در برابر زبان‌های سنتی؛ اولویتِ تائید ماشین بر نگارش انسان

زبان Jacquard برای آینده‌ای طراحی شده که در آن ماشین‌ها کد می‌زنند و انسان‌ها فقط بازبینی می‌کنند. این زبان با جایگزینی کامنت‌ها با محدودیت‌های سخت‌افزاری در سطح سینتکس، امنیت و…

۱۴ دقیقه خواندن
عامل هوش مصنوعی ChatGPT Work برای مدیریت کامل گردش کار معرفی شد
آموزش کاربردی

چگونه دستورات هدف‌محور جایگزین اسکریپت‌های گام‌به‌گام در OpenAI می‌شوند؟

شرکت OpenAI چارچوب جدیدی برای مهندسی پرامپت معرفی کرد که در آن تمرکز از دستورات پیچیده به درخواست‌های هدف‌محور تغییر یافته است. این راهنما تفاوت دقیقی میان وظایف سریع «چت» و…

۳ دقیقه خواندن
ارزیابی عامل هوش مصنوعی: چگونه سیستم‌هایی با رفتار غیرقطعی را آزمایش کنیم
آموزش کاربردی

چرا تست‌های نرم‌افزاری سنتی برای ارزیابی عامل‌های هوش مصنوعی شکست می‌خورند؟

ارزیابی عامل‌های هوش مصنوعی نیازمند گذار از بررسی خروجی‌های ساده به استراتژی‌های لایه‌ای شامل تحلیل مسیر اجرا و شبیه‌سازی‌های چندمرحله‌ای است. به دلیل ماهیت غیرقطعی این سیستم‌ها،…

۲۰ دقیقه خواندن۲
ارزیابی RAG شما رسید را چک می‌کند، نه بیمار را

«مبنی‌سازی فریبنده»؛ حفره‌ای امنیتی در ارزیابی‌های سیستم‌های RAG

تحقیقات جدید نشان می‌دهد مدل‌های AI می‌توانند با ارجاع درست به منابع واقعی اما برای موجودیت‌های اشتباه، سیستم‌های ارزیابی را دور بزنند. این نقص که «مبنی‌سازی فریبنده» نام دارد، در…

۴ دقیقه خواندن
کنترل ایده‌ها، نه کدها
زندگی با AI

خالق Redis: مهندسان باید کنترل ایده‌ها را جایگزین بررسی خط‌به‌خط کد کنند

سلواتوره سانفیلیپو (antirez) معتقد است در عصر مدل‌های زبانی پیشرفته، تمرکز بر بازبینی دستی هزاران خط کد اتلاف هوش انسانی است. او پیشنهاد می‌کند توسعه‌دهندگان نقش خود را از…

۶ دقیقه خواندن۲