پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۲۶ مقاله منتشر شده

لوله‌کشی چندعاملی هوش مصنوعی: چرا به ساخت افزایشی نیاز داریم
آموزش کاربردی

رویکرد هشینگ محتوا: حذف اجرای مجدد خط لوله‌های پیچیده در هوش مصنوعی

توسعه سامانه‌های پیچیده چندعاملی به‌دلیل نیاز به اجرای مجدد کل خط لوله برای تغییرات کوچک، بسیار هزینه‌بر است. رویکرد جدیدی با تبدیل جریان‌های کاری به گراف‌های وابستگی و استفاده از…

۶ دقیقه خواندن
«هر معیار حریصانه‌ای می‌گفت مدل در حال بهبود است. آنگاه pass@64 از ۰٫۸۳ به ۰٫۱۹ سقوط کرد»

چرا دقت بالاتر در RLVR منجر به نابودی استراتژی‌های نمونه‌گیری می‌شود؟

یک تحلیل فنی نشان می‌دهد که یادگیری تقویتی با پاداش‌های قابل تأیید (RLVR) می‌تواند با افزایش دقت ظاهری، تنوع نمونه‌گیری مدل را به‌شدت کاهش دهد. این وضعیت که «رژیم تخریب» نامیده…

۵ دقیقه خواندن
گزارش چت، git status نیست: پنج افسانه عامل هوشمند
آموزش کاربردی

چرا گزارش‌های چت عامل‌های هوش مصنوعی با واقعیت دیسک متفاوت است؟

برخی توسعه‌دهندگان به اشتباه متن چت عامل‌های هوش مصنوعی را به جای تغییرات واقعی فایل‌سیستم می‌پذیرند. این راهنما چارچوبی برای تطبیق ادعاهای مدل با واقعیت دیسک از طریق ابزارهای git…

۸ دقیقه خواندن
گزارش عامل یک ادعاست: پنج افسانه ردیابی
آموزش کاربردی

لاگ‌های عامل‌های هوش مصنوعی ادعای توخالی هستند، نه مدرک اجرا

یک چارچوب اعتبارسنجی جدید هشدار می‌دهد که گزارشات (Logs) عامل‌های هوش مصنوعی اغلب بیشتر شبیه به «نمایش» هستند تا مدرکی بر اجرای واقعی کد. این رویکرد، اعتماد به تاریخچهٔ چت را با…

۸ دقیقه خواندن
نگه‌دارنده نویسنده عبارت باقاعده تا رسیدهای سایه‌ای مطابقت یابند
آموزش کاربردی

رسیدهای سایه؛ راهکاری برای جلوگیری از شکست خط لوله‌های داده در استخراج AI

یک چارچوب تست محلی جدید به توسعه‌دهندگان اجازه می‌دهد تا استخراج‌کننده‌های مدل زبانی را با استفاده از «رسیدهای سایه» جایگزین پارسرهای Regex کنند. این روش با مقایسه دقیق فیلدهای…

۱۱ دقیقه خواندن
آموزش مدل کدنویسی برای نقاشی آبرنگ با TRL و OpenEnv
آموزش کاربردی

آموزش سلیقهٔ هنری به مدل‌های زبانی کوچک با یادگیری تقویتی

یک پیاده‌سازی متن‌باز جدید نشان می‌دهد چگونه می‌توان از یادگیری تقویتی برای آموزش «سلیقه» به مدل‌های زبانی کوچک استفاده کرد. این پروژه با پاداش دادن به کدهایی که آبرنگ‌های زیباتری…

۲۰ دقیقه خواندن
چرا «تست‌ها پاس شد» پرسش اشتباهی برای عامل کدنویسی هوش مصنوعی است
آموزش کاربردی

شواهد اجرایی در برابر اعتماد کورکورانه؛ راهکار حذف توهم در AI Coding

اتکا به گزارش «تست‌ها پاس شدند» در عامل‌های کدنویس، یک خطای حسابداری است نه مسئله‌ای اخلاقی. برای دستیابی به قابلیت اطمینان واقعی، باید شواهد اجرایی را مستقیماً به SHAهای خاصِ…

۵ دقیقه خواندن۱
نمودار: مراحل طراحی روبریک قابل‌اعتماد برای ارزیابی LLM-as-a-Judge
آموزش کاربردی

گوگل ارزیابی عامل‌های هوش مصنوعی را با روب‌ریک‌های بولی استاندارد کرد

تیم مهندسی گوگل چارچوبی را معرفی کرد که در آن مدل‌های زبانی به‌جای دستورات مبهم، از معیارهای سخت‌گیرانه و بله/خیر (Boolean) برای نمره‌دهی به سایر عامل‌ها استفاده می‌کنند. این روش…

۵ دقیقه خواندن