پرش به محتوای اصلی

موضوع

بازتولیدپذیری هوش مصنوعی

گزارش‌ها و تحلیل‌های مربوط به توانایی تکرار و تأیید نتایج پژوهش‌های هوش مصنوعی

۲۳۴ مقاله منتشر شده

گزارش چت، git status نیست: پنج افسانه عامل هوشمند
آموزش کاربردی

چرا گزارش‌های چت عامل‌های هوش مصنوعی با واقعیت دیسک متفاوت است؟

برخی توسعه‌دهندگان به اشتباه متن چت عامل‌های هوش مصنوعی را به جای تغییرات واقعی فایل‌سیستم می‌پذیرند. این راهنما چارچوبی برای تطبیق ادعاهای مدل با واقعیت دیسک از طریق ابزارهای git…

۸ دقیقه خواندن
گزارش عامل یک ادعاست: پنج افسانه ردیابی
آموزش کاربردی

لاگ‌های عامل‌های هوش مصنوعی ادعای توخالی هستند، نه مدرک اجرا

یک چارچوب اعتبارسنجی جدید هشدار می‌دهد که گزارشات (Logs) عامل‌های هوش مصنوعی اغلب بیشتر شبیه به «نمایش» هستند تا مدرکی بر اجرای واقعی کد. این رویکرد، اعتماد به تاریخچهٔ چت را با…

۸ دقیقه خواندن
نگه‌دارنده نویسنده عبارت باقاعده تا رسیدهای سایه‌ای مطابقت یابند
آموزش کاربردی

رسیدهای سایه؛ راهکاری برای جلوگیری از شکست خط لوله‌های داده در استخراج AI

یک چارچوب تست محلی جدید به توسعه‌دهندگان اجازه می‌دهد تا استخراج‌کننده‌های مدل زبانی را با استفاده از «رسیدهای سایه» جایگزین پارسرهای Regex کنند. این روش با مقایسه دقیق فیلدهای…

۱۱ دقیقه خواندن
آموزش مدل کدنویسی برای نقاشی آبرنگ با TRL و OpenEnv
آموزش کاربردی

آموزش سلیقهٔ هنری به مدل‌های زبانی کوچک با یادگیری تقویتی

یک پیاده‌سازی متن‌باز جدید نشان می‌دهد چگونه می‌توان از یادگیری تقویتی برای آموزش «سلیقه» به مدل‌های زبانی کوچک استفاده کرد. این پروژه با پاداش دادن به کدهایی که آبرنگ‌های زیباتری…

۲۰ دقیقه خواندن
چرا «تست‌ها پاس شد» پرسش اشتباهی برای عامل کدنویسی هوش مصنوعی است
آموزش کاربردی

شواهد اجرایی در برابر اعتماد کورکورانه؛ راهکار حذف توهم در AI Coding

اتکا به گزارش «تست‌ها پاس شدند» در عامل‌های کدنویس، یک خطای حسابداری است نه مسئله‌ای اخلاقی. برای دستیابی به قابلیت اطمینان واقعی، باید شواهد اجرایی را مستقیماً به SHAهای خاصِ…

۵ دقیقه خواندن۲
نمودار: مراحل طراحی روبریک قابل‌اعتماد برای ارزیابی LLM-as-a-Judge
آموزش کاربردی

گوگل ارزیابی عامل‌های هوش مصنوعی را با روب‌ریک‌های بولی استاندارد کرد

تیم مهندسی گوگل چارچوبی را معرفی کرد که در آن مدل‌های زبانی به‌جای دستورات مبهم، از معیارهای سخت‌گیرانه و بله/خیر (Boolean) برای نمره‌دهی به سایر عامل‌ها استفاده می‌کنند. این روش…

۵ دقیقه خواندن
ارزیابی تطبیقی سیستم‌های عامل‌گرای مرزی: معیارها، چالش‌ها و راهبردهای بهینه‌سازی عملکرد

نرخ موفقیت در برابر هزینه؛ چالش استقرار عامل‌های مهندسی نرم‌افزار

تحلیل جدید FrontierHarness نشان می‌دهد هزینهٔ عملیاتی عامل‌های مهندسی نرم‌افزار با نرخ موفقیت آن‌ها فاصله گرفته است. در حالی که برخی مدل‌ها تسک‌های بیشتری را پاس می‌کنند، هزینهٔ…

۱ دقیقه خواندن
متخصصان هشدار می‌دهند: بهینه‌سازی فرآیند، تخلخل را درمان نمی‌کند
آموزش کاربردی

بهینه‌سازی مبتنی بر هوش مصنوعی تخلخل چاپ فلزی را ۳۰٪ کاهش داد

یک روال بهینه‌سازی جدید با استفاده از هوش مصنوعی، نقص‌های تخلخل در تولید افزایشی فلزات را ۳۰٪ کاهش داده است. این سیستم کالیبراسیون دستی را با عملیاتی تک‌کلیکی بر اساس داده‌های…

۱ دقیقه خواندن۱
چرا پنجره‌های بزرگ‌تر زمینه، سیستم‌های حافظه را از بین نمی‌برند

«ضرورت حافظه مجزا»؛ چرا افزایش توکن‌ها برای مدل‌های قابل‌اعتماد کافی نیست

افزایش پنجرهٔ زمینه به میلیون‌ها توکن، مشکل بازیابی اطلاعات و وضعیت بلندمدت را حل نمی‌کند. پژوهش‌ها نشان می‌دهند مدل‌ها همچنان دچار سوگیری «گم‌شدن در میانه» و هزینه‌های عملیاتی…

۴ دقیقه خواندن۲