
یک حلقهٔ اعتبارسنجی سهمرحلهای خطاهای پارسر C++ را در ۳ دور اصلاح کرد
یک توسعهدهنده با جایگزینی مهندسی پرامپت با یک سامانهٔ اعتبارسنجی خودکار، توانست یک پارسر C++ آماده برای محیط عملیاتی تولید کند. این تجربه نشان داد که خطاهای مدلهای زبانی در…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

یک توسعهدهنده با جایگزینی مهندسی پرامپت با یک سامانهٔ اعتبارسنجی خودکار، توانست یک پارسر C++ آماده برای محیط عملیاتی تولید کند. این تجربه نشان داد که خطاهای مدلهای زبانی در…

مدلهای زبانی در محیط عملیاتی دچار شکستهایی میشوند که بنچمارکها هرگز آنها را نشان نمیدهند. این راهنما چارچوبی تشخیصی برای شناسایی و رفع خطاهایی نظیر بریدگی متنی و خروجیهای…

تحلیل عملی روی Claude Code نشان میدهد که عاملهای هوش مصنوعی دستورالعملهای بهینهسازی را نادیده میگیرند، مگر اینکه این قوانین در لایهی اجرایی سیستم سختافزاری یا کدنویسی شده…

پژوهشی از دانشگاه دوک نشان میدهد که مدلهای پیشرو در پاسخهای خلاقانه بهشدت شبیه به یکدیگر شدهاند. این روند که «تکفرهنگی الگوریتمی» نامیده میشود، حاکی از کاهش تنوع فکری و…

پژوهشی جدید نشان میدهد مدلهای پیشرو در بازشناسی گفتار بهجای تحلیل واقعی صوت، الگوهای آماری مجموعهدادههای آزمون را حفظ کردهاند. این پدیده که «بنچمکسینگ» نامیده میشود، باعث…

پزشکی قانونی دیجیتال از جستوجوی کلمات کلیدی به سمت درک معنایی حرکت کرده است. این تحول به بازرسان اجازه میدهد ترابایتها داده را بهجای چند ماه، در عرض چند روز تحلیل کنند.

مقایسه مدلهای ویدیویی بر اساس دموهای تصادفی منجر به نتایج گمراهکننده میشود. این راهنما یک گردشکار سختگیرانه برای جداسازی عملکرد واقعی مدل از شانس در پرامپتنویسی معرفی میکند.

یک گردشکار فنی جدید نشان میدهد چگونه میتوان با استفاده از بهینهسازی مستقیم ترجیح (DPO)، مدل Qwen2.5-0.5B-Instruct را همراستا کرد. این متد با تمرکز بر شناسایی «سوگیری طول»،…

سیستمهای نظارتی فعلی با تمرکز بر معیارهای عملیاتی، خطاهای ناشی از دادههای غیرقابلاعتماد را نادیده میگیرند. رویکرد جدید «امتیاز اعتماد» هر پیشبینی را به شواهد…

پلتفرم Fortitude Omnis ابزار متنباز OmnisBench را برای اعتبارسنجی ادعاهای کاهش هزینه در مسیریابی LLMها منتشر کرد. این ابزار نشان میدهد بخش بزرگی از صرفهجوییهای ادعایی، نه به…

یک SDK متنباز جدید با معرفی فرمت فایلهای .flight، امکان ضبط کامل جلسات هوش مصنوعی را برای عیبیابی دقیق و ردیابی هزینهها فراهم میکند. این ابزار به توسعهدهندگان اجازه میدهد…

تحلیلی جدید نشان میدهد تکنیک «کالیبراسیون زمینهای» میتواند نوسانات دقت ناشی از ترتیب قرارگیری مثالها در پرامپتهای چندنمونهای را بهطور کامل از بین ببرد. با این حال،…