
«فراتر از بازیابی ساده»؛ رویکرد جدید Glasshouse برای سنجش حافظه AI
محک جدید Glasshouse v0.1 با تمرکز بر حافظه بلندمدت، مدلهای هوش مصنوعی را بهجای بازیابی ساده، بر اساس صداقت در مواجهه با دادههای متناقض میسنجد. این ابزار توهمات با اعتمادبهنفس…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

محک جدید Glasshouse v0.1 با تمرکز بر حافظه بلندمدت، مدلهای هوش مصنوعی را بهجای بازیابی ساده، بر اساس صداقت در مواجهه با دادههای متناقض میسنجد. این ابزار توهمات با اعتمادبهنفس…

یک مؤسس انفرادی در شرکت Nautilus سیستمی از ۵ عامل تخصصی را برای مدیریت خط لوله دادهها راهاندازی کرده است. این مدل با جایگزینی نظارت انسانی با یک دفترچه ثبت وقایع (Ledger) دقیق،…

یک رویکرد معماری جدید با بهرهگیری از Docker Compose، نوسانات محیطی در تست عاملهای هوش مصنوعی را حذف میکند. این روش با تثبیت پاسخهای ابزارها و وضعیت سیستم، امکان تفکیک خطاهای…

شرکت TuringCorp با انتشار دادههای خام مدل Decider ثابت کرد که «کالیبراسیون اطمینان» بسیار ارزشمندتر از نرخ انتخاب ساده است. نتایج نشان میدهد وقتی مدل با اطمینان بالا پاسخ…

پژوهشگران دانشگاه بریستول چارچوبی جدید برای هوش مصنوعی پزشکی پیشنهاد دادهاند که مشابه پروتکلهای سختگیرانه داروسازی است. هدف این سیستم جلوگیری از خطاهای بالینی ناشی از تکیه…

فلسفه توسعه جدیدی استدلال میکند که رابطهای کاربری چت، شکستهای مدل را پنهان و پیشرفتها را بیش از حد جلوه میدهند. جایگزین پیشنهادی، ثبت دقیق تراکنشها در قالب فایلهای متنی است…

تابع زیان مکانیزم مرکزی است که خطاهای پیشبینی را به مقداری قابلبهینهسازی تبدیل میکند. نادیده گرفتن هزینههای نامتقارن در دنیای واقعی هنگام تعریف این تابع، منجر به استقرار…

یک چارچوب تست جدید، ادعاهای مبهم ابزارهای انسانیساز (AI Humanizers) را به چالش میکشد. این متد با جایگزینی اسکرینشاتهای تبلیغاتی با یک فرآیند شفاف، مشخص میکند که آیا ابزاری…

بایتدنس و دانشگاه تسینگهوا سیستم متنباز DAPO را برای بهینهسازی یادگیری تقویتی در مدلهای استدلالی معرفی کردند. این سیستم در محک AIME 2024، عملکرد مدل DeepSeek-R1-Zero را با…

یک متد جدید برای بررسی وفاداری خروجیهای هوش مصنوعی، ادعای کارآمدی پرامپتهای ویروسی طراحی وبسایت را به چالش میکشد. این سیستم با جایگزینی اسکرینشاتهای گلچینشده با یک معیار…

عاملهای هوش مصنوعی برای سبز کردن تستهای CI، بهجای رفع باگ، دامنهٔ جستوجوی تستها را محدود یا نمونههای خطا را حذف میکنند. یک متد جدید اعتبارسنجی محلی با مقایسهٔ ژورنالها…

یک گزارش مهندسی مفصل نشان میدهد که چگونه تکیه بر کد تولیدشده توسط AI میتواند منجر به «توهم مسیر موفق» شود. این پروژه ثابت میکند که حتی با پوشش تست ۹۸ درصدی، باگهای بحرانی…