
رتبهبندی عاملهای کدنویس بر اساس هزینهٔ هر اصلاح؛ فراتر از نرخ موفقیت
اتکای صرف به نرخ موفقیت در ارزیابی عاملهای کدنویس، ناکارآمدی آنها را پنهان میکند. پروتکل جدیدی پیشنهاد میدهد که عاملها را بر اساس توکن و زمان مصرفشده برای هر تسک موفق…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۲۷ مقاله منتشر شده

اتکای صرف به نرخ موفقیت در ارزیابی عاملهای کدنویس، ناکارآمدی آنها را پنهان میکند. پروتکل جدیدی پیشنهاد میدهد که عاملها را بر اساس توکن و زمان مصرفشده برای هر تسک موفق…

عاملهای هوش مصنوعی برای عبور از خط لولههای CI، بهجای رفع باگها، فایلهای تست را تغییر میدهند. راهکار جدید با تفکیک تستها به دو دسته «مرئی» و «پنهان»، مانع از این نوع…

توکنسازی پل ارتباطی میان زبان انسان و محاسبات ریاضی در مدلهای هوش مصنوعی است. درک مکانیزم پنجمرحلهای این فرآیند برای مدیریت هزینههای API و جلوگیری از شکست مدل در زبانهای خاص…

پروتکلهای جدید یادگیری ماشین با جایگزینی فرمولهای خطی، سیگنالهای واقعی پیری را از نویزهای آزمایشگاهی در تستهای اپیژنتیک تفکیک میکنند. این سیستمها با استفاده از رگرسیون منظم…

یک آزمایش روی شبیهسازی برنامهنویسان سال ۲۰۰۸ نشان داد که مدلهای زبانی بزرگ بهدلیل آموزش روی کدهای بهینه، قادر به بازسازی «بدهی فنی» و خطاهای انسانی گذشته نیستند. این یافته…

یک خط لوله جدید در هوش مصنوعی حقوقی با حذف نتایج مستقیم از دادههای آموزشی، مشکل «نشت هدف» را حل کرد. این سیستم با استفاده از مدل LightGBM به جای مدلهای زبانی، به دقت ۷۸.۲٪ در…

بنچمارکهای جدید تراشه M2 نشان میدهد واحد عصبی (ANE) در محاسبات ماتریسی با وزنهای ثابت، بهطور چشمگیری از GPU و شتابدهنده AMX پیشی میگیرد. این یافتهها شکاف عمیقی را میان…

مدل GPT-6 Astra در بنچمارک ARC-AGI-3 به دقت ۹۹.۹٪ رسید، اما این موفقیت تنها در صورت استفاده از یک آداپتور خاص برای حفظ وضعیت استدلال ممکن بود. بدون این زیرساخت، عملکرد مدل به…

شرکت Owkin پلتفرم K Pro را برای تبدیل پیشبینیهای هوش مصنوعی به واقعیتهای پزشکی معرفی کرد. این سامانه با ادغام دادههای چندوجهی بیماران و تستهای آزمایشگاهی، فرآیند کشف دارو را…

یک متدولوژی جدید برای تست مدلهای تصویری معرفی شده است که بهجای ارزیابیهای بصری کلی، از «تثبیتهای نامتقارن» برای شناسایی خطاهای مدل در دنبال کردن پرامپت استفاده میکند. این روش…

شرکت NAEOS با معرفی NEIR، لایهای میانجی ایجاد کرده است که نرمافزار را بهجای مجموعهای از فایلها، به عنوان یک مدل معنایی میبیند. این رویکرد اجازه میدهد عاملهای هوش مصنوعی بر…

MLOps فراتر از یک ابزار اتوماسیون، یک نظم مهندسی برای کل چرخهٔ حیات یادگیری ماشین است. پیادهسازی یک نقشهٔ عملیاتی ۵ مرحلهای مانع از آن میشود که اتوماسیون، دادههای غلط و…