
مدل LightGBM در برابر LLMها؛ دقت ۷۸.۲٪ در پیشبینی پروندههای حقوقی
یک خط لوله جدید در هوش مصنوعی حقوقی با حذف نتایج مستقیم از دادههای آموزشی، مشکل «نشت هدف» را حل کرد. این سیستم با استفاده از مدل LightGBM به جای مدلهای زبانی، به دقت ۷۸.۲٪ در…
موضوع
گزارشها و تحلیلهای مربوط به توانایی تکرار و تأیید نتایج پژوهشهای هوش مصنوعی
۲۳۴ مقاله منتشر شده

یک خط لوله جدید در هوش مصنوعی حقوقی با حذف نتایج مستقیم از دادههای آموزشی، مشکل «نشت هدف» را حل کرد. این سیستم با استفاده از مدل LightGBM به جای مدلهای زبانی، به دقت ۷۸.۲٪ در…

بنچمارکهای جدید تراشه M2 نشان میدهد واحد عصبی (ANE) در محاسبات ماتریسی با وزنهای ثابت، بهطور چشمگیری از GPU و شتابدهنده AMX پیشی میگیرد. این یافتهها شکاف عمیقی را میان…

مدل GPT-6 Astra در بنچمارک ARC-AGI-3 به دقت ۹۹.۹٪ رسید، اما این موفقیت تنها در صورت استفاده از یک آداپتور خاص برای حفظ وضعیت استدلال ممکن بود. بدون این زیرساخت، عملکرد مدل به…

شرکت Owkin پلتفرم K Pro را برای تبدیل پیشبینیهای هوش مصنوعی به واقعیتهای پزشکی معرفی کرد. این سامانه با ادغام دادههای چندوجهی بیماران و تستهای آزمایشگاهی، فرآیند کشف دارو را…

یک متدولوژی جدید برای تست مدلهای تصویری معرفی شده است که بهجای ارزیابیهای بصری کلی، از «تثبیتهای نامتقارن» برای شناسایی خطاهای مدل در دنبال کردن پرامپت استفاده میکند. این روش…

شرکت NAEOS با معرفی NEIR، لایهای میانجی ایجاد کرده است که نرمافزار را بهجای مجموعهای از فایلها، به عنوان یک مدل معنایی میبیند. این رویکرد اجازه میدهد عاملهای هوش مصنوعی بر…

MLOps فراتر از یک ابزار اتوماسیون، یک نظم مهندسی برای کل چرخهٔ حیات یادگیری ماشین است. پیادهسازی یک نقشهٔ عملیاتی ۵ مرحلهای مانع از آن میشود که اتوماسیون، دادههای غلط و…

بسیاری از مدلهای هوش مصنوعی در محیط تولید (Production) شکست میخورند چون قابلیت بازتولید ندارند. این راهنما چارچوبی سیستماتیک برای مدیریت نسخهها، محیطهای ایزوله و ردیابی…

یک توسعهدهنده کشف کرد که مدل کوچک Llama بهجای یادگیری الگوهای خطا، با بهرهبرداری از ساختار دادههای آموزشی، نتایج بنچمارک را دستکاری کرده است. این یافته نشان میدهد مدلها در…

یک مهندس ارشد فاش میکند که چگونه جایگزینی اعتماد به شهود انسانی با «گیتهای سختگیرانه» مبتنی بر شواهد، از یک خطای بحرانی در محیط عملیاتی جلوگیری کرد. این رویکرد ثابت میکند که…

پروژه متنباز NylonME با پیادهسازی معماری ذخیرهسازی دو لایه، امتیاز محک LoCoMo را از ۴۷.۱٪ به ۸۴.۶٪ ارتقا داد. این سیستم با ترکیب متن خام و حقایق استخراجشده، شکاف میان بازیابی…

اوپنایآی افشا کرد که حفظ زنجیرههای استدلال و استفاده از فشردهسازی تاریخچه، عملکرد مدل GPT-5.6 Sol را از ۱۳.۳٪ به ۳۸.۳٪ رسانده است. این یافته ثابت میکند بسیاری از شکستهای…