
«۳۰ درصد سناریوها معیوباند»؛ هشدار OpenAI دربارهٔ یک محک کدنویسی
شرکت OpenAI در بازرسی از محک کدنویسی SWE-Bench Pro دریافت که حدود ۳۰ درصد از سناریوهای آن دارای نقص فنی هستند. این شرکت به دلیل عدم اطمینان به نتایج، توصیه به استفاده از این…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۷۸ مقاله منتشر شده

شرکت OpenAI در بازرسی از محک کدنویسی SWE-Bench Pro دریافت که حدود ۳۰ درصد از سناریوهای آن دارای نقص فنی هستند. این شرکت به دلیل عدم اطمینان به نتایج، توصیه به استفاده از این…

چهار شکست امنیتی زنجیرهای در جولای ۲۰۲۶ نشان داد که اکثر عاملهای هوش مصنوعی بدون هیچ نظارت مستقلی عمل میکنند. دادههای مربوط به ۲.۴ میلیون عامل، شکافی سیستماتیک در مدلهای…

یک پیادهسازی کاربردی در Google Colab نشان میدهد که جایگزینی بافرهای تاریخچه کامل با تلخیص توکنمحور، هزینههای عملیاتی را بهشدت کاهش میدهد. این روش علاوه بر کنترل هزینهها،…

بهینهسازی تولید زبان طبیعی نیازمند موازنه بین زمان تا نخستین توکن و تأخیر بینتوکنی است. استفاده از معماری ترکیب خبرهها اجازه میدهد عمق استدلال مدل حفظ شود و در عین حال توان…

پلتفرم Hume با معرفی محک Real World VoiceEQ نشان داد که مدلهای صوتی علیرغم نمرات بالای فنی، در درک احساسات و بافتهای صوتی شکست میخورند. دادهها حاکی از آن است که هیچ مدل واحدی…

استفاده از زبانهای تخصصی (DSL) با محدود کردن فضای خروجی مدلها، احتمال توهم را حذف و صحت سینتکسی را تضمین میکند. این رویکرد به توسعهدهندگان اجازه میدهد حلقههای خودکارسازی…

پلتفرم LuisCore روشی شفاف برای ارزشگذاری پروژه خود معرفی کرد که بهجای یک عدد ثابت، از باندهای درصدی و دادههای فنی زنده استفاده میکند. این سیستم تلاش میکند تا روایتهای مبهم…

پلتفرم Oxlo.ai با جایگزینی مدل پرداخت توکنی با هزینه ثابت بهازای هر درخواست، مانع اقتصادی تحلیل فایلهای لاگ حجیم را از بین برد. این رویکرد امکان استدلال عمیق روی دادههای…

خودمختاری بدون محدودیت در عاملهای هوش مصنوعی منجر به شکستهای «اجرای جزئی» میشود که در آن تغییرات سیستمی بهصورت ناقص و غیرقابلبازگشت اعمال میشوند. قابلیت توقف دقیق و…

مدلهای زبانی مدرن بین دو مسیر معماری متراکم و ترکیب خبرهها (MoE) تقسیم شدهاند. در حالی که مدلهای متراکم از تمام توان خود برای هر پاسخ استفاده میکنند، MoE تنها بخشهای تخصصی…

قرارداد قابلیت عامل (ACC) لایهای قابلحمل برای تعریف حاکمیت کسبوکار در عاملهای هوش مصنوعی معرفی میکند. این استاندارد با تفکیک آنچه یک عامل میتواند ببیند از آنچه مجاز به…

شرکت OpenAI ارتباطات بین عاملهای هوش مصنوعی در ابزار Codex را رمزگذاری کرد تا توسعهدهندگان نتوانند روند تفویض تکالیف را ببینند. گمان میرود این اقدام برای جلوگیری از استخراج…