
نردبان اعتبارسنجی: سیستمی برای شکار باگهای پنهان در کدهای هوش مصنوعی
یک چارچوب اعتبارسنجی جدید با ترکیب تستهای واحد، تستهای تفاضلی و ابزارهای شناسایی خطا، نقصهای پنهان در کدهای تولیدشده توسط هوش مصنوعی را شناسایی میکند. این فرآیند کدهای «به…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۸۲ مقاله منتشر شده

یک چارچوب اعتبارسنجی جدید با ترکیب تستهای واحد، تستهای تفاضلی و ابزارهای شناسایی خطا، نقصهای پنهان در کدهای تولیدشده توسط هوش مصنوعی را شناسایی میکند. این فرآیند کدهای «به…

تحلیل ششماهه عملکرد مدلهای پیشرو نشان میدهد که دیگر «بهترین مدل واحد» وجود ندارد. در حالی که GPT-5 Turbo در بنچمارکهای خام و سرعت برنده است، Claude 4 Opus در دیباگینگ پیچیده و…

معماری جدید ترکیبی با ادغام فیلترینگ مشارکتی و رتبهبندی مبتنی بر مدلهای زبانی، دقت توصیهها را بالا برده است. Oxlo.ai با جایگزینی پرداخت توکنی با نرخ ثابت بهازای هر درخواست،…

پروژه Tera Pilot یک عامل کدنویسی متنباز و مستقل از فروشنده است که اولویت را بر حریم خصوصی و امنیت قرار داده است. این ابزار امکان اجرای کاملاً آفلاین و ثبت لاگهای امضاشده و…

پژوهشگران دریافتند ابزارهای کدنویسی هوش مصنوعی بهطور مکرر بستههای نرمافزاری غیرموجود را پیشنهاد میدهند. این نقص امنیتی که «اسلاپاسکواتینگ» نامیده شده، به مهاجمان اجازه میدهد…

دو پروژه متنباز PI Agent و Hermes Agent دو رویکرد متضاد را برای توسعه عاملهای هوش مصنوعی ارائه میدهند. در حالی که PI بر سادگی و کنترل محلی تمرکز دارد، Hermes سیستمی…

سازمانها برای بازپسگیری کنترل دادههای حساس و مدیریت هزینههای پیشبینیناپذیر، به سمت پشتههای متنباز هوش مصنوعی حرکت میکنند. جداسازی لایههای سرویسدهی، ذخیرهسازی و…

شرکت Cactus Compute مدل Needle 2 را برای اجرای آفلاین روی سختافزارهای لبه معرفی کرد. این مدل با جایگزینی لایههای سنتی با تبدیلهای هادامارد، امکان کنترل دستگاهها را روی…

دیلان پتل پیشبینی میکند که دو غول هوش مصنوعی تا سال ۲۰۲۸ تا ۸۰٪ از ظرفیت جدید محاسباتی جهان را در اختیار بگیرند. این انحصار از طریق یک «چرخدنده بازخوردی» ایجاد میشود که در آن…

تکنیکهای بهینهسازی جدید مانند رمزگشایی گمانهزنانه و توجه صفحهای، گلوگاه پهنایباند حافظه در مدلهای زبانی بزرگ را برطرف میکنند. این روشها اجازه میدهند مدلهای با پنجره متنی…

چتباتهای صنعتی برای جلوگیری از انحراف گفتگو و کاهش هزینههای API، نیازمند یک لایه مدیریت گفتگو (Dialogue Management) قطعی هستند. تفکیک ردیابی وضعیت از تولید زبان طبیعی، اجرای…

کاربران پیشرفته در Hacker News مجموعهای از وظایف ساده اما دشوار برای هوش مصنوعی را شناسایی کردند. این شکستها شکاف عمیق میان تسلط زبانی و دقت منطقی در مدلهای فعلی را افشا میکند.