
mini-swe-agent با ۵۴٪ توکن کمتر، نرخ موفقیت ۷۸ درصدی در رفع باگ ثبت کرد
یک محک جدید نشان میدهد چارچوب سبک mini-swe-agent در کارهای عیبیابی از Codex CLI پیشی گرفته است. این نتایج ثابت میکند ساختارهای سادهتر و خطی برای رفع باگهای واقعی کارآمدتر…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۸۷ مقاله منتشر شده

یک محک جدید نشان میدهد چارچوب سبک mini-swe-agent در کارهای عیبیابی از Codex CLI پیشی گرفته است. این نتایج ثابت میکند ساختارهای سادهتر و خطی برای رفع باگهای واقعی کارآمدتر…

زین نوفان ابوزید، توسعهدهنده اردنی، با معرفی ScamLens AI رویکردی جدید برای شناسایی فیشینگ ارائه داده است. این سیستم بهجای ارائه امتیاز ریسک مبهم، محرکهای روانشناختی و…

یک معماری جدید خودبهبودبخش، عیبیابی واکنشی را با حلقههای خودمختار جایگزین کرده است که خطاها را در لحظه تشخیص داده و اصلاح میکنند. این سیستم با ذخیره راهکارها در یک حافظه مشترک،…

پژوهشی از AgentVitals نشان میدهد نوسان در عملکرد عاملهای هوش مصنوعی بیش از آنکه به ناپایداری مدل مربوط باشد، ناشی از ابهام در دستورالعملهای داوری است. این تیم دریافت که طراحی…

تغییر دمای مدلهای زبانی (Temperature) باعث تولید ایدههای جدید نمیشود، بلکه تنها احتمال انتخاب توکنهای کماحتمالتر را افزایش میدهد. این تنظیمات رتبهبندی داخلی مدل را تغییر…

انویدیا با معرفی NOOA، پیچیدگیهای توسعه عاملهای هوش مصنوعی را به ساختار استاندارد مهندسی نرمافزار منتقل کرد. این ابزار با کاهش ۵۰ درصدی مصرف توکن، دقت بالایی را در بنچمارکهای…

رتبهبندیهای عمومی مدلهای زبانی اغلب برای توسعهدهندگان گمراهکننده است، زیرا نمرات آکادمیک محدودیتهای دنیای واقعی را پوشش نمیدهند. رویکرد مسیریابی وظایف (Task-specific…

یک چارچوب ارزیابی جدید نشان میدهد که مدلهای زبانی در نقش معلم، تمایل دارند بیش از حد به دانشآموز کمک کنند و فرصت «تلاش سازنده» را از آنها بگیرند. با وجود بهبود در مهندسی…

یک مطالعه بر روی ۷۲ آزمایش نشان میدهد که فشردهسازی خروجیهای ابزار در پروتکل MCP باعث میشود عاملها از انجام وظایفی که قادر به حل آنها هستند، صرفنظر کنند. این پژوهش ثابت…

بررسی یک جلسه عملی با عاملهای هوشمند نشان میدهد که پرامپتهای مبهم و نادیده گرفتن فاز برنامهریزی منجر به حلقههای تکراری و اتلاف توکن میشود. این مورد بر ضرورت تعریف دقیق…

آزمایشهای جدید نشان میدهد عاملهای هوش مصنوعی میتوانند با تبدیل اسکرینشاتها به دادههای اندازهگیری شده، ویدیوهای باکیفیت تولید کنند. این مدلها بدون «دیدن» واقعی فیلم، تنها…

پلتفرم BMAD با معرفی یک سامانه چندعاملی، تصمیمات فنی را پیش از کدنویسی اجباری میکند. این روش با انتقال مرحله برنامهریزی به ابتدای فرآیند، از حدسهای خاموش و باگهای پنهان در…