
mini-swe-agent با ۵۴٪ توکن کمتر، نرخ موفقیت ۷۸ درصدی در رفع باگ ثبت کرد
یک محک جدید نشان میدهد چارچوب سبک mini-swe-agent در کارهای عیبیابی از Codex CLI پیشی گرفته است. این نتایج ثابت میکند ساختارهای سادهتر و خطی برای رفع باگهای واقعی کارآمدتر…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۲۲ مقاله منتشر شده

یک محک جدید نشان میدهد چارچوب سبک mini-swe-agent در کارهای عیبیابی از Codex CLI پیشی گرفته است. این نتایج ثابت میکند ساختارهای سادهتر و خطی برای رفع باگهای واقعی کارآمدتر…

بسیاری از معیارهای سنجش عاملهای هوش مصنوعی بهدلیل قدیمی شدن دادههای مرجع در برابر تغییرات API و سیاستها، نتایج گمراهکنندهای میدهند. راهکار جایگزین، پیادهسازی یک سیستم…

پروتکل زمینهٔ مدل (MCP) استانداردی را معرفی میکند که تعامل مدلهای هوش مصنوعی با ابزارها و APIها را یکپارچه میسازد. با این روش، توسعهدهندگان دیگر نیازی ندارند با هر بار تغییر…

یک محک سختگیرانه نشان میدهد ابزارهای کاهش توکن برای عاملهای هوش مصنوعی، برخلاف ادعاهای بازاریابی، صرفهجویی بسیار کمتری ایجاد میکنند. این مطالعه نقص بحرانی در نحوه بارگذاری…

یک راهنمای فنی عمیق، نحوه پیادهسازی پسانتشار، بهینهساز AdamW و آموزش با دقت ترکیبی را با استفاده از HIP/C++ شرح میدهد. این مستند ابزارهای سطح پایین GPU را برای عبور از…

شرکت OpenAI توسعه بخشهایی از مدل Astra را متوقف کرد، زیرا تستهای داخلی نشان داد این مدل قادر است بهطور مستقل نقاط ضعف امنیتی سیستمهای پیشرفته را شناسایی و استثمار کند. این…

پژوهشگران دانشگاههای نورتایسترن و استنفورد ابزار متنباز Shepherd را معرفی کردند که اجرای عاملها را شبیه به Git نسخهبندی میکند. این زیرساخت اجازه میدهد وضعیت زنده یک عامل،…

پژوهشگران امنیتی نشان دادند که نقص در لایههای واسط ابزارهای Gemini CLI و Claude Code، امکان اجرای کد از راه دور و سرقت کلیدهای API را فراهم میکند. این حفرهها مربوط به منطق…

پروتکل Pilot با معرفی یک توالی خودکار شامل آدرسدهی، اعتماد و اکتشاف، پیکربندی دستی در ناوگانهای چندعاملی را حذف کرد. این سیستم با استفاده از آدرسهای مجازی دائمی، هزینه حاشیهای…

یک گردشکار صنعتی جدید امکان فیلتر ۵۰۰۰ مقاله هفتگی arXiv را برای استخراج ۵ سیگنال کلیدی فراهم میکند. این سامانه با ترکیب n8n و پایگاهداده برداری، روند «ترند شدن» پژوهشها را…

مدل جدید گوگل در شاخص هوش Artificial Analysis نمرهای بالاتر از نسخه اشتراکی Gemini 3.1 Pro کسب کرد. این وضعیت باعث ایجاد یک تناقض شده است که در آن مدل رایگان، بهطور عینی…

اندرو انجی در راهنمای جدید خود استدلال میکند که ساختار ارتباطی بین عاملها (Interaction Topology) بسیار حیاتیتر از تعداد آنهاست. این رویکرد برای جلوگیری از اتلاف توکن و…