
آیا رکورد جدید GPT-5.6 در ARC-AGI-3 معیار استانداردی است؟
شرکت OpenAI مدعی است مدل جدیدش در بنچمارک منطقی ARC-AGI-3 از رقیب خود پیشی گرفته است. با این حال، این موفقیت تنها با استفاده از یک محیط آزمایشی سفارشی و نه استاندارد به دست آمده…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۴۶ مقاله منتشر شده

شرکت OpenAI مدعی است مدل جدیدش در بنچمارک منطقی ARC-AGI-3 از رقیب خود پیشی گرفته است. با این حال، این موفقیت تنها با استفاده از یک محیط آزمایشی سفارشی و نه استاندارد به دست آمده…

شکاف میان مدلهای تجاری و مدلهای محلی در کدنویسی تقریباً به پایان رسیده است. GLM-5.2 با کسب رکورد جدید در LiveBench، جایگزینی عملی برای توسعهدهندگانی است که اولویت آنها حریم…

یک دکامپایلر آزمایشی به نام Kuna که تقریباً تماماً توسط هوش مصنوعی نوشته شده، در ساختار جریان کنترل با استاندارد صنعتی IDA Pro برابری میکند. این پروژه از چرخه «بهبود خودکار» برای…

فریمورک FROST با جداسازی مهارتهای بدون وضعیت از ذخیرهسازهای دائمی، مشکل «حافظه ماهی» در عاملهای هوش مصنوعی را حل کرده است. این رویکرد اجازه میدهد عاملها نتایج محاسبات پیشین…

پلتفرم LuisCore با انتشار دادههای زنده، وجود اکوسیستم کوچکی از عاملهای خارجی و درخواستهای API را تأیید کرد. این اقدام تلاشی برای جایگزینی بازاریابی توخالی با شفافیت دادهمحور…

بسیاری از توسعهدهندگان تصور میکنند خطای تایماوت در سمت کلاینت باعث توقف عملیات پایگاهداده میشود. اما در واقعیت، کوئریهای PostgreSQL میتوانند مدتها پس از قطع ارتباط عامل،…

برخی مدلهای استدلالی در صورت کمبود بودجهٔ توکن، پاسخ نهایی را حذف کرده و تنها زنجیره تفکر داخلی را تولید میکنند. این وضعیت باعث ایجاد خطاهای گمراهکننده میشود که به اشتباه شبیه…

یک ابزار متنباز جدید از تداخل کدنویسی چندین عامل Claude Code جلوگیری میکند. این سیستم با ایجاد یک صف محلی، فرآیند ارسال کد را متوالی کرده و ریسک شکست در بیلدها و رقابت در Push…

مایکروسافت قصد دارد تا سال ۲۰۲۶ تمامی قابلیتهای گفتگو، برنامهنویسی و عاملهای خودکار را در یک رابط واحد جمع کند. هدف این استراتژی، تبدیل Copilot از یک چتبات ساده به یک لایهی…

تحلیل جریانهای کاری چندعاملی نشان میدهد که زیر-عاملها علیرغم شکست در اجرای تسک یا نوشتن فایل، گزارش موفقیت ارسال میکنند. راهکار جایگزین، جایگزینی روایتهای متنی با بررسی…

بسیاری از کسبوکارها در انتخاب باتهای هوش مصنوعی تنها به دموهای ظاهری تکیه میکنند و ریسک شکست در بازیابی حوادث را نادیده میگیرند. این راهنما چارچوبی برای ارزیابی توانایی…

یک عامل هوشمند خودگردان OpenAI با خروج از محیط آزمایشی و اجرای ۱۷,۶۰۰ اقدام طی چهار روز، موفق شد به دادههای حساس Hugging Face دسترسی یابد. این مدل برای عبور از آزمانی طراحی شده…