
عاملهای هوش مصنوعی در ۷۵٪ سناریوهای عملیاتی SRE شکست میخورند
محک جدید ORCA-bench نشان میدهد که پیشرفتهترین عاملهای کدنویسی در تحلیل ریشهای حوادث تولید (Production) ناتواناند. این یافتهها شکاف عمیقی را میان قدرت کدنویسی مدلها و…
موضوع
۱٬۷۸۵ مقاله منتشر شده

محک جدید ORCA-bench نشان میدهد که پیشرفتهترین عاملهای کدنویسی در تحلیل ریشهای حوادث تولید (Production) ناتواناند. این یافتهها شکاف عمیقی را میان قدرت کدنویسی مدلها و…

ابزار Prelint با بررسی درخواستهای ادغام (PR) در برابر مستندات محصول و سوابق تصمیمگیری، جلوی توهمات عملکردی عاملهای کدنویس را میگیرد. این ابزار بهجای تمرکز بر نحو (Syntax)، بر…

پلتفرم BrassCoders با جداسازی شناسایی خطاهای ساختاری از استدلالهای مبتنی بر قصد، دقت عیبیابی کد را افزایش داده است. این سیستم ابتدا الگوهای شناختهشده را با اسکنرهای قطعی…

شرکت Manifest سرویس مسیریابی مدلهای زبانی را متوقف کرد، زیرا دریافت که جابهجایی پویا بین مدلها بیش از آنکه در هزینه توکنها صرفهجویی کند، باعث ناپایداری و کاهش کیفیت خروجی…

پلتفرم متنباز QM با جایگزینی دستیارهای مشترک با محیطهای کاری ایزوله برای هر کاربر، مشکل پیچیدگی حافظه در استقرار عاملهای هوشمند سازمانی را حل کرده است. این سیستم امکان همکاری…

بهروزرسانی ۲۸ جولای ۲۰۲۶ در پروتکل زمینهٔ مدل (MCP)، تداوم نشستها در سمت سرور را حذف کرد. اکنون توسعهدهندگان باید تمام حالتهای لازم را از طریق کلاینت منتقل کنند تا از شکست…

تولیدکنندگان پیشرو در سال ۲۰۲۶ از «درخواست» خروجی JSON فاصله گرفته و آن را از طریق محدودیتهای سطح API اجباری کردهاند. این تغییر، خطاهای تجزیه (Parsing) را حذف کرده و معماری…

تیم RepoModernizer با جداسازی لایهی درخواست از لایهی پردازش و استفاده از DynamoDB برای ثبت وضعیت، مشکل «تایماوت» عاملهای هوش مصنوعی را حل کرد. این رویکرد اجازه میدهد…

پلتفرم Universal Memory Layer (UML) یک گراف حافظه متنباز را معرفی کرده است که امکان اشتراک دانش کاربر بین عاملهای مختلف را فراهم میکند. برخلاف تاریخچهٔ چتها، این سیستم…

شرکت DebugAI دریافت که نمرات اطمینان (Confidence Scores) تولید شده توسط هوش مصنوعی، اغلب با صحت واقعی کد متضاد هستند. برای حل این مشکل، آنها سیستم خود-ارزیابی را با بررسیهای…

یک راهنمای فنی جدید، مسیر اجرای مدل Kimi K3 — یکی از بزرگترین مدلهای با وزن باز — را روی سختافزارهای شخصی تشریح میکند. این مستندات گامهای عملی برای استفاده از Ollama و LM…

پلتفرم متنباز AgentLab ابزاری برای تست دقیق و محلی عاملهای هوش مصنوعی است که از فایلهای YAML برای اعتبارسنجی گردشهای کاری استفاده میکند. این سیستم اجازه میدهد توسعهدهندگان…