
گوگل: چارچوب ADK نرخ خطاهای عملیاتی عاملهای هوش مصنوعی را کاهش میدهد
مجموعههای ارزیابی ایستا در عاملهای هوش مصنوعی بهسرعت منسوخ میشوند و خطاهای واقعی تولید را میپوشانند. چارچوب جدید گوگل ADK یک چرخه کنترلشده برای تبدیل شکستهای محیط عملیاتی…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۶۹ مقاله منتشر شده

مجموعههای ارزیابی ایستا در عاملهای هوش مصنوعی بهسرعت منسوخ میشوند و خطاهای واقعی تولید را میپوشانند. چارچوب جدید گوگل ADK یک چرخه کنترلشده برای تبدیل شکستهای محیط عملیاتی…

تحلیلهای جدید نشان میدهد مدلهای ارزانتر Anthropic برای فعالسازی حافظه (Caching) به متون بسیار طولانیتری نیاز دارند. این تضاد باعث میشود در بسیاری از موارد، استفاده از…

گزارش جدید BloombergNEF پیشبینی میکند تقاضای گاز طبیعی مراکز داده در آمریکا برای تغذیه رقابت هوش مصنوعی، تا سال ۲۰۳۵ از مجموع مصرف دو قدرت صنعتی آلمان و ژاپن پیشی بگیرد. این جهش…

اتودسک در حال تبدیل دستیار هوش مصنوعی خود به یک سامانه عاملمحور است که بهجای پاسخ به سؤالات، مدیریت پروژهها را بر عهده میگیرد. این سیستم با استفاده از یک ارکستراتور،…

شرکت G5 Labs با هدف حل بحران مدیریت کدهای تولیدشده توسط هوش مصنوعی، لایهای انتزاعی میسازد که در آن «قصد کاربر» بهجای کد، به عنوان منبع اصلی نرمافزار شناخته میشود. این رویکرد…

کیتی استاین، مدیرعامل جدید ASAPP، معتقد است شکست عاملهای هوش مصنوعی در محیطهای واقعی به دلیل نادیده گرفتن موارد نادر و پیچیده است. او راهکار را در جداسازی گفتگوهای طبیعی از…

گوگل از مدلهای Gemini 3.8 Live و Extended Thinking رونمایی کرد که برای استدلال چندمرحلهای و تعاملات صوتی بلادرنگ طراحی شدهاند. این مدلها با ادغام در اکوسیستم Workspace و API…

انویدیا با معرفی پلتفرم DSX، مشکل «دیوار توان» را از طریق بازتوزیع پویا انرژی در خوشههای GPU حل کرده است. نتایج اولیه شرکت Lambda نشان میدهد که بدون افزایش مصرف برق، توان…

مؤسسه هوش مصنوعی Zhongguancun مدل ZGCM-1 را معرفی کرد؛ مدلی ۷.۳۹ میلیارد پارامتری که بهجای حفظ دادهها، بر استدلال و استفاده از ابزار تمرکز دارد. این مدل با معماری ترکیبی و پنجره…

یک چارچوب تست جدید با جداسازی تستهای نوشتهشده توسط هوش مصنوعی از بررسیهای انسانی، مانع از تأیید خودکار کدهای غلط میشود. این سیستم با الزام وجود یک «شاهد» برای هر خط کد، توهم…

بسیاری از توسعهدهندگان خروجی متنی مدلها را با اجرای واقعی دستورات در سیستم اشتباه میگیرند. چارچوب جدیدی پیشنهاد میدهد که برای جلوگیری از «موفقیتهای کاذب»، لایههای مدل، ابزار…

مدل جدید OpenAI کدنویسی را از تولید تکه-کد به مدیریت خودکار کل چرخه حیات نرمافزار تبدیل کرد. این مدل با افزایش چشمگیر کارایی در تستهای رابط کاربری، نقش توسعهدهندگان را به نظارت…