
عاملهای هوش مصنوعی در ۸۰٪ وظایف واقعی وب شکست میخورند
بنچمارک جدید Mininglamp نشان میدهد مدلهای فعلی تنها در ۲۰٪ موارد موفق به تکمیل کامل وظایف در وب زنده میشوند. این فاصله عمیق بین «ناوبری ساده» و «اتمام عملیات»، چالش اصلی مسیر…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۲ مقاله منتشر شده

بنچمارک جدید Mininglamp نشان میدهد مدلهای فعلی تنها در ۲۰٪ موارد موفق به تکمیل کامل وظایف در وب زنده میشوند. این فاصله عمیق بین «ناوبری ساده» و «اتمام عملیات»، چالش اصلی مسیر…

مدل Kimi K3 محصول Moonshot AI اولین مدل با وزنهای باز در کلاس ۳ تریلیون پارامتر است که اکنون از طریق API شرکت Telnyx در دسترس است. این مدل با پنجره متنی ۱ میلیون توکنی، رقیبی جدی…

مایکروسافت مدل تخصصی MAI-Cyber-1-Flash را معرفی کرد که در محک CyberGym از مدلهای گوگل و OpenAI پیشی گرفته است. این مدل با مدیریت ۹۰ درصد وظایف امنیتی، هزینههای عملیاتی را تا ۵۰…

یک گردشکار فنی جدید معماری خدمات مالی آنتروپیک را در پایتون بازسازی میکند تا مدلهای کلود بتوانند ارزیابیهای DCF و تحلیل شرکتهای مشابه را از طریق یک سامانه ثبت مهارت اجرا…

تزریق حجم بالای داده به عاملهای هوش مصنوعی اغلب باعث کاهش دقت و بروز اثر «گمشده در میانه» میشود. تکنیکهای جدید فشردهسازی، از جمله بازرتبهبندی و خلاصهسازی بازگشتی، با حذف…

مایکروسافت مدل فشرده و کد-محور MAI-Cyber-1-Flash را برای مدیریت ۹۰٪ وظایف امنیتی عرضه کرد. این استراتژی هزینه عملیات را نصف کرده و دقت سیستم در شناسایی تهدیدات را افزایش داده است.

شرکت MoonshotAI جزئیات معماری مدل Kimi-K3 را در گیتهاب منتشر کرد. این گزارش نشان میدهد که استراتژی این شرکت از گسترش صرفِ پنجره متنی به سمت بهینهسازی استدلال و کاهش تأخیر تغییر…

توسعه نرمافزار از نوشتن کدهای ایستا به مدیریت عاملهای خودمختار تغییر مسیر داده است. چارچوبهای جدید با ایجاد چرخه «ادراک-استدلال-عمل-تأمل»، امکان خوداصلاحی برنامهها و اجرای…

سازمان پژوهشی METR با معرفی معیار «افق هزینه»، نشان داد که عاملهای فعلی هوش مصنوعی در پروژههای پیچیده، پس از صرف چند هزار دلار، دیگر بازدهی اقتصادی ندارند. این دادهها حاکی از…

سامانههای فعلی هوش مصنوعی با وجود قدرت استدلال بالا، در همکاری تیمی شکست میخورند. Outshift با معرفی «اینترنت شناخت»، لایهای برای اشتراک اهداف و حافظه میان عاملها ایجاد کرده تا…

سامانههای خودمختار برای مدیریت تصمیمات پیچیده و متوالی، از منطق صلبِ قانونمحور به سمت یادگیری تقویتی حرکت میکنند. با این حال، «شکاف واقعیت» و دشواری تأیید ایمنی همچنان موانع…

مقایسهی مستقیم دو مدل پیشرو نشان میدهد Claude Opus 5 در بنچمارکهای خنثی و سرعت پاسخدهی اولیه برتر است، در حالی که GPT-5.6 Sol در سرعت استریم و حالتهای محاسباتی سنگین پیروز…