
GPT-5.6 Sol مصرف توکنهای عاملهای هوشمند را ۶۳.۵٪ کاهش داد
اوپنایآی با معرفی خانواده مدلهای GPT-5.6، قابلیت فراخوانی برنامهریزیشده ابزارها را از طریق سندباکس V8 بهینه کرد. این بهروزرسانی هزینه و تأخیر در گردشکارهای پیچیده MCP را…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۸۸ مقاله منتشر شده

اوپنایآی با معرفی خانواده مدلهای GPT-5.6، قابلیت فراخوانی برنامهریزیشده ابزارها را از طریق سندباکس V8 بهینه کرد. این بهروزرسانی هزینه و تأخیر در گردشکارهای پیچیده MCP را…

یک پیشنهاد فنی جدید برای ثبت وقایع عاملهای هوش مصنوعی، توصیه میکند به جای ثبت صرفِ مسیر طیشده، دلایل رد گزینههای جایگزین نیز ذخیره شوند. این رویکرد اجازه میدهد انسانها مرز…

آنتروپیک مدل Claude Sonnet 5 را با تمرکز بر پایداری در چرخههای طولانی عاملمحور عرضه کرد. این مدل شکاف عملکردی با Opus 4.8 در کدنویسی را میبندد و قیمتهای introductory بسیار…

پلتفرم MORPHEUS نشان داد که الگوریتمهای رایج یادگیری تقویتی هنگام مواجهه با تغییرات محیطی در سازمانها، توانایی تطبیق ندارند. این نتایج شکاف عمیقی را در قابلیتهای یادگیری مستمر…

زبان Jacquard برای آیندهای طراحی شده که در آن ماشینها کد میزنند و انسانها فقط بازبینی میکنند. این زبان با جایگزینی کامنتها با محدودیتهای سختافزاری در سطح سینتکس، امنیت و…

پژوهشگران آنتروپیک لایهای مخفی به نام J-space را در مدل Claude پیدا کردند که مفاهیم و تحلیلها را پیش از تولید پاسخ پردازش میکند. این دستاورد در زمینه تفسیرپذیری مکانیکی، امکان…

مدل جدید DeepSeek V4 Flash عملکردی تقریباً مشابه با پیشروان آمریکایی در کدنویسی ارائه میدهد، اما با قیمتی بسیار پایینتر. دسترسی به این مدلها از طریق APIهای یکپارچه برای…

شرکت OpenAI چارچوب جدیدی برای مهندسی پرامپت معرفی کرد که در آن تمرکز از دستورات پیچیده به درخواستهای هدفمحور تغییر یافته است. این راهنما تفاوت دقیقی میان وظایف سریع «چت» و…

ارزیابی عاملهای هوش مصنوعی نیازمند گذار از بررسی خروجیهای ساده به استراتژیهای لایهای شامل تحلیل مسیر اجرا و شبیهسازیهای چندمرحلهای است. به دلیل ماهیت غیرقطعی این سیستمها،…

تحقیقات جدید نشان میدهد مدلهای AI میتوانند با ارجاع درست به منابع واقعی اما برای موجودیتهای اشتباه، سیستمهای ارزیابی را دور بزنند. این نقص که «مبنیسازی فریبنده» نام دارد، در…

سلواتوره سانفیلیپو (antirez) معتقد است در عصر مدلهای زبانی پیشرفته، تمرکز بر بازبینی دستی هزاران خط کد اتلاف هوش انسانی است. او پیشنهاد میکند توسعهدهندگان نقش خود را از…

شرکت Prime Intellect با معرفی Verifiers v1، ساختار محیطهای آموزشی را به سه بخش مجزای تسکست، هارنس و رانتایم تقسیم کرد. این رویکرد باعث حذف رشد درجهدوم حافظه و تسهیل یادگیری…