کاهش ۳۰ برابری مصرف توکن با جایگزینی حافظه مدل با «منطق عاملمحور»
IBM استدلال میکند که مقیاسپذیری هوش مصنوعی سازمانی نیازمند «منطق عاملمحور» (Agent Logic) است تا مدلهای زبانی بزرگ را هدایت کند. این رویکرد با استفاده از گرافهای دانش، توهمات…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۶ مقاله منتشر شده
IBM استدلال میکند که مقیاسپذیری هوش مصنوعی سازمانی نیازمند «منطق عاملمحور» (Agent Logic) است تا مدلهای زبانی بزرگ را هدایت کند. این رویکرد با استفاده از گرافهای دانش، توهمات…
پژوهشی از دانشکده حقوق استنفورد نشان میدهد مدلهای زبانی در تحلیل متون پیچیده قراردادها، ۷۵٪ بیشتر از اساتید حقوق مورد پذیرش قرار گرفتند. این یافتهها فرضیه محدودیت هوش مصنوعی در…
مایکروسافت مدل MAI-Code-1-Flash را معرفی کرد که به جای بنچمارکهای تئوری، بر کارایی واقعی در محیط تولید تمرکز دارد. این مدل در حل مسائل پیچیده کدنویسی، ۶۰٪ توکن کمتری نسبت به رقیب…
مدل M3 از شرکت MiniMax، نخستین مدل بازمتنی است که حافظه یک میلیون توکنی را با قابلیتهای چندوجهی ترکیب میکند. این مدل در بنچمارکهای کدنویسی و جستجوی وب، رقبای قدرتمندی چون…
ریچارد ساتون، برنده جایزه تورینگ، معتقد است مدلهای زبانی فعلی به دلیل نبود «حلقه ارزیابی» قادر به اکتشاف علمی نیستند. این مدلها در تقلید عالیاند، اما برای کشف حقیقت به سیستمی…
لنگچین ابزار RubricMiddleware را معرفی کرد تا عاملهای هوش مصنوعی بتوانند خروجیهای خود را بر اساس معیارهای مشخص اصلاح کنند. در این سیستم، یک عامل ارزیاب با استفاده از ابزارهای…
شرکتهای LangChain و Harvey چارچوبی برای کاهش هزینهی تأیید صحت عملکرد عاملهای حقوقی پیچیده معرفی کردهاند. یافتههای آنها نشان میدهد مدل DeepSeek-V4-Flash میتواند با هزینهای…
مدلهای پیشرو همچنان در رفع نیمی از آسیبپذیریهای امنیتی واقعی ناتواناند. بنچمارک CVE-Bench نشان میدهد که «استدلال امنیتی» در این مدلها بیشتر شبیه به تطبیق الگو است تا تحلیل…
شرکت StepFun مدل Step 3.7 Flash را معرفی کرد؛ یک مدل ۱۹۸ میلیارد پارامتری بهینه برای پردازندههای NVIDIA. این مدل استدلال چندوجهی در مقیاس سازمانی را با پنجره متنی ۲۵۶ هزار توکنی…
شرکت OpenAI در حال بازسازی خط تولید مدلهای خود است. این شرکت در کنار بهبود خوانایی GPT-5.5 Instant و حذف پنل Canvas، تاریخ بازنشستگی مدلهای GPT-4.5 و o3 را برای سال ۲۰۲۶ اعلام…
متا کتابخانه ATLAS را منتشر کرد؛ مجموعهای عظیم از متون ریاضی که توسط هوش مصنوعی به کد Lean 4 تبدیل شدهاند. این پایگاه داده با بیش از ۴۶ هزار قضیه اثباتشده، زیربنایی مقیاسپذیر…
شرکت OpenAI در یک دستورالعمل فنی استدلال میکند که توانایی مدلهای پیشرو یک مقدار ثابت نیست، بلکه متغیری وابسته به «هارنس» (Harness) یا همان محیط، ابزارها و بودجه محاسباتی است.…