مالیات ۶.۵ برابری توکنها؛ چرا GPT-5.4 در اصلاح کد ناکارآمد است؟
مدل GPT-5.4 در اصلاح کدهای برنامهنویسی دچار «ویرایش بیشازحد» میشود و بدون افزایش دقت، ۶.۵ برابر بیشتر از Claude Opus 4.6 توکن تولید میکند. این شکاف کارایی منجر به اتلاف منابع…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۴ مقاله منتشر شده
مدل GPT-5.4 در اصلاح کدهای برنامهنویسی دچار «ویرایش بیشازحد» میشود و بدون افزایش دقت، ۶.۵ برابر بیشتر از Claude Opus 4.6 توکن تولید میکند. این شکاف کارایی منجر به اتلاف منابع…
ائتلافی از ۱۶ ریاضیدان برجسته و اتحادیه بینالمللی ریاضیات با انتشار اعلامیه لایدن، وضعیت پژوهشهای ریاضی را به خطر افتاده اعلام کردند. این مانیفست هشدار میدهد که اثباتهای…
IBM استدلال میکند که مقیاسپذیری هوش مصنوعی سازمانی نیازمند «منطق عاملمحور» (Agent Logic) است تا مدلهای زبانی بزرگ را هدایت کند. این رویکرد با استفاده از گرافهای دانش، توهمات…
پژوهشی از دانشکده حقوق استنفورد نشان میدهد مدلهای زبانی در تحلیل متون پیچیده قراردادها، ۷۵٪ بیشتر از اساتید حقوق مورد پذیرش قرار گرفتند. این یافتهها فرضیه محدودیت هوش مصنوعی در…
مایکروسافت مدل MAI-Code-1-Flash را معرفی کرد که به جای بنچمارکهای تئوری، بر کارایی واقعی در محیط تولید تمرکز دارد. این مدل در حل مسائل پیچیده کدنویسی، ۶۰٪ توکن کمتری نسبت به رقیب…
مدل M3 از شرکت MiniMax، نخستین مدل بازمتنی است که حافظه یک میلیون توکنی را با قابلیتهای چندوجهی ترکیب میکند. این مدل در بنچمارکهای کدنویسی و جستجوی وب، رقبای قدرتمندی چون…
ریچارد ساتون، برنده جایزه تورینگ، معتقد است مدلهای زبانی فعلی به دلیل نبود «حلقه ارزیابی» قادر به اکتشاف علمی نیستند. این مدلها در تقلید عالیاند، اما برای کشف حقیقت به سیستمی…
لنگچین ابزار RubricMiddleware را معرفی کرد تا عاملهای هوش مصنوعی بتوانند خروجیهای خود را بر اساس معیارهای مشخص اصلاح کنند. در این سیستم، یک عامل ارزیاب با استفاده از ابزارهای…
شرکتهای LangChain و Harvey چارچوبی برای کاهش هزینهی تأیید صحت عملکرد عاملهای حقوقی پیچیده معرفی کردهاند. یافتههای آنها نشان میدهد مدل DeepSeek-V4-Flash میتواند با هزینهای…
مدلهای پیشرو همچنان در رفع نیمی از آسیبپذیریهای امنیتی واقعی ناتواناند. بنچمارک CVE-Bench نشان میدهد که «استدلال امنیتی» در این مدلها بیشتر شبیه به تطبیق الگو است تا تحلیل…
شرکت StepFun مدل Step 3.7 Flash را معرفی کرد؛ یک مدل ۱۹۸ میلیارد پارامتری بهینه برای پردازندههای NVIDIA. این مدل استدلال چندوجهی در مقیاس سازمانی را با پنجره متنی ۲۵۶ هزار توکنی…
شرکت OpenAI در حال بازسازی خط تولید مدلهای خود است. این شرکت در کنار بهبود خوانایی GPT-5.5 Instant و حذف پنل Canvas، تاریخ بازنشستگی مدلهای GPT-4.5 و o3 را برای سال ۲۰۲۶ اعلام…