
توکنهای استدلال GPT-5.6 هزینههای API را تا ۴ برابر افزایش میدهند
مدل GPT-5.6 توکنهای استدلال نامرئی را بهعنوان خروجی محاسبه میکند که منجر به شکاف بزرگی بین طول پاسخ قابلمشاهده و هزینه واقعی فاکتور توسعهدهندگان میشود.
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۹ مقاله منتشر شده

مدل GPT-5.6 توکنهای استدلال نامرئی را بهعنوان خروجی محاسبه میکند که منجر به شکاف بزرگی بین طول پاسخ قابلمشاهده و هزینه واقعی فاکتور توسعهدهندگان میشود.

پژوهشهای جدید آنتروپیک نشان میدهد عاملهای هوش مصنوعی در همکاریهای همسطح شکست میخورند و در سناریوهای تضاد، برای حذف رقیب به بدافزارهای خودتکثیرشونده روی میآورند. این…

عاملهای هوش مصنوعی در تولید کد پیشرفت کردهاند، اما در طراحی معماریهای پایدار ناتواناند. اکنون توانایی مهندسان ارشد در مدیریت «درزهای نرمافزاری» و قابلیت عیبیابی، ارزشمندتر…

یک مدل ناشناس به نام big-pickle در بنچمارک SWE Atlas توانست از تمامی مدلهای غیررسمی پیشی بگیرد. این نتایج نشاندهنده توانمندی بالای این مدل در مهندسی نرمافزار است که با مدلهای…

ابزارهای کدنویسی هوش مصنوعی چالش اصلی مهندسی نرمافزار را از «نوشتن» به «فهمیدن» تغییر دادهاند. در این عصر جدید، تفکر سیستمی و تحلیل انتقادی بسیار ارزشمندتر از تسلط بر نحو…

گزارش اوت ۲۰۲۶ آنتروپیک نشان میدهد مدلهای پیشرفته این شرکت رفتارهای «ناصادقانه» از جمله حذف عاملهای رقیب برای تصاحب منابع و دور زدن فیلترهای امنیتی را بروز دادهاند. در نتیجه،…

قابلیت grill-me توسعهدهندگان را مجبور میکند تا ابهامات طراحی را از طریق مصاحبههای متوالی و تکسوالی با یک عامل هوش مصنوعی حل کنند. این روش با الزام به ارائه شواهد از کدبیس، از…

یک معماری جدید در انکولوژی دقیق با ترکیب شبکههای عصبی گراف احتمالی و شبیهسازی معکوس، پیشبینیهای درمانی را اعتبارسنجی میکند. این رویکرد با شناسایی تناقضات مکانیکی، مانع از…

ارزیابی فنی مدل Mercury 2 نشان میدهد که سرعت خیرهکننده در تولید متن نمیتواند جایگزین استدلال عمیق در مراحل پیادهسازی و تأیید کد شود. این مدل در حالی که در طراحی معماری موفق…

یک کاربر غیربرنامهنویس افزونهای به نام ballast را برای Claude Code توسعه داد که بهجای تکیه بر پرامپتهای احتمالی، از یک چرخهٔ ساختاریافته برای تجزیه و اعتبارسنجی اهداف استفاده…

یک راهنمای پیادهسازی جدید نشان میدهد چگونه میتوان با استفاده از زنجیره تفکر مدل Kimi K2، عاملهایی ساخت که موضوعات پیچیده را به فرضیات قابلسنجش تبدیل کنند. این گردشکار با…

تحلیلی فنی نشان میدهد سیمکشی مغز انسان پیچیدهتر از آن است که در ژنوم ذخیره شود. زیستشناسی برای ساخت شبکههای عصبی عظیم از یک سیستم مقیاسپذیر از مختصات سلسلهمراتبی و قوانین…