
تضاد تشخیص Opus 4.8 با نظر پزشک در تحلیل تصاویر MRI شانه
یک بیمار با استفاده از مدل Opus 4.8 و ابزار Claude Code، دادههای MRI خود را تحلیل کرد که منجر به رد تشخیص پزشک مبنی بر پارگی درجه ۳ تاندون شد. این اتفاق بیمار را در وضعیتی میان…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۱۳ مقاله منتشر شده

یک بیمار با استفاده از مدل Opus 4.8 و ابزار Claude Code، دادههای MRI خود را تحلیل کرد که منجر به رد تشخیص پزشک مبنی بر پارگی درجه ۳ تاندون شد. این اتفاق بیمار را در وضعیتی میان…

شرکت OpenAI عرضه مدلهای جدید GPT-5.6 را به گروه کوچکی از شرکای مورد اعتماد محدود کرد. این تصمیم در پاسخ به درخواست دولت آمریکا برای بازبینی امنیتی مدلها اتخاذ شده است.

محققان با طراحی محک CEO-Bench، توانایی مدلهای زبانی را در هدایت استراتژیک یک شرکت نرمافزاری طی ۵۰۰ روز بررسی کردند. از میان ۱۴ مدل شرکتکننده، تنها Claude Fable 5، Claude Opus…

معماری جدید Nexus Forge با پیادهسازی یک حلقه بازخورد بازگشتی، عاملهای هوش مصنوعی را قادر میسازد تا خطاها را شناسایی و بهصورت خودکار اصلاح کنند. این سیستم با ترکیب Semantic…

وابستگی بیش از حد به چتباتهای همواره موافق، حلقهای از «بلهگویی» ایجاد کرده که در آن کاربران برای فرار از تلاش ذهنی، پاسخهای غلط را تایید میکنند. این روند، انسان را از یک…

شرکت OpenAI مجموعهای از مدلهای طبقهبندی شده به نام GPT-5.6 شامل مدلهای Sol، Terra و Luna را معرفی کرد. این اقدام نشاندهنده چرخش صنعت از چتباتهای متنی به سمت مدلهای بزرگ…

این راهنما روشی بهینه برای تحلیل، بازرسی و آموزش بر روی مجموعه داده Fable 5 Traces در محیط گوگل کولب ارائه میدهد. هدف این گردشکار، تبدیل تلهمتری خام عاملها به دادههای…

پژوهش جدید دانشگاه UIUC نشان میدهد که تلاش عاملهای هوش مصنوعی برای خلاصهسازی یا پاکسازی حافظه بلندمدت، منجر به کاهش شدید دقت آنها میشود. بازنویسی مداوم سوابق، سوگیری انتخابی…

دو مورد شکست اخیر هوش مصنوعی نشان میدهد که همدلی بیش از حد و شفافیت در پاسخدهی میتواند منجر به حلقههای تکرار بیپایان یا افشای مسیرهای دور زدن امنیت شود.

پژوهش جدید CoffeeBench شکافی خطرناک میان برنامهریزی و اجرا در عاملهای هوش مصنوعی شناسایی کرد. این «رانش بیهدف» باعث میشود مدلها بهجای اقدام، صرفاً گزارش دقیقی از دلیل شکست…

یک چارچوب پیادهسازی جدید به مدلهای زبانی اجازه میدهد بهصورت خودکار تصمیم بگیرند چه زمانی از پایگاهدادههای برداری استفاده کنند. این تغییر از خطلولههای سختافزار به حلقههای…

شرکت DeepSeek چارچوب DSpark را برای شتاببخشی به استنتاج مدلهای V4 معرفی کرد. این سیستم با ترکیب پیشنویسهای موازی و یک زمانبند هوشمند، سرعت تولید توکن را بدون کاهش کیفیت خروجی…