
تضاد تشخیص Opus 4.8 با نظر پزشک در تحلیل تصاویر MRI شانه
یک بیمار با استفاده از مدل Opus 4.8 و ابزار Claude Code، دادههای MRI خود را تحلیل کرد که منجر به رد تشخیص پزشک مبنی بر پارگی درجه ۳ تاندون شد. این اتفاق بیمار را در وضعیتی میان…
موضوع
Autonomous agents, tool use, planning, multi-step workflows
۳٬۶۰۶ مقاله منتشر شده

یک بیمار با استفاده از مدل Opus 4.8 و ابزار Claude Code، دادههای MRI خود را تحلیل کرد که منجر به رد تشخیص پزشک مبنی بر پارگی درجه ۳ تاندون شد. این اتفاق بیمار را در وضعیتی میان…

شرکت OpenAI عرضه مدلهای جدید GPT-5.6 را به گروه کوچکی از شرکای مورد اعتماد محدود کرد. این تصمیم در پاسخ به درخواست دولت آمریکا برای بازبینی امنیتی مدلها اتخاذ شده است.

سامانه Branch Agent مدل درختی گفتگو را معرفی کرده است که امکان فورک، مقایسه و ادغام چتهای AI را فراهم میکند. این ابزار با استفاده از ارجاعات اشارهگر (Pointer)، نیاز به کپی-پیست…

پلتفرم Crucible با اتوماسیون تستهای خصمانه، زمان بررسیهای امنیتی AI را از چندین ساعت به کمتر از یک دقیقه کاهش داد. این ابزار اجازه میدهد تستهای امنیتی بهطور مستقیم در خط لوله…

محققان با طراحی محک CEO-Bench، توانایی مدلهای زبانی را در هدایت استراتژیک یک شرکت نرمافزاری طی ۵۰۰ روز بررسی کردند. از میان ۱۴ مدل شرکتکننده، تنها Claude Fable 5، Claude Opus…

معماری جدید Nexus Forge با پیادهسازی یک حلقه بازخورد بازگشتی، عاملهای هوش مصنوعی را قادر میسازد تا خطاها را شناسایی و بهصورت خودکار اصلاح کنند. این سیستم با ترکیب Semantic…

پلتفرم FROST با معرفی Weapon Registry، مدل تعامل عاملهای هوشمند با ابزارها را از فراخوانیهای سختافزاری به یک زرادخانهٔ پویا و نسخهبندیشده تغییر داد. این سیستم به عاملها…

یک تجربه عملی نشان میدهد که تکیه بر نظارتهای غیرفعال (Passive Hooks) در عاملهای هوشمند منجر به ایجاد بدهی فنی و خطاهای سیستمی میشود. جایگزینی این روش با «گیتهای اعتبارسنجی…

شرکت OpenAI مجموعهای از مدلهای طبقهبندی شده به نام GPT-5.6 شامل مدلهای Sol، Terra و Luna را معرفی کرد. این اقدام نشاندهنده چرخش صنعت از چتباتهای متنی به سمت مدلهای بزرگ…

پلتفرم NegotiAI با بهرهگیری از Gemini گوگل، فرآیند تدوین پیشنهادها و مدیریت اعتراضات مشتریان را خودکار میکند. این ابزار با پیشنهاد «بهترین اقدام بعدی»، نقش یک مربی استراتژیک را…

شرکت Verifly با عرضه یک سرور MCP، امکان پاکسازی و تأیید لحظهای آدرسهای ایمیل را برای عاملهای هوشمند فراهم کرد. این ابزار مانع از پذیرش ثبتنامهای جعلی یا ارسال پیام به…

بررسی یک دستیار پژوهشی مبتنی بر هوش مصنوعی نشان میدهد که مدلهای زبانی اغلب با اعتماد کامل دروغ میگویند و منابع جعلی میسازند. این یافتهها ثابت میکند که تکنیک RAG تنها یک نقطه…