
مدل Astra شرکت OpenAI دو حفره امنیتی Zero-Day را کشف کرد
مدل جدید Astra توانست آسیبپذیریهای ناشناختهای را شناسایی و به کد تخریبی تبدیل کند. با این حال، معماری جدید این مدل باعث شده است که فرآیند استدلال داخلی آن برای ناظران انسانی…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۷ مقاله منتشر شده

مدل جدید Astra توانست آسیبپذیریهای ناشناختهای را شناسایی و به کد تخریبی تبدیل کند. با این حال، معماری جدید این مدل باعث شده است که فرآیند استدلال داخلی آن برای ناظران انسانی…

گلوگاه اصلی عاملهای هوش مصنوعی هوش مدل نیست، بلکه نبود سازوکار تأیید خروجی است. پروتکل Agateon با تبدیل تأیید به یک زیرساخت سختگیرانه، «مالیات اعتماد» و نیاز به نظارت انسانی…

سیستم هوش مصنوعی AISLE موفق شد شش حفره امنیتی جدی را در کد curl شناسایی کند، در حالی که مدلهای پیشرو OpenAI و Anthropic هیچ یافتهای نداشتند. این نتیجه نشان میدهد سامانههای…

گوگل با جایگزینی نمونهبرداری ثابت با رویکردی عاملمحور، هزینههای تحلیل ویدیوهای طولانی را بهشدت کاهش داد. این سیستم بهجای اسکن تمام ثانیهها، بهصورت هوشمند تنها فریمها و…

یک استراتژی جدید با ترکیب vLLM و کوانتش INT8، هزینه اجرای Grok-2 را به ۰.۰۰۶۷ دلار بهازای هر میلیون توکن رسانده است. این معماری، مدلهای استدلالی پیشرفته را بهشدت ارزانتر از…

یک پژوهشگر امنیتی ثابت کرد که جایگزینی پرامپتهای کلی با «قراردادهای سختگیرانه»، توهمات هوش مصنوعی را حذف و منجر به شناسایی ۴ آسیبپذیری واقعی در مخازن متنباز میشود. این متد با…

آنتروپیک با معرفی نسخههای Fable 5.1 و Mythos 5.1، هزینههای گردشکارهای عاملمحور را بهشدت کاهش داد. این بهروزرسانی بر بهبود استدلال علمی و بهینهسازی قیمتگذاری دادههای…

آزمایشگاه فیزیک Physical Superintelligence با استفاده از یک سامانه هوش مصنوعی، مسیر پروازی خلاقانهای برای ارسال کاوشگر به نزدیکترین ستاره به زمین کشف کرد. این مأموریت که توسط…

پلتفرم متنباز ctxloom با حذف گرافهای اجرای پیشفرض، رویکردی مبتنی بر حالت (State-driven) را برای مدیریت عاملهای هوش مصنوعی معرفی کرده است. در این سیستم، عاملها بهجای دنبال…

عاملهای هوش مصنوعی با ترکیب استدلال و توانایی تعامل با محیط، مدلهای زبانی را از چتباتهای ساده به سامانههایی تبدیل میکنند که قادر به اجرای مستقل گردشهای کاری پیچیده هستند.

پژوهشگران چارچوب BenchMIRT را برای تفکیک سیگنالهای متناقض در ارزیابیهای مدلهای زبانی معرفی کردند. این ابزار نشان میدهد بسیاری از محکهای «ایمنی» در واقع توان استدلال کلی را…

شرکت You.com حالت استخراج جدیدی به نام Highlights را برای API جستوجوی وب خود عرضه کرد که صحت پاسخها را به ۹۵.۱۷٪ میرساند. این ابزار در مقایسه با راهکارهای داخلی OpenAI و…