
«دور زدن خودکار دیوارههای آتش» با کمک مدل کلود اپوس ۴.۷
ایان کارول، پژوهشگر امنیتی، با استفاده از مدل کلود اپوس ۴.۷ توانست یک آسیبپذیری بحرانی در سامانه Front Gate Tickets پیدا کند. این حادثه نشان میدهد هوش مصنوعی اکنون قادر است…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۱۳ مقاله منتشر شده

ایان کارول، پژوهشگر امنیتی، با استفاده از مدل کلود اپوس ۴.۷ توانست یک آسیبپذیری بحرانی در سامانه Front Gate Tickets پیدا کند. این حادثه نشان میدهد هوش مصنوعی اکنون قادر است…

محک جدید GPTNT نشان داد که هیچ مدل زبانی بزرگی، اعم از متنباز یا تجاری، قادر به مدیریت همکاریهای آنی تحت فشار نیست. این آزمایش شکافی بحرانی در توانایی مدلها برای مدیریت عدم…

انویدیا با معرفی مدل وزنباز Nemotron-Labs-TwoTower، رمزگشایی متوالی توکنها را با فرآیند انتشار موازی جایگزین کرد. این مدل در حالی توان عملیاتی تولید را بیش از دو برابر افزایش…

یافتههای جدید Inithouse نشان میدهد عاملهایی که بهجای متنهای طولانی، خروجیهای عددی و احتمالی میدهند، نرخ تعامل بالاتری دارند. این رویکرد با ایجاد نقاط مقایسهی دقیق، قابلیت…

یک پیادهسازی جدید نشان میدهد چگونه میتوان با ترکیب دو مدل زبانی، سیستمی برای تولید و بازبینی خودکار کد پایتون ساخت. استفاده از مدل قیمتگذاری ثابت در پلتفرم Oxlo.ai اجازه…

پژوهشی جدید نشان میدهد تعامد (Orthogonalization) ماتریس حافظه در مدلهای mLSTM، توانایی بازیابی اطلاعات در محیطهای نویزی را بهشدت افزایش میدهد. این تکنیک مانع از حذف خاطرات…

آنتروپیک و گوگل دیپمایند با معرفی مدلهای فوقسریع، رقابت را از «هوش» به «سرعت» تغییر دادند. مدل Sonnet 5 بر استدلال آنی تمرکز دارد و DiffusionGemma تولید تصویر با وزنهای باز را…

تبدیل مدلهای زبانی از حالت پاسخدهنده به عاملهای خودکار، نیازمند افزودن لایههای ساختاری برای حافظه، استدلال و دسترسی به ابزارها است. این معماری به توسعهدهندگان اجازه میدهد…

محک جدید ScarfBench نشان میدهد عاملهای هوش مصنوعی در مهاجرت اپلیکیشنهای سازمانی جاوا با شکست مواجهاند. با وجود تولید کدهای قابل کامپایل، این مدلها در حفظ رفتار عملیاتی سیستم…
آنتروپیک مدل Sonnet 5 را برای اجرای خودکار ابزارها و برنامهریزیهای پیچیده عرضه کرد. این مدل عملکرد مشابه Opus 4.8 را با قیمتی بسیار پایینتر ارائه میدهد.

یک توسعهدهنده با طراحی گردشکاری سیستماتیک در Claude، خطاهای لبهای و نشت حافظه را شناسایی میکند که معمولاً از چشم بازبینهای انسانی دور میمانند. این متد بر پرسشهای هدفمند…

تحلیلی مفهومی نشان میدهد که برخلاف انسانها که کلمات را از ایدههای درونی میسازند، مدلهای زبانی ایدهها را به عنوان محصول جانبی پیشبینی کلمات تولید میکنند. این تفاوت ساختاری،…