
درون فضای نهانی Claude؛ رصد افکار پنهان مدل با ابزار J-lens
آنتروپیک با معرفی ابزار Jacobian lens (J-lens)، فضای نهانی از مفاهیم داخلی مدل Claude Opus 4.6 را شناسایی کرد. این تکنیک اجازه میدهد تا کلمات و تمهایی که مدل پیش از تولید پاسخ…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۱۹ مقاله منتشر شده

آنتروپیک با معرفی ابزار Jacobian lens (J-lens)، فضای نهانی از مفاهیم داخلی مدل Claude Opus 4.6 را شناسایی کرد. این تکنیک اجازه میدهد تا کلمات و تمهایی که مدل پیش از تولید پاسخ…

ارزیابیهای جدید از مدل وزنهایباز GLM 5.2 نشان میدهد این مدل میتواند اظهارنامههای مالیاتی VAT کسبوکارهای کوچک بریتانیا را با دقتی نزدیک به انسان آماده کند. پردازش ۵۹ تراکنش…

مدل جدید OpenAI با نام Sol، توانمندیهای هوش مصنوعی Claude Fable 5 را با ۶۶٪ هزینه کمتر شبیهسازی میکند. این مدل بهویژه در بنچمارکهای کدنویسی پیشتازی کرده و ساختار قیمتگذاری…

اوپنایآی با معرفی ChatGPT Work و مدل GPT-5.6، قابلیت اجرای مستقل گردشهای کاری پیچیده در چندین اپلیکیشن را فراهم کرد. این سامانه با ادغام ابزارهای سازمانی و قابلیت «وظایف…

شرکت ClauseShift با الزام مدلها به ارائهی نقلقول دقیق از متن، مشکل اعتماد به هوش مصنوعی در تحلیل قراردادها را حل کرد. این سیستم دو مدل را بهطور موازی اجرا میکند و هرگونه…

عاملهای هوش مصنوعی از دنبالکنندگان سادهی دستورات به سیستمهایی با قابلیت برنامهریزی مستقل تبدیل شدهاند. این تحول با ترکیب مدلهای زبانی بزرگ و الگوی ReAct محقق شده تا مدلها…

شرکت SpaceXAI مدل Grok 4.5 را با تمرکز بر بهینهسازی توکنها برای کارهای مهندسی و عاملمحور عرضه کرد. این مدل که با همکاری Cursor آموزش دیده، سرعت استنتاج بالا و قیمت رقابتی را…

تحلیلهای فنی نشان میدهد پیشرفت هوش مصنوعی تنها به قابلیت تأیید (Verifiability) وابسته نیست. مفاهیمی چون «قابلیت تکرار انبوه» (Grindability) تعیین میکنند که آیا توانمندی یک مدل…

روش جدیدی به نام داربست استدلالی با جایگزینی دستورات مبهم «گامبهگام فکر کن»، مدلها را مجبور به طی یک چرخه سختگیرانه از مشاهده، فرضیه، تست و نتیجهگیری میکند. این رویکرد با…

مقایسهی عملکرد مدلهای جدید نشان میدهد Grok 4.5 سریعترین و ارزانترین گزینه است، اما خانواده Claude همچنان در اجرای کدهای پیچیده و سهبعدی پیشتاز است. این آزمون بدون هیچگونه…

استارتاپ General Intuition با استفاده از میلیونها ساعت دادههای بازیهای ویدئویی، مدلی بنیادی برای هوش مصنوعی فیزیکی ساخته است. این روش اجازه میدهد رباتها حرکات پیچیده را با…

دن لو، مهندس ارشد نرمافزار، استدلال میکند که جریانهای کاری کدنویسی با هوش مصنوعی بهدلیل اتکا به بازبینی انسانی بهجای تستهای تصادفی، بهسرعت دچار افت کیفیت میشوند. او…