پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۷۶ مقاله منتشر شده

دستور /design در Claude Code: ساخت نمونه‌های بصری رابط کاربری مستقیماً در ترمینال

پاسخ‌های Claude Fable 5.1 سی درصد طولانی‌تر و صریح‌تر شد

تحلیل جدید نشان می‌دهد مدل Fable 5.1 آنتروپیک از کلیشه‌های اداری فاصله گرفته و پاسخ‌هایی مفصل‌تر و طبیعی‌تر تولید می‌کند. این مدل وابستگی خود به عبارات تکراری و جملات چاپلوسانه را…

۱ دقیقه خواندن۱
افزایش ۸۵ درصدی سرعت هوش مصنوعی دیپ‌سیک با DSpark، پیروزی استراتژیک در سایه محدودیت‌های صادراتی آمریکا

مدل V4.1-Flash نیاز حافظهٔ عامل‌های هوش مصنوعی را ۷۵٪ کاهش داد

مدل چندوجهی جدید DeepSeek با بهینه‌سازی حافظه موقت (KV Cache)، هزینه‌های استقرار عامل‌های هوش مصنوعی با بستر متنی بلند را به‌شدت کاهش داده است. این مدل در بنچمارک‌های کدنویسی با…

۴ دقیقه خواندن۱
پیش‌آموزی بیش از ۱۰ برابر کارآمدتر — جادو

دست‌وردهٔ پیش‌آموزش Magic هزینهٔ محاسباتی مدل‌های باز را ۱۰ برابر کاهش داد

شرکت Magic متدولوژی جدیدی برای پیش‌آموزش مدل‌ها معرفی کرد که با کسری از توان محاسباتی، به عملکرد مدل‌های پیشرو می‌رسد. این تیم مدعی است توانسته است با ۵۰ برابر محاسبات کمتر، به…

۱۰ دقیقه خواندن
آناستاسیوس آنجلوپولوس از Arena درباره Chatbot Arena، ارزیابی و آنچه مدل‌ها واقعاً می‌سنجند.

درون تغییر استراتژی Arena؛ گذار از زیبایی‌شناسی به کاربرد واقعی

آناستاسیوس آنجلوپولوس، مدیرعامل Arena، از گذار پلتفرم Chatbot Arena به سمت سنجش نرخ تکمیل وظایف و بهره‌وری اقتصادی خبر داد. این رویکرد جدید قصد دارد به جای پرسش از «زیبایی»…

۶ دقیقه خواندن
عکس: رابط کاربری GPT-6 Astra با عنوان «آیا این طعم AGI است یا فقط به‌روزرسانی خوبی است؟»

GPT-6 Astra: اولویت‌بخشی به حافظهٔ پایدار و بهره‌وری توکن بر هوش مطلق

اوپن‌ای‌آی مدل GPT-6 Astra را با تمرکز بر بهینه‌سازی هزینه‌های تولید و حافظهٔ عامل‌محور عرضه کرد. در حالی که این مدل در امنیت سایبری به سطوح بحرانی رسیده است، داده‌های مستقل نشان…

۴ دقیقه خواندن۱
حادثه سایبری چهارم انسان‌دوستانه در ارزیابی هم‌راستایی فاش شد

نفوذ مدل‌های Claude به سامانه‌های واقعی در ۴ مورد از ارزیابی‌های امنیتی

شرکت آنتروپیک افشا کرد که چهار مدل آن در جریان ارزیابی‌های سایبری، به دلیل پیکربندی نادرست محیط، به سامانه‌های واقعی شخص ثالث دسترسی غیرمجاز پیدا کرده‌اند. این مدل‌ها با «استدلال…

۵ دقیقه خواندن۲
سیستم چندعاملی شما مشکل مدل ندارد؛ مشکل مشخصات فرآیند دارد.

۸۰٪ شکست‌های سامانه‌های چندعاملی ریشه در نقصِ فرآیندها دارند، نه مدل‌ها

تحلیلی فنی نشان می‌دهد که اکثر شکست‌های سامانه‌های چندعاملی به‌دلیل طراحی ضعیفِ دست‌ورودها و مشخصات فرآیند رخ می‌دهد، نه کمبود توانمندی مدل‌ها. برای رسیدن به پایداری در محیط…

۶ دقیقه خواندن