پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۷۶ مقاله منتشر شده

AI

CogCAPTCHA30 و شکاف فرآیندی: چرا مدل‌های پیشرو در استدلال کمتر شبیه انسان هستند؟

پژوهشی جدید با معرفی «تست تورینگ فرآیندی» نشان می‌دهد که مدل‌های پیشرو با وجود ارائه پاسخ‌های صحیح، مسیری کاملاً متفاوت از انسان برای رسیدن به جواب طی می‌کنند. این مطالعه فاش…

۳ دقیقه خواندن۱
AI

چرا وزن‌های مدل، گلوگاه واقعی عامل‌های هوش مصنوعی نیستند؟

پژوهشگران استنفورد و متا استدلال می‌کنند که عامل‌های هوش مصنوعی تنها یک مدل زبانی نیستند، بلکه ترکیبی از مدل و یک «هارنس» نرم‌افزاری‌اند. این لایه‌ی کد اجرایی است که تداوم وضعیت،…

۳ دقیقه خواندن
AI

RSI در برابر AGI: چرا خود-بهبودبخشی هدف جدید آزمایشگاه‌های هوش مصنوعی است؟

آزمایشگاه‌های هوش مصنوعی از هدف مبهم AGI به سمت RSI یا «خود-بهبودبخشی بازگشتی» حرکت کرده‌اند. هدف، ساخت سیستم‌هایی است که بتوانند بدون دخالت انسان، کد و معماری خود را ارتقا دهند.

۲ دقیقه خواندن۱
AI

چگونه GPT-5.5 مصرف توکن‌های برنامه‌نویسی را در پلتفرم Oz تا ۳۰٪ کاهش داد؟

شرکت Warp با معرفی پلتفرم Oz و بهره‌گیری از GPT-5.5، ۹۰٪ از Pull Requestهای خود را خودکار کرده است. این رویکرد «توسعه‌ی عامل‌محور»، باعث رشد ۳۵ برابری درآمد سالانه‌ی این شرکت شده…

۳ دقیقه خواندن
AI

بنچمارک ITBench-AA: نرخ موفقیت مدل‌های پیشرو در وظایف SRE کمتر از ۵۰٪ است

یک بنچمارک جدید از IBM و Artificial Analysis نشان می‌دهد که پیشرفته‌ترین مدل‌های هوش مصنوعی در عیب‌یابی زیرساخت‌های سازمانی شکست می‌خورند. یافته‌ها حاکی از یک رابطه معکوس…

۳ دقیقه خواندن