پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۷۷۳ مقاله منتشر شده

چرا Gemini 2.5 Flash در پیش‌بینی دشواری وظایف شکست می‌خورد؟

چرا Gemini 2.5 Flash در پیش‌بینی دشواری وظایف شکست می‌خورد؟

ابزار جدیدی به نام کاوشگر فراشناختی نشان می‌دهد که مدل‌های پیشرو می‌توانند در یک بُعد از اطمینان دقیق باشند اما در بُعدی دیگر به‌طور کامل شکست بخورند. این یافته نقطه کوری حیاتی در…

۲ دقیقه خواندن
بنچمارک EnactToM: شکست ۱۰۰ درصدی مدل‌های پیشرو در وظایف کاربردی نظریه ذهن

بنچمارک EnactToM: شکست ۱۰۰ درصدی مدل‌های پیشرو در وظایف کاربردی نظریه ذهن

مدل‌های پیشرو در درک باورهای دیگران موفق‌اند اما در محیط‌های سه‌بعدی نمی‌توانند بر اساس این دانش عمل کنند. بنچمارک جدید EnactToM نشان می‌دهد هفت مدل برتر در تمامی وظایف دشوار…

۲ دقیقه خواندن
چرا در مقیاس Blackwell، زیرساخت شبکه به متغیر تعیین‌کننده جایگزین FLOPS شد؟

چرا در مقیاس Blackwell، زیرساخت شبکه به متغیر تعیین‌کننده جایگزین FLOPS شد؟

شرکت AWS معماری چهارلایه جدیدی را برای پشتیبانی از «سه قانون مقیاس‌پذیری» مدل‌های بنیادی معرفی کرد. این ساختار با ادغام پردازنده‌های NVIDIA Blackwell و شبکه EFAv4، تلاش می‌کند…

۲ دقیقه خواندن
گزارش بایدو: کاهش ۹۴ درصدی هزینه آموزش Ernie 5.1 در مسیر رقابت با GPT-5.5

گزارش بایدو: کاهش ۹۴ درصدی هزینه آموزش Ernie 5.1 در مسیر رقابت با GPT-5.5

مدل Ernie 5.1 شرکت بایدو با کاهش ۹۴ درصدی هزینه‌های پیش‌آموزش، جایگاه چهارم جهانی را در جدول Arena Search به دست آورد. این مدل با استفاده از یک چارچوب آموزشی الاستیک، توانسته است…

۴ دقیقه خواندن۲
چرا در ریاضیات پیشرفته، شکست‌های هوش مصنوعی ارزشمندتر از پاسخ‌های درست هستند؟

چرا در ریاضیات پیشرفته، شکست‌های هوش مصنوعی ارزشمندتر از پاسخ‌های درست هستند؟

سیستم جدید و عامل‌محور گوگل دیپ‌مایند با ثبت رکورد ۴۸ درصدی در بنچمارک FrontierMath، توانست به یک پروفسور آکسفورد در حل یک مسئله‌ی ریاضی دشوار کمک کند. این دستاورد نشان می‌دهد که…

۲ دقیقه خواندن
چرا بازیابی عامل‌محور در RRCM بر روش‌های سنتی توزیع متن غلبه می‌کند؟

چرا بازیابی عامل‌محور در RRCM بر روش‌های سنتی توزیع متن غلبه می‌کند؟

چارچوب RRCM با استفاده از GRPO به‌طور پویا تصمیم می‌گیرد چه زمانی از شواهد مشارکتی یا متادیتا برای توصیه‌ها استفاده کند. این رویکرد عامل‌محور با حذف نویز، عملکرد مدل‌های زبانی با…

۲ دقیقه خواندن۱
گزارش curl: مدل Mythos تنها یک آسیب‌پذیری کم‌اهمیت در ۱۷۸ هزار خط کد یافت

گزارش curl: مدل Mythos تنها یک آسیب‌پذیری کم‌اهمیت در ۱۷۸ هزار خط کد یافت

مدل Mythos شرکت Anthropic که با ادعای «قدرت خطرناک» در شناسایی حفره‌های امنیتی معرفی شده بود، در آزمون واقعی روی کد curl شکست خورد. این مدل تنها یک آسیب‌پذیری جزئی یافت که عملکرد…

۳ دقیقه خواندن۳
چرا توکنایزر جدید Claude Opus 4.7 هزینه‌های عملیاتی را ۳۵٪ افزایش می‌دهد؟
آموزش کاربردی

چرا توکنایزر جدید Claude Opus 4.7 هزینه‌های عملیاتی را ۳۵٪ افزایش می‌دهد؟

آنتروپیک مدل Claude Opus 4.7 را با تمرکز بر کنترل دقیق عامل‌های خودکار و بینایی با رزولوشن بالا معرفی کرد. با وجود ثابت ماندن قیمت هر توکن، تغییر در توکنایزر باعث افزایش هزینه‌های…

۲ دقیقه خواندن
پالو آلتو نتورکس: یک سال تست نفوذ دستی در ۳ هفته با هوش مصنوعی

پالو آلتو نتورکس: یک سال تست نفوذ دستی در ۳ هفته با هوش مصنوعی

گزارش‌ها نشان می‌دهد مدل‌های پیشرو مانند Claude Mythos اکنون قادرند عملیات پیچیده تست نفوذ یک‌ساله را در ۲۱ روز به پایان برسانند. این تحول، هوش مصنوعی را از یک دستیار ساده به یک…

۳ دقیقه خواندن۲
گورز: ChatGPT 5.5 Pro با ایده‌های بدیع، مسائل باز نظریه اعداد را حل کرد

گورز: ChatGPT 5.5 Pro با ایده‌های بدیع، مسائل باز نظریه اعداد را حل کرد

تیموتی گورز، برنده مدال فیلدز، گزارش می‌دهد که ChatGPT 5.5 Pro توانسته است مسائل باز در نظریه اعداد را با ایده‌هایی «کاملاً بدیع» حل کند. این دستاورد که توسط پژوهشگران تایید شده،…

۲ دقیقه خواندن
چرا حل مسائل سطح دکترا توسط ChatGPT 5.5 Pro، معیار نبوغ انسانی را تغییر می‌دهد؟

چرا حل مسائل سطح دکترا توسط ChatGPT 5.5 Pro، معیار نبوغ انسانی را تغییر می‌دهد؟

مدل ChatGPT 5.5 Pro موفق شد مسئله‌ای پیچیده در نظریه اعداد را با ارائه ایده‌هایی بدیع حل کند. این دستاورد که توسط پژوهشگران MIT تأیید شده، نشان می‌دهد مدل‌های زبانی اکنون قادر به…

۲ دقیقه خواندن۲
چرا تا سال ۲۰۲۸، مهندسی هوش مصنوعی از دست انسان خارج می‌شود؟

چرا تا سال ۲۰۲۸، مهندسی هوش مصنوعی از دست انسان خارج می‌شود؟

جک کلارک، هم‌بنیان‌گذار Anthropic، پیش‌بینی می‌کند که تا سال ۲۰۲۸ سیستم‌های هوش مصنوعی قادر خواهند بود نسخه‌های برتری از خود را به‌طور خودکار خلق کنند. این جهش، مرز بین ابزارهای…

۳ دقیقه خواندن