پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۷ مقاله منتشر شده

نمونه‌ای کوچک برای بررسی هزینه‌محور باگ‌ها
آموزش کاربردی

«شکاف خوش‌بینی»؛ توهم موفقیت در عیب‌یابی AI بر اساس متادیتا

یک نمونه اولیه پایتونی با معرفی سیاست‌های «هزینه-آگاه»، استراتژی جمع‌آوری شواهد در عیب‌یابی کد را بازتعریف می‌کند. این پروژه یک «شکاف خوش‌بینی» خطرناک را افشا کرد: شواهد مبتنی بر…

۷ دقیقه خواندن۱
GLM ۵.۲ تقریباً به دقت حسابدار انسانی با کمتر از ۱٪ هزینه
آموزش کاربردی

چطور GLM 5.2 دقت حسابداران انسانی را با هزینه کمتر شبیه‌سازی کرد؟

ارزیابی‌های جدید از مدل وزن‌های‌باز GLM 5.2 نشان می‌دهد این مدل می‌تواند اظهارنامه‌های مالیاتی VAT کسب‌وکارهای کوچک بریتانیا را با دقتی نزدیک به انسان آماده کند. پردازش ۵۹ تراکنش…

۸ دقیقه خواندن
پایه‌های معماری عامل‌های هوش مصنوعی خودمختار
آموزش کاربردی

الگوی ReAct؛ مکانیزم تبدیل مدل‌های زبانی به عامل‌های خودکار

عامل‌های هوش مصنوعی از دنبال‌کنندگان ساده‌ی دستورات به سیستم‌هایی با قابلیت برنامه‌ریزی مستقل تبدیل شده‌اند. این تحول با ترکیب مدل‌های زبانی بزرگ و الگوی ReAct محقق شده تا مدل‌ها…

۱۰ دقیقه خواندن
انتشار Grok 4.5 توسط SpaceXAI: مدل آموزش‌دیده با Cursor برای کدنویسی، وظایف عاملی و کار دانشی با قیمت ۲ دلار به ازای میلیون ت

Grok 4.5 در برابر Opus 4.8؛ بهینه‌سازی برای گردش‌های کاری نرم‌افزاری

شرکت SpaceXAI مدل Grok 4.5 را با تمرکز بر بهینه‎‌سازی توکن‌ها برای کارهای مهندسی و عامل‌محور عرضه کرد. این مدل که با همکاری Cursor آموزش دیده، سرعت استنتاج بالا و قیمت رقابتی را…

۴ دقیقه خواندن
تصویر شماتیک: آناتومی یک محیط خوب — وقتی قابلیت تأیید به تنهایی کافی نیست

«فراتر از تأیید-پذیری»؛ شرط لازم برای تکامل واقعی مدل‌های هوشمند

تحلیل‌های فنی نشان می‌دهد پیشرفت هوش مصنوعی تنها به قابلیت تأیید (Verifiability) وابسته نیست. مفاهیمی چون «قابلیت تکرار انبوه» (Grindability) تعیین می‌کنند که آیا توانمندی یک مدل…

۲ دقیقه خواندن