پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۱۱۹ مقاله منتشر شده

GLM ۵.۲ تقریباً به دقت حسابدار انسانی با کمتر از ۱٪ هزینه
آموزش کاربردی

چطور GLM 5.2 دقت حسابداران انسانی را با هزینه کمتر شبیه‌سازی کرد؟

ارزیابی‌های جدید از مدل وزن‌های‌باز GLM 5.2 نشان می‌دهد این مدل می‌تواند اظهارنامه‌های مالیاتی VAT کسب‌وکارهای کوچک بریتانیا را با دقتی نزدیک به انسان آماده کند. پردازش ۵۹ تراکنش…

۸ دقیقه خواندن
پایه‌های معماری عامل‌های هوش مصنوعی خودمختار
آموزش کاربردی

الگوی ReAct؛ مکانیزم تبدیل مدل‌های زبانی به عامل‌های خودکار

عامل‌های هوش مصنوعی از دنبال‌کنندگان ساده‌ی دستورات به سیستم‌هایی با قابلیت برنامه‌ریزی مستقل تبدیل شده‌اند. این تحول با ترکیب مدل‌های زبانی بزرگ و الگوی ReAct محقق شده تا مدل‌ها…

۱۰ دقیقه خواندن
انتشار Grok 4.5 توسط SpaceXAI: مدل آموزش‌دیده با Cursor برای کدنویسی، وظایف عاملی و کار دانشی با قیمت ۲ دلار به ازای میلیون ت

Grok 4.5 در برابر Opus 4.8؛ بهینه‌سازی برای گردش‌های کاری نرم‌افزاری

شرکت SpaceXAI مدل Grok 4.5 را با تمرکز بر بهینه‎‌سازی توکن‌ها برای کارهای مهندسی و عامل‌محور عرضه کرد. این مدل که با همکاری Cursor آموزش دیده، سرعت استنتاج بالا و قیمت رقابتی را…

۴ دقیقه خواندن
تصویر شماتیک: آناتومی یک محیط خوب — وقتی قابلیت تأیید به تنهایی کافی نیست

«فراتر از تأیید-پذیری»؛ شرط لازم برای تکامل واقعی مدل‌های هوشمند

تحلیل‌های فنی نشان می‌دهد پیشرفت هوش مصنوعی تنها به قابلیت تأیید (Verifiability) وابسته نیست. مفاهیمی چون «قابلیت تکرار انبوه» (Grindability) تعیین می‌کنند که آیا توانمندی یک مدل…

۲ دقیقه خواندن
بیش از «گام‌به‌گام فکر کن»: ساختار استدلال برای واداشتن هوش مصنوعی به تفکر واقعی
آموزش کاربردی

رویکرد Scaffolds: جایگزینی الگوهای آماری با چرخهٔ چهارگانهٔ استدلال

روش جدیدی به نام داربست استدلالی با جایگزینی دستورات مبهم «گام‌به‌گام فکر کن»، مدل‌ها را مجبور به طی یک چرخه سخت‌گیرانه از مشاهده، فرضیه، تست و نتیجه‌گیری می‌کند. این رویکرد با…

۱۵ دقیقه خواندن
گروک ۴.۵، جی‌پی‌تی ۵.۵ و کلود در حال ساخت یک اپلیکیشن مشابه
آموزش کاربردی

Grok 4.5 سرعت استنتاج را دوبرابر کرد اما در کدنویسی سه‌بعدی شکست خورد

مقایسه‌ی عملکرد مدل‌های جدید نشان می‌دهد Grok 4.5 سریع‌ترین و ارزان‌ترین گزینه است، اما خانواده Claude همچنان در اجرای کدهای پیچیده و سه‌بعدی پیشتاز است. این آزمون بدون هیچ‌گونه…

۵ دقیقه خواندن
شرط ۲.۳ میلیارد دلاری جنرال اینتویشن: بازی‌های ویدیویی می‌توانند عامل‌های هوش مصنوعی را برای دنیای واقعی آموزش دهند.

آموزش ربات‌ها با داده‌های بازی‌های ویدئویی؛ کاهش زمان یادگیری به ۸ دقیقه

استارتاپ General Intuition با استفاده از میلیون‌ها ساعت داده‌های بازی‌های ویدئویی، مدلی بنیادی برای هوش مصنوعی فیزیکی ساخته است. این روش اجازه می‌دهد ربات‌ها حرکات پیچیده را با…

۳ دقیقه خواندن
فرآیندهای تست عاملی، معیارهای LLM و یادداشت‌هایی درباره کدنویسی عاملی از جزایر گالاپاگوس

تست‌های تصادفی در برابر بازبینی انسانی در مقیاس‌پذیری کدنویسی هوش مصنوعی

دن لو، مهندس ارشد نرم‌افزار، استدلال می‌کند که جریان‌های کاری کدنویسی با هوش مصنوعی به‌دلیل اتکا به بازبینی انسانی به‌جای تست‌های تصادفی، به‌سرعت دچار افت کیفیت می‌شوند. او…

۷۱ دقیقه خواندن