پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۱۰۸ مقاله منتشر شده

رمزگشایی از BFQ: حذف گام‌های تکراری Denoising در RL آفلاین بدون افت عملکرد

رمزگشایی از BFQ: حذف گام‌های تکراری Denoising در RL آفلاین بدون افت عملکرد

چارچوب جدید Bootstrapped Flow Q-Learning (BFQ) امکان تولید تک‌گامی کنش‌ها را در یادگیری تقویت‌شده آفلاین فراهم می‌کند. این روش نیاز به فرآیندهای هزینه‌بر حذف نویز و شبکه‌های کمکی…

۱ دقیقه خواندن
اتوماسیون تولید مش‌های چهارضلعی با معماری عامل‌محور Dmsh

اتوماسیون تولید مش‌های چهارضلعی با معماری عامل‌محور Dmsh

چارچوب Dmsh با استفاده از یادگیری تقویت‌شده، فرآیند تجزیه هندسی و تولید مش‌های چهارضلعی را به‌طور کامل خودکار می‌کند. این سیستم با بهره‌گیری از سه عامل هماهنگ، نیاز به تنظیمات…

۱ دقیقه خواندن
NOVA: جهش ۲۹.۸ درصدی در دقت پیش‌بینی تغییر خط با رگرسیون نمادین

NOVA: جهش ۲۹.۸ درصدی در دقت پیش‌بینی تغییر خط با رگرسیون نمادین

چارچوب NOVA با استفاده از رگرسیون نمادین، مدل‌های ریاضی تفسیری از رفتار رانندگی انسان را مستخرج می‌کند. این سیستم با تکیه بر موتور Rust، دقتی به‌مراتب بالاتر از مدل‌های عصبی مبهم…

۱ دقیقه خواندن
سازوکار همگرایی MC-O-PI بدون نیاز به به‌روزرسانی یکنواخت وضعیت-کنش

سازوکار همگرایی MC-O-PI بدون نیاز به به‌روزرسانی یکنواخت وضعیت-کنش

پژوهشی جدید ثابت می‌کند که الگوریتم تکرار سیاست خوش‌بینانه مونت‌کارلو (MC-O-PI) برای رسیدن به بهینگی نیازی به مقداردهی اولیه یکنواخت وضعیت‌ها ندارد. این پیشرفت اجازه می‌دهد…

۱ دقیقه خواندن
شکاف ۲۴ درصدی در استنتاج منطقی: شکست ROME و FT در ویرایش دانش

شکاف ۲۴ درصدی در استنتاج منطقی: شکست ROME و FT در ویرایش دانش

یک بنچمارک جدید نشان می‌دهد روش‌های رایج ویرایش دانش مانند ROME و FT در حفظ سازگاری منطقی پس از به‌روزرسانی حقایق شکست می‌خورند. در حالی که مدل‌ها می‌توانند حقایق ویرایش‌شده را…

۱ دقیقه خواندن
KG-CFR: کاهش نرخ فروپاشی منطقی در ۹۵٪ از آزمون‌های استرس عامل‌های هوش مصنوعی

KG-CFR: کاهش نرخ فروپاشی منطقی در ۹۵٪ از آزمون‌های استرس عامل‌های هوش مصنوعی

پژوهشگران معماری جدیدی به نام KG-CFR معرفی کرده‌اند که با جداسازی برنامه‌ریزی داخلی از اجرای خارجی، مشکل «انحراف نقش» در بحث‌های چندعاملی را حل می‌کند. این رویکرد پایداری و کیفیت…

۲ دقیقه خواندن
سازوکار KG-SoftMAP در بازیابی ساختار شبکه‌های بیزی از داده‌های پراکنده

سازوکار KG-SoftMAP در بازیابی ساختار شبکه‌های بیزی از داده‌های پراکنده

روش KG-SoftMAP با بهره‌گیری از گراف‌های دانش به عنوان پیش‌فرض‌های منعطف، امکان بازیابی ساختار شبکه‌های بیزی را در داده‌های بسیار پراکنده فراهم می‌کند. این رویکرد اجازه می‌دهد تا…

۱ دقیقه خواندن
چرا استنتاج آفلاین در معماری AIR سرعت توصیه‌های هوش مصنوعی را ۴۰۰ برابر کرد؟

چرا استنتاج آفلاین در معماری AIR سرعت توصیه‌های هوش مصنوعی را ۴۰۰ برابر کرد؟

چارچوب AIR با انتقال استدلال مدل‌های زبانی به فاز آفلاین، گلوگاه تأخیر در سیستم‌های توصیه‌گر صنعتی را برطرف کرده است. این رویکرد در Kuaishou موجب افزایش ۳.۴۴۶ درصدی حجم کالاهای…

۱ دقیقه خواندن
چرا عامل‌های ناظر در بحث‌های هوش مصنوعی در شناسایی خطاهای خود شکست می‌خورند؟

چرا عامل‌های ناظر در بحث‌های هوش مصنوعی در شناسایی خطاهای خود شکست می‌خورند؟

تحقیقات جدید نشان می‌دهد در سیستم‌های بحث میان عامل‌ها، «ناظران» بسیار ضعیف‌تر از «سازندگان» در شناسایی شکست‌های استدلالی خود هستند. این شکاف ثابت می‌کند که سیگنال‌های اعتماد…

۱ دقیقه خواندن
مقایسه‌ای میان GRPO و REINFORCE؛ پایان وابستگی به Baseline در بهینه‌سازی ترکیبی

مقایسه‌ای میان GRPO و REINFORCE؛ پایان وابستگی به Baseline در بهینه‌سازی ترکیبی

پژوهشگران دریافتند که الگوریتم GRPO، با حذف نیاز به بیس‌لاین‌های حساس در بهینه‌سازی ترکیبی عصبی، از فروپاشی فاجعه‌بار آموزش در بنچمارک‌های مسیریابی جلوگیری می‌کند. این روش در حالی…

۱ دقیقه خواندن