پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۰۹۸ مقاله منتشر شده

مقایسه عملکرد و هزینه مدل‌های GPT-5.6 Sol و Fable 5 در بنچمارک‌های ترکیبی

خانواده مدل‌های Astra با حل ۱۰ مسئله ریاضی قدیمی مرز استدلال را جابه‌جا کرد

مدل‌های جدید OpenAI با نام Astra توانستند ۱۰ مسئله پیچیده ریاضی و علوم کامپیوتر را که بیش از یک دهه حل‌نشده مانده بودند، گره‌گشایی کنند. این دستاورد نشان‌دهنده تغییر استراتژی…

۵ دقیقه خواندن۲
مقایسه هوش مصنوعی: تفاوت LLM و یادگیری عمیق
آموزش کاربردی

مدل‌های زبانی در برابر یادگیری عمیق؛ تحلیل مرز استدلال و بازنمایی

یک راهنمای عملی جدید نشان می‌دهد که مدل‌های زبانی بزرگ، زیرمجموعه‌ای تخصصی از یادگیری عمیق هستند و نه جایگزینی برای آن. توسعه‌دهندگان می‌توانند با جداسازی مدل‌های بردارساز و مولد،…

۴ دقیقه خواندن
مقایسه معنای تکمیل و حفظ زمینه: تفاوت طراحی بین AGE Plan و برنامه‌ریزی با فایل‌ها
آموزش کاربردی

AGE Plan با مکانیزم «دروازه‌های بستار» جلوی توهم عامل‌های کدنویس را می‌گیرد

مقایسه‌ای میان AGE Plan و PwF نشان می‌دهد که در حالی که دومی بر حفظ حافظه تمرکز دارد، اولی با معرفی «دروازه‌های بستار» مانع از ادعاهای دروغین عامل‌ها درباره تکمیل وظایف می‌شود.…

۱۴ دقیقه خواندن۱
نمونه‌برداری بوت‌استرپ در خط لوله RAG: بررسی عمیق مشکل انتخاب تصادفی اسناد
آموزش کاربردی

پژوهش‌های RAG: اتصال به دانش خارجی ریسک خطای LLM را پایین می‌آورد

خط لوله‌های RAG با ترکیب بازیابی داده‌های خارجی و تولید متن، پاسخ‌های مدل‌های زبانی را به واقعیت‌های قابل راستی‌آزمایی گره می‌زنند. این سازوکار ریسک توهم مدل را کاهش داده و دسترسی…

۷ دقیقه خواندن
قوانین محرک‌اند، مصنوعات تصمیم‌می‌گیرند: آنچه در ۱۷ خطای عامل اندازه‌گرفتم
آموزش کاربردی

قواعد خودارزیابی در عامل‌های هوش مصنوعی هرگز خطاهای تثبیت‌شده را شکار نمی‌کنند

تحلیل ۱۷ خطای عامل‌محور نشان می‌دهد قواعد داخلی برای اندازه‌گیری مفیدند اما هرگز نمی‌توانند داور نهایی باشند. برای دستیابی به قابلیت اطمینان، توسعه‌دهندگان باید به‌جای تکیه بر…

۷ دقیقه خواندن
معیار ORCA: آمادگی عوامل زبانی برای پاسخگویی به حوادث عملیاتی چقدر است؟

عامل‌های هوش مصنوعی در ۷۵٪ سناریوهای عملیاتی SRE شکست می‌خورند

محک جدید ORCA-bench نشان می‌دهد که پیشرفته‌ترین عامل‌های کدنویسی در تحلیل ریشه‌ای حوادث تولید (Production) ناتوان‌اند. این یافته‌ها شکاف عمیقی را میان قدرت کدنویسی مدل‌ها و…

۲ دقیقه خواندن
هوش مصنوعی چگونه باگ‌های خود را شکار می‌کند
آموزش کاربردی

ترکیب تحلیل ایستا و مدل‌های زبانی؛ فرمول BrassCoders برای شکار باگ‌های منطقی

پلتفرم BrassCoders با جداسازی شناسایی خطاهای ساختاری از استدلال‌های مبتنی بر قصد، دقت عیب‌یابی کد را افزایش داده است. این سیستم ابتدا الگوهای شناخته‌شده را با اسکنرهای قطعی…

۴ دقیقه خواندن
هوش مصنوعی: استدلال درست، اما دلایل اشتباه؟

زنجیره‌های تفکر در مدل‌های استدلالی؛ توهمِ منطق یا ابزاری برای محاسبه؟

پژوهشگران معتقدند مدل‌های استدلالی بزرگ (LRM) به‌جای تفکر واقعی، از میان‌برهای سطحی و بازیابی تقریبی برای تقلید از استدلال استفاده می‌کنند. شواهد نشان می‌دهد که «زنجیره‌های تفکر»…

۱۵ دقیقه خواندن
تحلیل هوش، عملکرد و قیمت مدل DeepSeek V4 Flash 0731 (max)

DeepSeek V4 Flash 0731: استدلال سطح بالا با قیمت ۰.۱۴ دلار برای هر میلیون توکن

دیپ‌سیک مدل V4 Flash 0731 را معرفی کرد؛ مدل استدلالی جدیدی که توازن میان هوش بالا و قیمت بسیار پایین را برقرار کرده است. این مدل در حالی پنجره متنی ۱ میلیون توکنی دارد که هزینه…

۲ دقیقه خواندن۱
آزمایش تبدیل مدل زبانی کوچک به عامل هوشمند قابل اعتماد با HUQAN و OPT-125M
آموزش کاربردی

رتبه‌بندی شواهد در HUQAN توهمات مدل ۱۲۵ میلیون پارامتری OPT را متوقف کرد

پژوهشگران با افزودن یک لایه «سلسله‌مراتب اعتماد» به مدل بسیار سبک OPT-125M، توانستند توهمات آن را به‌طور مؤثر حذف کنند. این سامانه به‌جای تکیه بر اطمینان مدل، اعتبار پاسخ‌ها را بر…

۴ دقیقه خواندن