پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۴ مقاله منتشر شده

مقایسه معنای تکمیل و حفظ زمینه: تفاوت طراحی بین AGE Plan و برنامه‌ریزی با فایل‌ها
آموزش کاربردی

AGE Plan با مکانیزم «دروازه‌های بستار» جلوی توهم عامل‌های کدنویس را می‌گیرد

مقایسه‌ای میان AGE Plan و PwF نشان می‌دهد که در حالی که دومی بر حفظ حافظه تمرکز دارد، اولی با معرفی «دروازه‌های بستار» مانع از ادعاهای دروغین عامل‌ها درباره تکمیل وظایف می‌شود.…

۱۴ دقیقه خواندن۳
نمونه‌برداری بوت‌استرپ در خط لوله RAG: بررسی عمیق مشکل انتخاب تصادفی اسناد
آموزش کاربردی

پژوهش‌های RAG: اتصال به دانش خارجی ریسک خطای LLM را پایین می‌آورد

خط لوله‌های RAG با ترکیب بازیابی داده‌های خارجی و تولید متن، پاسخ‌های مدل‌های زبانی را به واقعیت‌های قابل راستی‌آزمایی گره می‌زنند. این سازوکار ریسک توهم مدل را کاهش داده و دسترسی…

۷ دقیقه خواندن۱
قوانین محرک‌اند، مصنوعات تصمیم‌می‌گیرند: آنچه در ۱۷ خطای عامل اندازه‌گرفتم
آموزش کاربردی

قواعد خودارزیابی در عامل‌های هوش مصنوعی هرگز خطاهای تثبیت‌شده را شکار نمی‌کنند

تحلیل ۱۷ خطای عامل‌محور نشان می‌دهد قواعد داخلی برای اندازه‌گیری مفیدند اما هرگز نمی‌توانند داور نهایی باشند. برای دستیابی به قابلیت اطمینان، توسعه‌دهندگان باید به‌جای تکیه بر…

۷ دقیقه خواندن
هوش مصنوعی چگونه باگ‌های خود را شکار می‌کند
آموزش کاربردی

ترکیب تحلیل ایستا و مدل‌های زبانی؛ فرمول BrassCoders برای شکار باگ‌های منطقی

پلتفرم BrassCoders با جداسازی شناسایی خطاهای ساختاری از استدلال‌های مبتنی بر قصد، دقت عیب‌یابی کد را افزایش داده است. این سیستم ابتدا الگوهای شناخته‌شده را با اسکنرهای قطعی…

۴ دقیقه خواندن
هوش مصنوعی: استدلال درست، اما دلایل اشتباه؟

زنجیره‌های تفکر در مدل‌های استدلالی؛ توهمِ منطق یا ابزاری برای محاسبه؟

پژوهشگران معتقدند مدل‌های استدلالی بزرگ (LRM) به‌جای تفکر واقعی، از میان‌برهای سطحی و بازیابی تقریبی برای تقلید از استدلال استفاده می‌کنند. شواهد نشان می‌دهد که «زنجیره‌های تفکر»…

۱۵ دقیقه خواندن
تحلیل هوش، عملکرد و قیمت مدل DeepSeek V4 Flash 0731 (max)

DeepSeek V4 Flash 0731: استدلال سطح بالا با قیمت ۰.۱۴ دلار برای هر میلیون توکن

دیپ‌سیک مدل V4 Flash 0731 را معرفی کرد؛ مدل استدلالی جدیدی که توازن میان هوش بالا و قیمت بسیار پایین را برقرار کرده است. این مدل در حالی پنجره متنی ۱ میلیون توکنی دارد که هزینه…

۲ دقیقه خواندن۱
آزمایش تبدیل مدل زبانی کوچک به عامل هوشمند قابل اعتماد با HUQAN و OPT-125M
آموزش کاربردی

رتبه‌بندی شواهد در HUQAN توهمات مدل ۱۲۵ میلیون پارامتری OPT را متوقف کرد

پژوهشگران با افزودن یک لایه «سلسله‌مراتب اعتماد» به مدل بسیار سبک OPT-125M، توانستند توهمات آن را به‌طور مؤثر حذف کنند. این سامانه به‌جای تکیه بر اطمینان مدل، اعتبار پاسخ‌ها را بر…

۴ دقیقه خواندن
تغییرات API دیپ‌سیک | مستندات فنی

مدل V4-Flash دیپ‌سیک در بنچمارک‌های عامل‌محور از نسخه Pro پیشی گرفت

دیپ‌سیک نسخه بتاهای عمومی V4-Flash را منتشر کرد که در وظایف اتوماسیون و کدنویسی، عملکردی فراتر از نسخه Pro-Preview دارد. این مدل بدون تغییر در معماری، تنها از طریق بهینه‌سازی‌های…

۶ دقیقه خواندن۲