پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۷۸۸ مقاله منتشر شده

هوش مصنوعی چگونه باگ‌های خود را شکار می‌کند
آموزش کاربردی

ترکیب تحلیل ایستا و مدل‌های زبانی؛ فرمول BrassCoders برای شکار باگ‌های منطقی

پلتفرم BrassCoders با جداسازی شناسایی خطاهای ساختاری از استدلال‌های مبتنی بر قصد، دقت عیب‌یابی کد را افزایش داده است. این سیستم ابتدا الگوهای شناخته‌شده را با اسکنرهای قطعی…

۴ دقیقه خواندن
هوش مصنوعی: استدلال درست، اما دلایل اشتباه؟

زنجیره‌های تفکر در مدل‌های استدلالی؛ توهمِ منطق یا ابزاری برای محاسبه؟

پژوهشگران معتقدند مدل‌های استدلالی بزرگ (LRM) به‌جای تفکر واقعی، از میان‌برهای سطحی و بازیابی تقریبی برای تقلید از استدلال استفاده می‌کنند. شواهد نشان می‌دهد که «زنجیره‌های تفکر»…

۱۵ دقیقه خواندن
تحلیل هوش، عملکرد و قیمت مدل DeepSeek V4 Flash 0731 (max)

DeepSeek V4 Flash 0731: استدلال سطح بالا با قیمت ۰.۱۴ دلار برای هر میلیون توکن

دیپ‌سیک مدل V4 Flash 0731 را معرفی کرد؛ مدل استدلالی جدیدی که توازن میان هوش بالا و قیمت بسیار پایین را برقرار کرده است. این مدل در حالی پنجره متنی ۱ میلیون توکنی دارد که هزینه…

۲ دقیقه خواندن۱
آزمایش تبدیل مدل زبانی کوچک به عامل هوشمند قابل اعتماد با HUQAN و OPT-125M
آموزش کاربردی

رتبه‌بندی شواهد در HUQAN توهمات مدل ۱۲۵ میلیون پارامتری OPT را متوقف کرد

پژوهشگران با افزودن یک لایه «سلسله‌مراتب اعتماد» به مدل بسیار سبک OPT-125M، توانستند توهمات آن را به‌طور مؤثر حذف کنند. این سامانه به‌جای تکیه بر اطمینان مدل، اعتبار پاسخ‌ها را بر…

۴ دقیقه خواندن
تغییرات API دیپ‌سیک | مستندات فنی

مدل V4-Flash دیپ‌سیک در بنچمارک‌های عامل‌محور از نسخه Pro پیشی گرفت

دیپ‌سیک نسخه بتاهای عمومی V4-Flash را منتشر کرد که در وظایف اتوماسیون و کدنویسی، عملکردی فراتر از نسخه Pro-Preview دارد. این مدل بدون تغییر در معماری، تنها از طریق بهینه‌سازی‌های…

۶ دقیقه خواندن۳
راهنمای مسیریابی ۸۰/۲۰: کاهش ۷۰٪+ هزینه عامل هوش مصنوعی بدون افت کیفیت
آموزش کاربردی

«مدل‌های ارزان برای وظایف ساده»؛ راهکاری برای کاهش ۷۰ درصدی مخارج

یک رویکرد جدید در مسیریابی توکن‌ها پیشنهاد می‌کند که حجم کاری عامل‌ها بر اساس دشواری تقسیم شود. با ارسال وظایف ساده به مدل‌های ارزان و رزرو مدل‌های پیشرو برای استدلال‌های پیچیده،…

۵ دقیقه خواندن
نشستی که نمی‌توانی با خود ببری | ارندیل

بلوک‌های رمزنگاری‌شده در برابر متون قابل‌انتقال؛ نبرد برای مالکیت تاریخچهٔ کاربر

ارائه‌دهندگان پیشرو هوش مصنوعی در حال جایگزینی متون قابل‌انتقال با بلوک‌های رمزنگاری‌شده هستند تا کاربران را در اکوسیستم خود حبس کنند. این تغییر باعث می‌شود انتقال تاریخچهٔ کامل…

۱۲ دقیقه خواندن۱
تصویری از یک سیستم ساختاریافته برای نوشتن پرامپت هوشمندانه‌تر با هوش مصنوعی
آموزش کاربردی

موتور شفاف‌سازی متوالی: راهکاری برای حذف چرخه‌های تکرار در خروجی‌های هوش مصنوعی

روش جدید Sequential Clarification Engine با جایگزینی پرامپت‌های ایستا با یک پروتکل چهارمرحله‌ای، توهمات ناشی از فرض‌های غلط را حذف می‌کند. این سیستم با اولویت دادن به تشخیص نیازها…

۸ دقیقه خواندن۲
معیار سنجش حافظه هوش مصنوعی که همه از آن نقل می‌کنند، گفتن «نمی‌دانم» را ممنوع کرده است

محک LOCOMO با حذف پرسش‌های خصمانه، توهمِ دقت در حافظهٔ عامل‌ها را می‌سازد

یک تحلیل فنی فاش کرد که بنچمارک LOCOMO به‌طور عمدی مدل‌ها را از پذیرش «نمی‌دانم» منع کرده و پرسش‌های چالشی را حذف می‌کند. این ساختار باعث ایجاد سقفی مصنوعی از صحت می‌شود که…

۸ دقیقه خواندن۲