
DeepSeek V4 Flash: برابری با GPT-5.6 Luna با هزینه ۶۰٪ کمتر
مدل جدید DeepSeek V4 Flash 0731 در بنچمارکهای هوش مصنوعی با GPT-5.6 Luna برابری کرد، اما هزینهی عملیاتی را ۶۰٪ کاهش داد. این بهروزرسانی جهشی در توانمندیهای عاملمحور و کاهش…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۸۸ مقاله منتشر شده

مدل جدید DeepSeek V4 Flash 0731 در بنچمارکهای هوش مصنوعی با GPT-5.6 Luna برابری کرد، اما هزینهی عملیاتی را ۶۰٪ کاهش داد. این بهروزرسانی جهشی در توانمندیهای عاملمحور و کاهش…

پلتفرم BrassCoders با جداسازی شناسایی خطاهای ساختاری از استدلالهای مبتنی بر قصد، دقت عیبیابی کد را افزایش داده است. این سیستم ابتدا الگوهای شناختهشده را با اسکنرهای قطعی…

پژوهشگران معتقدند مدلهای استدلالی بزرگ (LRM) بهجای تفکر واقعی، از میانبرهای سطحی و بازیابی تقریبی برای تقلید از استدلال استفاده میکنند. شواهد نشان میدهد که «زنجیرههای تفکر»…

دیپسیک مدل V4 Flash 0731 را معرفی کرد؛ مدل استدلالی جدیدی که توازن میان هوش بالا و قیمت بسیار پایین را برقرار کرده است. این مدل در حالی پنجره متنی ۱ میلیون توکنی دارد که هزینه…

پژوهشگران با افزودن یک لایه «سلسلهمراتب اعتماد» به مدل بسیار سبک OPT-125M، توانستند توهمات آن را بهطور مؤثر حذف کنند. این سامانه بهجای تکیه بر اطمینان مدل، اعتبار پاسخها را بر…

شرکت DebugAI دریافت که نمرات اطمینان (Confidence Scores) تولید شده توسط هوش مصنوعی، اغلب با صحت واقعی کد متضاد هستند. برای حل این مشکل، آنها سیستم خود-ارزیابی را با بررسیهای…

دیپسیک نسخه بتاهای عمومی V4-Flash را منتشر کرد که در وظایف اتوماسیون و کدنویسی، عملکردی فراتر از نسخه Pro-Preview دارد. این مدل بدون تغییر در معماری، تنها از طریق بهینهسازیهای…

موتور جدید neuro-symbolic با نام PRISMA از طریق جایگزینی حافظه احتمالی با منطق قطعی، توهمات LLM را حذف میکند. این سیستم که با پایتون ساخته شده، امکان ابطال لحظهای حقایق و اجرای…

یک رویکرد جدید در مسیریابی توکنها پیشنهاد میکند که حجم کاری عاملها بر اساس دشواری تقسیم شود. با ارسال وظایف ساده به مدلهای ارزان و رزرو مدلهای پیشرو برای استدلالهای پیچیده،…

ارائهدهندگان پیشرو هوش مصنوعی در حال جایگزینی متون قابلانتقال با بلوکهای رمزنگاریشده هستند تا کاربران را در اکوسیستم خود حبس کنند. این تغییر باعث میشود انتقال تاریخچهٔ کامل…

روش جدید Sequential Clarification Engine با جایگزینی پرامپتهای ایستا با یک پروتکل چهارمرحلهای، توهمات ناشی از فرضهای غلط را حذف میکند. این سیستم با اولویت دادن به تشخیص نیازها…

یک تحلیل فنی فاش کرد که بنچمارک LOCOMO بهطور عمدی مدلها را از پذیرش «نمیدانم» منع کرده و پرسشهای چالشی را حذف میکند. این ساختار باعث ایجاد سقفی مصنوعی از صحت میشود که…