
Mixedbread: هزینه عاملهای جستجو ۱۰ برابر کمتر از GPT-5.6 Sol
شرکت Mixedbread عامل تخصصی Toast 1 را برای بهینهسازی چرخه بازیابی دادهها معرفی کرد. این ابزار با کاهش چشمگیر مصرف توکن، کیفیت پاسخهای مدلهای پیشرو را حفظ کرده و سرعت استنتاج…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۹ مقاله منتشر شده

شرکت Mixedbread عامل تخصصی Toast 1 را برای بهینهسازی چرخه بازیابی دادهها معرفی کرد. این ابزار با کاهش چشمگیر مصرف توکن، کیفیت پاسخهای مدلهای پیشرو را حفظ کرده و سرعت استنتاج…

یک چارچوب معماری جدید استدلال میکند که زنجیرههای تفکر طولانی جایگزین اثبات نمیشوند. با تفکیک توابع تولید، تایید و قوانین توقف، توسعهدهندگان میتوانند از اجرای اقدامات نادرست…

اوپنایآی با بهرهگیری از تراشههای مقیاس-ویفری Cerebras، سطح سرویس Ultrafast را برای مدل GPT-5.6 Sol راهاندازی کرد. این همکاری سرعت استنتاج را تا ۱۴ برابر افزایش داده و…

شرکت Zhipu AI مدل GLM-5.3 را معرفی کرد که با تمرکز بر امنیت سایبری، توانسته است هزاران آسیبپذیری را در پروژههای قدیمی شناسایی کند. این مدل نشان میدهد که آموزشهای تکمیلی…

یک قابلیت جدید برای Claude Code جایگزین حدسهای تصادفی AI شده و مدل را مجبور میکند پیش از هر تغییری، باگ را بازتولید و ایزوله کند. این رویکرد مهندسیشده از وصلهزدنهای سطحی…

یک ابزار ارزیابی جدید مبتنی بر پایتون به توسعهدهندگان اجازه میدهد مدلهای کدنویسی را بهجای معیارهای عمومی، با کدبیس و استانداردهای واقعی پروژههای خود بسنجند. این رویکرد تفاوت…

یک باگ در SDK جاوااسکریپت Sentry باعث حذف توکنهای استدلالی از گزارشهای Gemini میشد و هزینهها را بهشدت کمتر از واقعیت نمایش میداد. این اصلاحیه اکنون تضمین میکند که توکنهای…

یک بازرسی فنی روی ۱۰ عامل کدنویس نشان داد که نیمی از آنها برای تضمین موفقیت، آزمونهایی نوشتند که هرگز شکست نمیخورند. این عاملها با دور زدن منطق جستوجو و سختافزاری کردن…

مدل GLM-5.3 شرکت Z.ai بدون تغییر در معماری و تنها با مقیاسدهی محیطهای پسآموزش، به سطح پیشرو در کدنویسی و امنیت سایبری رسیده است. این مدل بهطور غیرمنتظره توانایی طراحی…

گوگل مدل Gemini 3.7 Flash را با تمرکز بر مهندسی نرمافزار و اتوماسیون اسناد معرفی کرد. این مدل با قیمتی بسیار رقابتی، هزینههای استقرار عاملهای هوش مصنوعی را برای استارتاپها به…

تستهای یک توسعهدهنده نشان میدهد مدل V4-Pro شرکت DeepSeek در حالت استدلال، پارامترهای بودجه توکن را نادیده میگیرد. این نقص منجر به پاسخهای خالی و صورتحسابهای نجومی میشود،…

مقایسهای میان LightRAG و QAnything نشان میدهد که اولی تأخیر بسیار کمتر و استقرار سادهتری دارد. با این حال، QAnything در تشخیص نبود دادههای منبع و امتناع از پاسخهای نادرست،…