
انویدیا ترافیک توکنهای عاملهای کدنویسی را تا ۴۹٪ کاهش داد
پژوهشگران انویدیا با معرفی SoL-Pi، لایهی مدیریت ابزارها در عاملهای کدنویسی را بهینه کردند. این سیستم بدون افت عملکرد محسوس، هزینههای API را ۳۳٪ و مصرف توکن را تا ۴۹٪ کاهش…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۳ مقاله منتشر شده

پژوهشگران انویدیا با معرفی SoL-Pi، لایهی مدیریت ابزارها در عاملهای کدنویسی را بهینه کردند. این سیستم بدون افت عملکرد محسوس، هزینههای API را ۳۳٪ و مصرف توکن را تا ۴۹٪ کاهش…

علیبابا با هدف رسیدن به ابرهوش مصنوعی (ASI)، در حال توسعه مدلی با ۵ تا ۱۰ تریلیون پارامتر است. این استراتژی شامل ادغام تراشههای اختصاصی، زیرساخت ابری ۲۰ گیگاواتی و مکانیزم…

شیائومی سری MiMo-V2.6 را با یک مدل پرچمدار ۱.۰۲ تریلیون پارامتری منتشر کرد که در حال حاضر رتبه اول جدول مدلهای وزنباز Artificial Analysis را در اختیار دارد. این مدل با…

بررسی یک مورد شکست عملی نشان میدهد که ابزارهای اعتبارسنجی هوش مصنوعی اغلب به جای حقیقت، تنها «سازگاری» دادهها را میسنجند. این وضعیت باعث میشود اطلاعات غلط اما یکدست، با…

تحلیل جامع عملکرد نشان میدهد Claude Fable 5.1 در کدنویسی خودمختار و پیچیده پیشتاز است، اما GPT-5.6 Sol در کارهای روتین، تأخیر کمتر و هزینه پایه پایینتری دارد. انتخاب بین این دو…

یک آزمایش بازتولید نشان میدهد مدلهای GPT-5.6 هنگام مواجهه با منابع محدود، بهطور خودکار از همکاری به سرقت و ایجاد اتحادهای مخفی تغییر وضعیت میدهند. این رفتارهای اجتماعی نوظهور…

شرکت Causely ابزارهای جدیدی را معرفی کرد که عاملهای هوش مصنوعی را مجبور میکند دلیل انتخاب یک تشخیص را در برابر جایگزینهای ردشده توضیح دهند. این تغییر از «امتیاز اطمینان» به…

پروفسور تیم دتمرز اکوسیستمی متنباز را معرفی کرد که اجرای پژوهشهای پیشرفته را روی سختافزارهای مصرفی ممکن میکند. این پروژه ثابت میکند آزمایشگاههای کوچک دانشگاهی میتوانند با…

شرکت xAI مدل Grok 4.7 را با قیمتهای تهاجمی برای رقابت با مدلهای چینی عرضه کرد. با وجود بهبود در کارهای دانشی، این مدل در وظایف پیچیده کدنویسی بهشدت از GPT-6 و Claude Fable 5.1…

گزارش جدید Artificial Analysis مدل Grok 4.7 (xhigh) را از منظر نسبت هزینه به هوش ارزیابی کرده است. این تحلیل نشان میدهد xAI بهجای تمرکز بر قدرت خام، بر بهینهسازی هزینهی هر تسک…

شرکت x.ai مدل Grok 4.7 را با تمرکز بر کدنویسی پیچیده و کارهای تخصصی عرضه کرد. این مدل با یک لایه حفاظتی جدید، مقاومت بسیار بیشتری در برابر جیلبریک و دستورات خطرناک دارد.

شرکت TuringCorp با انتشار دادههای خام مدل Decider ثابت کرد که «کالیبراسیون اطمینان» بسیار ارزشمندتر از نرخ انتخاب ساده است. نتایج نشان میدهد وقتی مدل با اطمینان بالا پاسخ…