
تفسیرپذیری مدلهای جعبهسیاه با مکانیزم پرامپتنویسی متضاد
یک اسکنر جدید به مهندسان اجازه میدهد بدون دسترسی به وزنهای داخلی، رفتار مدلهای زبانی را از طریق مقایسه پاسخهای پایه با تغییرات متضاد تحلیل کنند. این گردشکار با استفاده از…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۸۹ مقاله منتشر شده

یک اسکنر جدید به مهندسان اجازه میدهد بدون دسترسی به وزنهای داخلی، رفتار مدلهای زبانی را از طریق مقایسه پاسخهای پایه با تغییرات متضاد تحلیل کنند. این گردشکار با استفاده از…

یک گردشکار فنی جدید امکان اجرای مدل بسیار فشرده Bonsai-27B را روی سختافزارهای معمولی فراهم کرد. کاربران با استفاده از نسخه اختصاصی PrismML از llama.cpp میتوانند این مدل ۱-بیتی…

یک ابزار متنباز جدید با ایجاد یک تورنمنت رقابتی بین مدلهای هوش مصنوعی، آنها را مجبور میکند تا کدهای یکدیگر را نقد کنند. این سیستم با پنهان کردن امتیازها و شرطی کردن مراحل بر…

بنچمارک جدید Mininglamp نشان میدهد مدلهای فعلی تنها در ۲۰٪ موارد موفق به تکمیل کامل وظایف در وب زنده میشوند. این فاصله عمیق بین «ناوبری ساده» و «اتمام عملیات»، چالش اصلی مسیر…

مدل Kimi K3 محصول Moonshot AI اولین مدل با وزنهای باز در کلاس ۳ تریلیون پارامتر است که اکنون از طریق API شرکت Telnyx در دسترس است. این مدل با پنجره متنی ۱ میلیون توکنی، رقیبی جدی…

مایکروسافت مدل تخصصی MAI-Cyber-1-Flash را معرفی کرد که در محک CyberGym از مدلهای گوگل و OpenAI پیشی گرفته است. این مدل با مدیریت ۹۰ درصد وظایف امنیتی، هزینههای عملیاتی را تا ۵۰…

یک گردشکار فنی جدید معماری خدمات مالی آنتروپیک را در پایتون بازسازی میکند تا مدلهای کلود بتوانند ارزیابیهای DCF و تحلیل شرکتهای مشابه را از طریق یک سامانه ثبت مهارت اجرا…

تزریق حجم بالای داده به عاملهای هوش مصنوعی اغلب باعث کاهش دقت و بروز اثر «گمشده در میانه» میشود. تکنیکهای جدید فشردهسازی، از جمله بازرتبهبندی و خلاصهسازی بازگشتی، با حذف…

مایکروسافت مدل فشرده و کد-محور MAI-Cyber-1-Flash را برای مدیریت ۹۰٪ وظایف امنیتی عرضه کرد. این استراتژی هزینه عملیات را نصف کرده و دقت سیستم در شناسایی تهدیدات را افزایش داده است.

شرکت MoonshotAI جزئیات معماری مدل Kimi-K3 را در گیتهاب منتشر کرد. این گزارش نشان میدهد که استراتژی این شرکت از گسترش صرفِ پنجره متنی به سمت بهینهسازی استدلال و کاهش تأخیر تغییر…

توسعه نرمافزار از نوشتن کدهای ایستا به مدیریت عاملهای خودمختار تغییر مسیر داده است. چارچوبهای جدید با ایجاد چرخه «ادراک-استدلال-عمل-تأمل»، امکان خوداصلاحی برنامهها و اجرای…

سازمان پژوهشی METR با معرفی معیار «افق هزینه»، نشان داد که عاملهای فعلی هوش مصنوعی در پروژههای پیچیده، پس از صرف چند هزار دلار، دیگر بازدهی اقتصادی ندارند. این دادهها حاکی از…