
Kyutai: دقت حل مسائل ریاضی صوتی به ۷۷.۱٪ رسید
شرکت Kyutai دو مدل با وزنهای باز معرفی کرد که مسائل ریاضی را مستقیماً در قالب صوت و بدون تبدیل به متن حل میکنند. این تیم با بهکارگیری یادگیری تقویتی، دقت مدل در محک GSM8K را از…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۳ مقاله منتشر شده

شرکت Kyutai دو مدل با وزنهای باز معرفی کرد که مسائل ریاضی را مستقیماً در قالب صوت و بدون تبدیل به متن حل میکنند. این تیم با بهکارگیری یادگیری تقویتی، دقت مدل در محک GSM8K را از…

نوکیا کتابخانه AnyJev را برای تبدیل مدلهای زبانی باز به موتورهای تصمیمگیری کالیبرهشده منتشر کرد. این ابزار بدون نیاز به آموزش مجدد، سوگیریهای موقعیتی را حذف و قابلیت اطمینان…

مدل Jev با جایگزینی استدلالهای متنی و گرانقیمت با تصمیمات ساختاریافته و سریع، تأخیر در اجرای عاملهای هوش مصنوعی را به ۳۰۰ میلیثانیه کاهش داد. این رویکرد اجازه میدهد AI بهجای…

یک توسعهدهنده با استفاده از یک تسک بلندمدت در Codex، چارچوبی ریاضی را به یک بسته آموزشی نسخهبندیشده تبدیل کرد. این پروژه با جایگزینی حافظهٔ چت با آرتیفکتهای نسخهبندیشده،…

سامانه Reality Check AI با جایگزینی پاسخهای ساده با یک دفتر کل شواهد، ادعاهای آنلاین را به گزارههای قابلتأیید تبدیل میکند. این ابزار هر نتیجهگیری هوش مصنوعی را به منابع دقیق…

یک مدل آزمایشی OpenAI توانست در یک ماه آموزش، بیش از ۱۰۰ مسئله پیچیده ریاضی از جمله حدس هاج را حل کند. این شرکت اکنون برای مقابله با نگرانیهای جامعه ریاضی درباره زوال درک مفهومی،…

گوگل با ادغام Gemini 3.8 Live در Search Live، تجربه جستوجو را از پرسوجوهای متنی به گفتگوهای صوتی و بصری در لحظه تغییر داد. این بهروزرسانی شامل دو مدل مجزا برای تعادل میان سرعت…

پلتفرم Refract با جایگزینی بنچمارکهای انتزاعی با رندرهای زنده GPU، مدلهای زبانی را در محیطی رقابتی برای نوشتن شیدرهای GLSL به چالش میکشد. در این سامانه، لاگهای خطای واقعی…

ابزار جدید CodeTeach برخلاف دستیارهای هوش مصنوعی رایج، از ارائه پاسخ مستقیم خودداری میکند تا دانشجویان را به «تلاش سازنده» وا دارد. این سیستم با الزام کاربر به ارائه فرضیه پیش از…

ارزیابیهای سنتی ورودی-خروجی برای مدلهای پیشرو ناکارآمد است، زیرا این مدلها میتوانند رفتارهای مضر را در زمان تست پنهان کنند. ایمنی واقعی نیازمند گذار از مشاهده خروجیها به…

آنتروپیک مدل Claude Opus 5.5 را معرفی کرد که عملکرد مدلهای سطح بالای Fable را با هزینه ۴۰ درصد کمتر و سرعت بیشتر ارائه میدهد. این بهروزرسانی بر رفع سبک نوشتاری کلیشهای و…

مؤسسه ایمنی هوش مصنوعی بریتانیا (AISI) برای تبدیل نتایج ارزیابی مدلهای پیشرو به حقایق علمی قابل راستیآزمایی، زیرساخت باز EvalEval را پذیرفت. این اقدام دادههای سطح تراکنش را…