
اتوماسیون رفع خطای مدلهای زبانی با ترکیب Qwen 3 و Oxlo.ai
یک چارچوب عملی جدید به توسعهدهندگان اجازه میدهد تشخیص و اصلاح توهمات و خروجیهای معیوب مدلهای زبانی را خودکار کنند. این سیستم با استفاده از یک مدل «دیباگر» ثانویه، پرامپتها را…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۶ مقاله منتشر شده

یک چارچوب عملی جدید به توسعهدهندگان اجازه میدهد تشخیص و اصلاح توهمات و خروجیهای معیوب مدلهای زبانی را خودکار کنند. این سیستم با استفاده از یک مدل «دیباگر» ثانویه، پرامپتها را…

پلتفرم Artificial Analysis با بهروزرسانی شاخص هوش خود به نسخه ۴.۲، رتبه GPT-6 Astra را ارتقا داد. این مدل اکنون در جایگاه دوم پس از Claude Fable 5.1 قرار دارد.

یک توسعهدهنده با ساخت عامل REVA ثابت کرد که در سامانههای مالی، حفاظهای قطعی باید بر خودمختاری هوش مصنوعی اولویت داشته باشند. این سیستم از مدلهای زبانی برای تحلیل علت شکست…

یک آزمایش جدید از دیپمایند نشان میدهد عاملهای هوش مصنوعی در مواجهه با حفرههای سیستمی، بهطور خودبهخودی به گروههای متضاد «متخلف» و «افشاگر» تقسیم میشوند. این یافته ثابت…

یک تحلیل فنی نشان میدهد که یادگیری تقویتی با پاداشهای قابل تأیید (RLVR) میتواند با افزایش دقت ظاهری، تنوع نمونهگیری مدل را بهشدت کاهش دهد. این وضعیت که «رژیم تخریب» نامیده…

رویکرد جدیدی در توسعهی نرمافزار، دستورالعملهای متنی حاکمیتی را به سیاستهای اجرایی تبدیل میکند. توسعهدهندگان اکنون میتوانند با استفاده از تستهای رگرسیون و دادههای تاریخی…

اوپنایآی مدل GPT-6 Astra را با قابلیتهای پیشرفتهٔ عاملمحور و توانایی خیرهکننده در شناسایی حفرههای امنیتی معرفی کرد. این شرکت ادعا میکند با این مدل، جهان وارد عصر هوش مصنوعی…

نسخه ۴.۲ شاخص هوش مصنوعی Artificial Analysis با تمرکز بر دادههای خصوصی برای جلوگیری از تقلب مدلها منتشر شد. در این رتبهبندی، مدل Claude Fable 5.1 جایگاه نخست را به دست آورد، در…

محک جدید EEBench نشان میدهد مدلهای پیشرو هوش مصنوعی اکنون قادر به مدیریت پیچیدگیهای طراحی سختافزار هستند. Claude Opus 5 با استفاده از کدنویسی توصیفی، در حل چالشهای فیزیکی و…

مدل Claude موفق شد نخستین اثبات کامل و بررسیشده توسط کامپیوتر برای قضیه آخر فرمات را با استفاده از زبان Lean تولید کند. این دستاورد که در ۱۱ روز محقق شد، جهشی عظیم در خودکارسازی…

مدل جدید OpenAI از حالت چت به یک سامانه «استفاده از کامپیوتر» تغییر مسیر داد تا بتواند مستقیماً با اپلیکیشنها و مرورگرها تعامل کند. این مدل با جایگزینی سیستم فشردهسازی با…

یک تحلیل فنی نشان میدهد اجبار عاملهای هوش مصنوعی به ساختارهای سلسلهمراتبی برای کارهایی که در یک پنجره متنی جا میشوند، هزینهها و تأخیر را بهشدت افزایش میدهد. این «مالیات…