
«اثبات صحت کد»؛ رویکردی جدید برای عبور از تستهای سنتی هوش مصنوعی
یک چارچوب ارزیابی جدید با استفاده از دو پیادهسازی مستقل از کد، باگهای پیچیدهای را میگیرد که تستهای سنتی نادیده میگیرند. این سیستم با تطبیق خروجیهای دو موتور مجزا، سطح…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۸۸ مقاله منتشر شده

یک چارچوب ارزیابی جدید با استفاده از دو پیادهسازی مستقل از کد، باگهای پیچیدهای را میگیرد که تستهای سنتی نادیده میگیرند. این سیستم با تطبیق خروجیهای دو موتور مجزا، سطح…

یک پژوهشگر با بازسازی معماری JEPA شرکت متا برای بازی Super Mario Bros دریافت که توانایی پیشبینی فریمهای آینده به معنای تسلط بر کنترل بازی نیست. مدل مذکور در پیشبینیهای…

چارچوب H2A2H جایگزین فرایندهای سنتی تعامل انسان با اپلیکیشن میشود تا عاملها را از ابزارهای ساده به لایههای واسط تبدیل کند. این سیستم تماسهای فنی API را با کشف قصد کاربر و…

پلتفرم Maxim AI با معرفی ابزار مشاهدهپذیری (Observability) برای گردشهای کاری عاملمحور، فراتر از ثبت ساده وقایع رفته تا مسیر تصمیمگیریهای پیچیده را ردیابی کند. این سیستم به…

تحلیلی فنی نشان میدهد پارادایم فعلی چتباتها بر پایه وزنهای ثابت، با نیازهای بهرهوری و امنیت متخصصان در تضاد است. چارچوب پیشنهادی «فرشته نگهبان»، جایگزینی مدلهای عمومی را با…

ابزار Argus برای جلوگیری از توهمات هوش مصنوعی، تنها زمانی علت ریشهای یک نقص را گزارش میکند که پنج تحلیل مستقل بر سر آن توافق کنند. این رویکرد اجماعی مانع از حدسهای نادرست مدل…

شرکت PrismML مدل Bonsai 27B را معرفی کرد؛ نخستین مدل در این مقیاس که بهدلیل استفاده از وزنهای ۱-بیتی و ترنری، روی گوشیهای هوشمند اجرا میشود. این مدل قابلیتهای استدلالی…

ارائه بصری باکیفیت در گزارشهای تولید شده توسط هوش مصنوعی میتواند کاربران را به اشتباه بیندازد تا تصور کنند تحلیل دقیقی صورت گرفته است. این مقاله یک گردشکار پنجمرحلهای برای…

تمایل فزاینده به واگذاری تکالیف شناختی به هوش مصنوعی، از اتوماسیون کارهای ساده به جایگزینی تصمیمگیریهای انسانی تغییر میکند. این روند خطر از دست دادن استقلال فردی و توانایی…

مدل جدید ThinkingCap-Qwen3.6 با استفاده از یک حلقهٔ تأییدی داخلی، در ۷ مورد از ۱۰ چالش پیچیده استدلالی از Llama 4.1-70B پیشی گرفت. این دستاورد نشان میدهد کیفیت دادههای آموزشی و…

کمپانی OpenAI سری مدلهای GPT-5.6 را با قابلیت Computer Use برای کنترل مستقیم رابط کاربری و سه سطح مختلف تفکر روانه بازار کرد. این بهروزرسانی شامل ادغام اپلیکیشنهای macOS و…

آزمایشهای جدید نشان میدهد که تنظیم دقیق و RAG نمیتوانند سیگنالهای پیشبینیکننده را در دادههای نویزی خلق کنند. مدلهای بزرگتر تمایل دارند به جای الگو، «نویز» را حفظ کنند و…