
عاملهای OpenAI برای هر یک روز کار انسانی، ۳.۱ روز تلاش تولید میکنند
اوپنایآی با استقرار «کارآموز پژوهشی خودکار» گامی concrete به سوی بهبود خودکار بازگشتی (RSI) برداشت. دادههای داخلی نشان میدهد عاملهای کدنویسی اکنون حجم کاری معادل ۳.۱ روز را…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۶ مقاله منتشر شده

اوپنایآی با استقرار «کارآموز پژوهشی خودکار» گامی concrete به سوی بهبود خودکار بازگشتی (RSI) برداشت. دادههای داخلی نشان میدهد عاملهای کدنویسی اکنون حجم کاری معادل ۳.۱ روز را…

شرکت OpenAI هشدار داد که هوش مصنوعی به مرحلهای از خودبهبهبود بازگشتی رسیده است که در آن ماشینها توسعه خود را هدایت میکنند. این شرکت اکنون اولویت خود را بر «دفاع مقیاسپذیر»…

تحلیلی جدید نشان میدهد سیستمهای هوش مصنوعی که قادر به آموزش نسخههای بعدی خود بدون دخالت انسان هستند، بسیار کندتر از پیشبینیهای نظریه تکینگی پیش میروند. گلوگاههای فنی در…

بسیاری از خطاهای مدلهای زبانی ناشی از «منحنی U-شکل» در توجه مدل است که باعث نادیده گرفتن اطلاعات میانی پرامپت میشود. برای حل این مشکل، باید ساختاری سختگیرانه شامل نقش، وظیفه و…

بررسی پدیدهی «شهود» در مدلهای زبانی که فراتر از دستورات صریح توسعهدهندگان شکل میگیرد. این تحلیل نشان میدهد ارزشمندترین رفتارهای هوش مصنوعی، همانهایی هستند که بهطور تصادفی و…

یک توسعهدهنده نرمافزار از پارادوکس هوش مصنوعی میگوید؛ جایی که تواناییهای استدلالی مدلها با تخریب محیطزیست و نابودی وب آزاد پیش میرود. این تحلیل استدلال میکند که پیروزیهای…

رقابت در دنیای هوش مصنوعی از افزایش اندازه مدلها به سمت بهینهسازی شدید هزینهها تغییر مسیر داده است. در حالی که مدلهای غربی بر قدرت و ایمنی تمرکز دارند، مدلهای وزنباز چینی با…

چارچوب جدید LLM-JEPA با ترکیب مدلهای زبانی و معماریهای پیشبینِ جاسازی مشترک، به جای پیشبینی توکنها به شبیهسازی واقعیت در فضای انتزاعی روی آورده است. این رویکرد باعث بهبود…

مقایسه مدلهای پیشرو با پرامپتهای ساده منجر به شکستهای هزینهبر در محیط عملیاتی میشود. چارچوب ارزیابی جدید، تمرکز را از «زیبایی کد» به رعایت محدودیتها، آگاهی از ساختار مخزن و…

مقیاسدهی افقی عاملهای هوش مصنوعی با تکرار مدلهای یکسان، تنها نرخ توهم را افزایش میدهد. استراتژی Depth Chart با ایجاد لایههای جایگزین (عاملهای ذخیره و متخصص)، تابآوری سیستم…

تحلیل API مدل Gemini نشان میدهد دقت هوش مصنوعی پس از ۲۰ نوبت گفتگو افت میکند، حتی اگر پنجره متنی فضای بیشتری داشته باشد. این یافتهها حاکی از آن است که «فراموشی» فعال، یک ضرورت…

پردازش زبان طبیعی در حوزه مالی از برچسبهای ساده مثبت/منفی فاصله گرفته و به سمت خط لولههای پیچیدهای میرود که هویت گوینده و بستر متن را وزندهی میکنند. سامانه AI QuantTrader…