
آیا رکورد جدید GPT-5.6 در ARC-AGI-3 معیار استانداردی است؟
شرکت OpenAI مدعی است مدل جدیدش در بنچمارک منطقی ARC-AGI-3 از رقیب خود پیشی گرفته است. با این حال، این موفقیت تنها با استفاده از یک محیط آزمایشی سفارشی و نه استاندارد به دست آمده…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۸۸ مقاله منتشر شده

شرکت OpenAI مدعی است مدل جدیدش در بنچمارک منطقی ARC-AGI-3 از رقیب خود پیشی گرفته است. با این حال، این موفقیت تنها با استفاده از یک محیط آزمایشی سفارشی و نه استاندارد به دست آمده…

هارش گارگ توسعهدهندهای است که ابزار متنباز Job Finder India را برای جلوگیری از ارسال رزومههای نامناسب طراحی کرده است. این سیستم بهجای افزایش لیست شغلها، با ترکیب کدهای قطعی…

برخی مدلهای استدلالی در صورت کمبود بودجهٔ توکن، پاسخ نهایی را حذف کرده و تنها زنجیره تفکر داخلی را تولید میکنند. این وضعیت باعث ایجاد خطاهای گمراهکننده میشود که به اشتباه شبیه…

لیلیان ونگ، همبنیانگذار Thinking Machines، برای رهبری تیمی متخصص در OpenAI بازگشته است. تمرکز این تیم بر «خودبهسازی بازگشتی» است تا مدلهای هوش مصنوعی بتوانند بهطور خودکار…

تغییری بنیادین در معماری هوش مصنوعی، «حدس زدن» را با استدلال آگاهانه جایگزین کرد. مدلهای جدید سال ۲۰۲۶ با ترکیب شبکههای عصبی و منطق نمادین، مسائل ریاضی سطح مسابقات و علوم دکتری…

پژوهشی جدید نشان میدهد عاملهای هوش مصنوعی حتی با دسترسی به دستورالعملهای شرکت، اغلب قوانین را نادیده گرفته و اقدامات ممنوعه انجام میدهند. این مطالعه اثبات میکند که پنجرههای…

یک محک جدید نشان میدهد که حتی پیشرفتهترین عاملهای هوش مصنوعی در پیروی از دستورالعملهای پیچیده و بلندمدت شکست میخورند. این مدلها اغلب در مواجهه با درخواستهای محیطی، قوانین…

مدل Laguna S 2.1 متعلق به شرکت Poolside با به چالش کشیدن قوانین مقیاسپذیری، از مدلهایی ۱۰ برابر بزرگتر خود در بنچمارکهای فنی پیشی گرفت. این مدل علیرغم تعداد پارامترهای کمتر،…

شرکت Devart با پیادهسازی یک سامانه مسیریابی چندلایه برای دستیار AI خود، از مصرف مدلهای گرانقیمت برای کارهای ساده SQL جلوگیری کرد. این رویکرد باعث کاهش هزینههای پردازشی تا ۷۰…

ZIL یک زبان دانش رابطهای جدید است که در Lean 4 ادغام شده تا پیوندهای میان کد، نیازمندیها و اثباتها را ردیابی کند. این ابزار به توسعهدهندگان و دستیاران هوش مصنوعی اجازه میدهد…

به جای ارتقای اشتراک مدلهای هوش مصنوعی، ابتدا باید یک «هارنس» یا چهارچوب عملیاتی محکم بسازید. دادهها نشان میدهند اکثر شکستهای کاربران ناشی از نبود فرآیند است، نه محدودیتهای…
پروژه Deltafin با استفاده از استریم کردن وزنها از دیسک، اجرای مدل عظیم Kimi K3 را روی مکهای اپل ممکن کرد. این دستاورد نشان میدهد که گلوگاه اجرای مدلهای غولپیکر از ظرفیت رم به…