
درون یک جلسه عملی؛ تحلیل حلقههای تکراری در هدایت مدلهای پیچیده
بررسی یک جلسه عملی با عاملهای هوشمند نشان میدهد که پرامپتهای مبهم و نادیده گرفتن فاز برنامهریزی منجر به حلقههای تکراری و اتلاف توکن میشود. این مورد بر ضرورت تعریف دقیق…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۸۲ مقاله منتشر شده

بررسی یک جلسه عملی با عاملهای هوشمند نشان میدهد که پرامپتهای مبهم و نادیده گرفتن فاز برنامهریزی منجر به حلقههای تکراری و اتلاف توکن میشود. این مورد بر ضرورت تعریف دقیق…

آزمایشهای جدید نشان میدهد عاملهای هوش مصنوعی میتوانند با تبدیل اسکرینشاتها به دادههای اندازهگیری شده، ویدیوهای باکیفیت تولید کنند. این مدلها بدون «دیدن» واقعی فیلم، تنها…

پلتفرم BMAD با معرفی یک سامانه چندعاملی، تصمیمات فنی را پیش از کدنویسی اجباری میکند. این روش با انتقال مرحله برنامهریزی به ابتدای فرآیند، از حدسهای خاموش و باگهای پنهان در…

یک چارچوب ارزیابی جدید با استفاده از ASan و UBSan ثابت کرد که اصلاحات کد C++ توسط هوش مصنوعی اغلب در ظاهر درست اما در زمان اجرا شکست میخورند. این سیستم سیگنالهای باینری پاس/فیل…

شیائومی خانواده مدلهای MiMo را برای کارهای برنامهنویسی و پردازش متون طولانی در دسترس قرار داد. این مدلها با تمرکز بر استدلال پیشرفته طراحی شدهاند و از طریق Hugging Face قابل…

بسیاری از سامانههای ارزیابی، عاملهای هوش مصنوعی را بر اساس تکتک پاسخها میسنجند، نه کل جلسه. این رویکرد باعث میشود «زوال محدودیتها» و تناقضات در گفتگوهای طولانی نادیده گرفته…

پروژه LuisCore با معرفی نقشه راه Tier 2، بر ایجاد یک بستر غیرمتمرکز با تأخیر کم برای استنتاج عاملهای هوش مصنوعی تمرکز کرده است. این سیستم ابزارهای تخصصی برای مدیریت خط لولههای…

شرکت OpenAI دسترسی به چتهای متنی را برای کاربران طرحهای رایگان و Go نامحدود کرد و مدل پیشفرض را به GPT-5.6 Luna ارتقا داد. این بهروزرسانی با افزودن دکمه «Think» برای…

ارائه سوابق واقعی اجرا بهجای اکتفا به کد و لاگها، مدلهای هوش مصنوعی را قادر میسازد تا بهصورت معکوس از حالت نهایی به علت خطا برسند. این رویکرد، AI را از ابزاری که حدسهای…

بسیاری از تیمهای مهندسی مهارتهای عامل (Agent Skills) را با پروتکل زمینه مدل (MCP) اشتباه میگیرند. در حالی که MCP لایهی اتصال به دادههاست، مهارتها داربستهای شناختی هستند که…

شرکت OpenAI با بهرهگیری از مدل جدید GPT-5.6 Luna، محدودیتهای تعداد پیام در چتهای متنی را برای همه کاربران حذف کرد. این بهروزرسانی شامل دکمه «Think» برای استدلالهای پیچیده و…

مدل جدید علیبابا در وظایف پیچیده عملکردی خیرهکننده دارد، اما هزینه هر تسک را ۱۱۴٪ افزایش داده است. این مدل با وجود برتری در استدلال، با نرخ توهم بالاتر و بهرهوری کمتر نسبت به…