
TutorMoments: مدلهای زبانی با کمک بیش از حد، تفکر انتقادی دانشآموزان را
یک چارچوب ارزیابی جدید نشان میدهد که مدلهای زبانی در نقش معلم، تمایل دارند بیش از حد به دانشآموز کمک کنند و فرصت «تلاش سازنده» را از آنها بگیرند. با وجود بهبود در مهندسی…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۰۹۶ مقاله منتشر شده

یک چارچوب ارزیابی جدید نشان میدهد که مدلهای زبانی در نقش معلم، تمایل دارند بیش از حد به دانشآموز کمک کنند و فرصت «تلاش سازنده» را از آنها بگیرند. با وجود بهبود در مهندسی…

یک مطالعه بر روی ۷۲ آزمایش نشان میدهد که فشردهسازی خروجیهای ابزار در پروتکل MCP باعث میشود عاملها از انجام وظایفی که قادر به حل آنها هستند، صرفنظر کنند. این پژوهش ثابت…

بررسی یک جلسه عملی با عاملهای هوشمند نشان میدهد که پرامپتهای مبهم و نادیده گرفتن فاز برنامهریزی منجر به حلقههای تکراری و اتلاف توکن میشود. این مورد بر ضرورت تعریف دقیق…

آزمایشهای جدید نشان میدهد عاملهای هوش مصنوعی میتوانند با تبدیل اسکرینشاتها به دادههای اندازهگیری شده، ویدیوهای باکیفیت تولید کنند. این مدلها بدون «دیدن» واقعی فیلم، تنها…

پلتفرم BMAD با معرفی یک سامانه چندعاملی، تصمیمات فنی را پیش از کدنویسی اجباری میکند. این روش با انتقال مرحله برنامهریزی به ابتدای فرآیند، از حدسهای خاموش و باگهای پنهان در…

یک چارچوب ارزیابی جدید با استفاده از ASan و UBSan ثابت کرد که اصلاحات کد C++ توسط هوش مصنوعی اغلب در ظاهر درست اما در زمان اجرا شکست میخورند. این سیستم سیگنالهای باینری پاس/فیل…

شیائومی خانواده مدلهای MiMo را برای کارهای برنامهنویسی و پردازش متون طولانی در دسترس قرار داد. این مدلها با تمرکز بر استدلال پیشرفته طراحی شدهاند و از طریق Hugging Face قابل…

بسیاری از سامانههای ارزیابی، عاملهای هوش مصنوعی را بر اساس تکتک پاسخها میسنجند، نه کل جلسه. این رویکرد باعث میشود «زوال محدودیتها» و تناقضات در گفتگوهای طولانی نادیده گرفته…

پروژه LuisCore با معرفی نقشه راه Tier 2، بر ایجاد یک بستر غیرمتمرکز با تأخیر کم برای استنتاج عاملهای هوش مصنوعی تمرکز کرده است. این سیستم ابزارهای تخصصی برای مدیریت خط لولههای…

شرکت OpenAI دسترسی به چتهای متنی را برای کاربران طرحهای رایگان و Go نامحدود کرد و مدل پیشفرض را به GPT-5.6 Luna ارتقا داد. این بهروزرسانی با افزودن دکمه «Think» برای…

ارائه سوابق واقعی اجرا بهجای اکتفا به کد و لاگها، مدلهای هوش مصنوعی را قادر میسازد تا بهصورت معکوس از حالت نهایی به علت خطا برسند. این رویکرد، AI را از ابزاری که حدسهای…

بسیاری از تیمهای مهندسی مهارتهای عامل (Agent Skills) را با پروتکل زمینه مدل (MCP) اشتباه میگیرند. در حالی که MCP لایهی اتصال به دادههاست، مهارتها داربستهای شناختی هستند که…