پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۰۹۶ مقاله منتشر شده

لحظات تدریس: آیا معلمان هوش مصنوعی می‌دانند چه‌وقت کمک کنند و چه‌وقت دست نگه دارند؟
آموزش کاربردی

TutorMoments: مدل‌های زبانی با کمک بیش از حد، تفکر انتقادی دانش‌آموزان را

یک چارچوب ارزیابی جدید نشان می‌دهد که مدل‌های زبانی در نقش معلم، تمایل دارند بیش از حد به دانش‌آموز کمک کنند و فرصت «تلاش سازنده» را از آن‌ها بگیرند. با وجود بهبود در مهندسی…

۷ دقیقه خواندن۲
آزمایش ۷۲ باره به جای بحث: ابزار MCP چه باید برگرداند؟
آموزش کاربردی

داده‌های تفکیکی در برابر ردیف‌های خلاصه؛ نبرد برای دقت عامل‌ها

یک مطالعه بر روی ۷۲ آزمایش نشان می‌دهد که فشرده‌سازی خروجی‌های ابزار در پروتکل MCP باعث می‌شود عامل‌ها از انجام وظایفی که قادر به حل آن‌ها هستند، صرف‌نظر کنند. این پژوهش ثابت…

۵ دقیقه خواندن
جلسه بن: مردی در حال ارائه در اتاق کنفرانس، با نمودارهای روی تخته سفید و همکاران در حال گوش دادن
آموزش کاربردی

درون یک جلسه عملی؛ تحلیل حلقه‌های تکراری در هدایت مدل‌های پیچیده

بررسی یک جلسه عملی با عامل‌های هوشمند نشان می‌دهد که پرامپت‌های مبهم و نادیده گرفتن فاز برنامه‌ریزی منجر به حلقه‌های تکراری و اتلاف توکن می‌شود. این مورد بر ضرورت تعریف دقیق…

۷ دقیقه خواندن۱
عنوان مقاله: «عوامل هوش مصنوعی نمی‌توانند ویدیو ببینند. مال من با این حال سه فیلم ساخت.»
آموزش کاربردی

پژوهش جدید: تبدیل اسکرین‌شات به داده، خطاهای بصری ویدیو را گرفت

آزمایش‌های جدید نشان می‌دهد عامل‌های هوش مصنوعی می‌توانند با تبدیل اسکرین‌شات‌ها به داده‌های اندازه‌گیری شده، ویدیوهای باکیفیت تولید کنند. این مدل‌ها بدون «دیدن» واقعی فیلم، تنها…

۶ دقیقه خواندن۱
گردش کار BMAD از ابتدا تا انتها: تحویل یک قابلیت با رویکرد مشخصات‌محور
آموزش کاربردی

چگونه سامانه چندعاملی BMAD خطاهای پرامپت‌نویسی مستقیم را می‌گیرد؟

پلتفرم BMAD با معرفی یک سامانه چندعاملی، تصمیمات فنی را پیش از کدنویسی اجباری می‌کند. این روش با انتقال مرحله برنامه‌ریزی به ابتدای فرآیند، از حدس‌های خاموش و باگ‌های پنهان در…

۱۶ دقیقه خواندن۱
ضدعفونی‌کننده‌ها به کسی تعارف نمی‌کنند: امتیازدهی مدل‌های کدنویسی رایگان در رفع رفتار تعریف‌نشده C++
آموزش کاربردی

«ظاهراً درست اما عملاً شکست‌خورده»؛ تحلیل خطاهای پنهان در کدهای هوش مصنوعی

یک چارچوب ارزیابی جدید با استفاده از ASan و UBSan ثابت کرد که اصلاحات کد C++ توسط هوش مصنوعی اغلب در ظاهر درست اما در زمان اجرا شکست می‌خورند. این سیستم سیگنال‌های باینری پاس/فیل…

۶ دقیقه خواندن
عامل شما در هر نوبت قبول می‌شود، اما مکالمه را با شکست مواجه می‌کند.
آموزش کاربردی

شکاف ۹۴ درصدی؛ چرا ارزیابی‌های تک‌مرحله‌ای عامل‌های هوش مصنوعی را می‌فریبند؟

بسیاری از سامانه‌های ارزیابی، عامل‌های هوش مصنوعی را بر اساس تک‌تک پاسخ‌ها می‌سنجند، نه کل جلسه. این رویکرد باعث می‌شود «زوال محدودیت‌ها» و تناقضات در گفتگوهای طولانی نادیده گرفته…

۵ دقیقه خواندن۲
یادداشت‌های هفتگی کشتی‌ها · ۷ اوت ۲۰۲۶
آموزش کاربردی

LuisCore زیرساخت غیرمتمرکز برای مدیریت عامل‌های هوش مصنوعی پیچیده را توسعه داد

پروژه LuisCore با معرفی نقشه راه Tier 2، بر ایجاد یک بستر غیرمتمرکز با تأخیر کم برای استنتاج عامل‌های هوش مصنوعی تمرکز کرده است. این سیستم ابزارهای تخصصی برای مدیریت خط لوله‌های…

۳ دقیقه خواندن۲
«مدل متغیر نبود. فکر می‌کنم سوابق بودند.»
آموزش کاربردی

سوابق اجرای کد برتری مدل‌های زبانی را در دیباگینگ بی‌معنی می‌کند

ارائه سوابق واقعی اجرا به‌جای اکتفا به کد و لاگ‌ها، مدل‌های هوش مصنوعی را قادر می‌سازد تا به‌صورت معکوس از حالت نهایی به علت خطا برسند. این رویکرد، AI را از ابزاری که حدس‌های…

۵ دقیقه خواندن۲
مهارت‌ها در برابر MCP: تفاوت واقعی (و چرا اکثر تیم‌ها اشتباه می‌کنند)
آموزش کاربردی

تحلیل فنی: تفکیک لایه اتصال از داربست شناختی، خطای عامل‌ها را می‌کاهد

بسیاری از تیم‌های مهندسی مهارت‌های عامل (Agent Skills) را با پروتکل زمینه مدل (MCP) اشتباه می‌گیرند. در حالی که MCP لایه‌ی اتصال به داده‌هاست، مهارت‌ها داربست‌های شناختی هستند که…

۹ دقیقه خواندن