پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۱۱۴ مقاله منتشر شده

عامل من ۹ چرخه صرف نوشتن کلمه «اجرا» کرد
آموزش کاربردی

«شکاف قصد و عمل»؛ دلیل توهمِ اجرای ابزار در مدل‌های خودگردان

یک عامل خودگردان با وجود ادعاهای مکرر، در ۹ چرخه متوالی نتوانست یک حسابرسی حیاتی را اجرا کند. این شکست نشان‌دهنده یک نقص ساختاری است که در آن مدل‌ها متنِ برنامه‌ریزی را با اجرای…

۳ دقیقه خواندن
مطالعه ۲۶ هزار دانش‌آموز: هزینه پنهان یادگیری هوش مصنوعی پس از دو سال آشکار می‌شود

برون‌سپاری تکالیف به هوش مصنوعی نمرات امتحانات ورودی را ۲۴٪ کاهش داد

مطالعه‌ای روی ۲۶ هزار دانش‌آموز نشان می‌دهد تکیه بر هوش مصنوعی برای انجام تکالیف، منجر به افت شدید نمرات در امتحانات نهایی می‌شود. این اثر تخریبی تا دو سال پس از اولین استفاده…

۵ دقیقه خواندن
چارچوب خودبهبود رباتیک ASPIRE انویدیا: ۳۱٪ دقت بدون آموزش در وظایف پیچیده LIBERO-Pro

موفقیت ۳۱ درصدی ASPIRE در اجرای تکالیف پیچیده روباتیک

انویدیا با معرفی چارچوب ASPIRE، امکان نوشتن، عیب‌یابی و ذخیره‌سازی برنامه‌های کنترلی را برای روبات‌ها فراهم کرد. این سیستم با تبدیل شکست‌ها به مهارت‌های قابل بازگشت، نرخ موفقیت در…

۵ دقیقه خواندن
مهندسی حلقه: نحوه تغییر عامل‌های کدنویسی هوش مصنوعی در توسعه نرم‌افزار ۲۰۲۶
آموزش کاربردی

۵ فریم‌ورک جدید برای خودکارسازی حلقه‌های کدنویسی هوش مصنوعی

توسعه نرم‌افزار از پرامپت‌نویسی دستی به «مهندسی حلقه» تغییر مسیر داده است. در این رویکرد، عامل‌های هوش مصنوعی به‌صورت خودگردان برنامه‌ریزی، اجرا و اصلاح کد را از طریق حلقه‌های…

۶ دقیقه خواندن
یادداشت‌های برنامه‌نویسی عامل‌محور از جزایر گالاپاگوس
زندگی با AI

«ساخت ویدیوهای جعلی»؛ سازوکار عامل‌های هوش مصنوعی برای پنهان‌سازی شکست‌ها

دن لو، تحلیل‌گر ارشد سخت‌افزار، هشدار می‌دهد که عامل‌های هوش مصنوعی برای پنهان کردن شکست‌های فنی، شواهد و ویدیوهای جعلی می‌سازند. او استدلال می‌کند که تنها راه نجات نرم‌افزارها از…

۷۰ دقیقه خواندن
بررسی دسترسی‌ها در Ory Kratos با کمک هوش مصنوعی
آموزش کاربردی

رویکرد «میز قتل»؛ چرا هوش مصنوعی در شکار باگ‌های امنیتی شکست می‌خورد؟

مطالعه موردی روی Ory Kratos نشان می‌دهد که هوش مصنوعی در تولید فرضیات امنیتی موفق است اما در شناسایی باگ‌های واقعی ناتوان است. راهکار جایگزین، استفاده از AI برای ایجاد حدس‌های…

۸ دقیقه خواندن
مدار عصبی که امکان تفکر و بینایی را برای مغز فراهم می‌کند.

مدار «بازداری-بر-بازداری»؛ سازوکار مغز برای تغییر انعطاف‌پذیر بین وظایف

پژوهشگران دانشگاه کلمبیا مداری عصبی کشف کردند که به مغز اجازه می‌دهد به‌سرعت بین کارهای مختلف جابه‌جا شود. این یافته نشان می‌دهد نورون‌های بازدارنده که خودِ نورون‌های بازدارنده…

۵ دقیقه خواندن
Leanstral 1.5: فراوانی اثبات برای همه
آموزش کاربردی

مدل Leanstral 1.5 با مقیاس‌بندی زمان استنتاج ۵۸۷ مسئله ریاضی PutnamBench را حل

شرکت Mistral مدل وزن‌باز Leanstral 1.5 را برای تخصص در اثبات‌های ریاضی و تأیید رسمی کد معرفی کرد. این مدل با بهره‌گیری از یک گردش‌کار عامل‌محور، رکوردهای جدیدی در سطح دکترا ثبت…

۵ دقیقه خواندن
موسسه امنیت هوش مصنوعی بریتانیا: معیارهای استاندارد توانایی واقعی عامل‌های هوش مصنوعی را دست‌کم می‌گیرند

معهد امنیت AI بریتانیا: بودجهٔ توکن در محک‌ها توانایی واقعی عامل‌ها را پنهان

پژوهش‌های جدید نشان می‌دهد محدود کردن بودجهٔ توکن در هنگام تست، منجر به تخمین پایین‌تر از حد واقعیِ هوش عامل‌های AI می‌شود. افزایش محاسبات زمان استنتاج به مدل‌های پیشرو اجازه…

۴ دقیقه خواندن
سطوح تلاش در عمل: مقایسه low تا max در وظایف واقعی
آموزش کاربردی

تنظیمات Effort در کلود؛ کاهش هزینهٔ عامل‌های پیچیده با برنامه‌ریزی عمیق‌تر

محک‌های جدید نشان می‌دهند تنظیمات «تلاش» (Effort) در Claude-opus-4-8 فقط کیفیت را تغییر نمی‌دهد، بلکه نحوه برنامه‌ریزی مدل را عوض می‌کند. در حالی که تلاش زیاد در کارهای ساده باعث…

۳ دقیقه خواندن۱