پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه Cursor با بازخورد متنی، سیگنال یادگیری عامل‌های خود را ۲۰۰۰ برابر کرد؟

·۵ خرداد ۱۴۰۵۲ دقیقه مطالعه۱ بازدید
اشتراک‌گذاری

آموزش یک عامل (Agent) برای مدیریت ۱۰۰ هزار توکن، یک کابوس ریاضی است؛ چرا که یک نمره «رد» در پایان مسیر، تقریباً هیچ سیگنال مفیدی به توکن‌های میانی نمی‌رساند. وقتی پاداش در یک اجرای عظیم پخش شود، گرادیان هر حرکت خاص در نویز غرق شده و مدل به‌جای یادگیری اصلاحات دقیق، در جهتی میانگین حرکت می‌کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی نرخ موفقیت ۳۶ درصدی در Cursor Composer 2.5 اشاره کردیم، این ابزار اکنون سازوکار دقیق این پیشرفت را افشا کرده است. طبق اعلام تیم توسعه، نسخه‌ی جدید که در ۱۸ مه ۲۰۲۶ منتشر شد، بر پایه چک‌پوینت متن‌باز Moonshot Kimi K2.5 است و بر تغییر بنیادین در نحوه اعمال یادگیری تقویت‌شده (RL) در عامل‌های با بافت بلند تمرکز دارد.

به نقل از تحلیل فنی در dev.to، شرکت Cursor از روش «یادگیری تقویت‌شده با بازخورد متنی هدفمند» (Targeted Textual Feedback RL) برای محلی‌سازی گرادیان استفاده می‌کند. در این روش، به‌جای تکیه بر یک پاداش اسکالر (Scalar Reward) در انتهای جلسه، یک بازه مشخص — معمولاً حدود ۵۰ توکن — شناسایی شده و یک راهنمای متنی کوتاه (مثلاً «ابتدا ایمپورت‌های فایل را بررسی کن») در بافت محلی درج می‌شود. این توزیعِ شرطی‌شده با راهنما، نقش معلم را ایفا می‌کند و یک زیان KL در تقطیر درون-سیاستی (On-policy distillation KL loss) احتمالات مدل دانش‌آموز را تنها در آن بازه خاص به سمت معلم سوق می‌دهد.

Cover image for Cursor Composer 2.5: Targeted Textual Feedback RL

اثر ریاضی این تغییر تکان‌دهنده است. در یک اجرای ۱۰۰ هزار توکنی، پاداش اسکالر استاندارد سیگنالی در حدود $10^{-5}$ (۰.۰۰۱٪) برای هر توکن ایجاد می‌کند. در مقابل، بازخورد هدفمند در یک بازه ۵۰ توکنی، شدت سیگنال را به حدود ۲٪ می‌رساند؛ یعنی اعتبار محلی تقریباً ۲۰۰۰ برابر قوی‌تر می‌شود. این رویکرد با RLVR (یادگیری تقویت‌شده با پاداش‌های قابل تأیید) ترکیب شده و از طریق Sharded Muon و HSDP بهینه شده است. هم‌زمان، Cursor در حال آموزش یک مدل پیشرو با همکاری SpaceXAI روی کلاستر Colossus 2 با استفاده از حدود ۱ میلیون GPU معادل H100 است.

این چرخش نشان‌دهنده تکامل مهندسی عامل‌هاست: با تبدیل شدن رویه‌های زمان استنتاج (Inference-time) مانند اجراهای طولانی به ستون‌های اصلی سیستم، پس‌آموزش باید از پاداش‌های کلی به سمت اصلاحات محلی حرکت کند. برای این حوزه، معنای این اتفاق آن است که مشکل تخصیص اعتبار (Credit Assignment Problem) نه با مدل‌های پاداش پیچیده‌تر، بلکه با بازطراحی تابع زیان برای پذیرش مداخلات متنی انسانی حل می‌شود.

گام بعدی شما

  • بررسی اثر تقطیر هدفمند بر پایداری سایر عامل‌های با پنجره متنی بلند.
  • تحلیل نتایج خروجی از آموزش‌های کلاستر Colossus 2 شرکت SpaceXAI.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی گلوگاه اصلی مقیاس‌پذیری عامل‌های هوش مصنوعی را می‌شکند و اجازه می‌دهد مدل‌ها در جلسات طولانی بدون گم کردن مسیر یاد بگیرند. اعتبار این ادعا از همکاری Cursor با زیرساخت‌های عظیم SpaceXAI و استفاده از ۱ میلیون GPU نشأت می‌گیرد.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.