پرش به محتوای اصلی
پرش به محتوای مقاله

ترنسفورمرهای حلقوی؛ افزایش عمق استدلال از طریق مسیرهای زمانی

·۲۲ شهریور ۱۴۰۵۳ دقیقه مطالعه
معماری ترنسفورمر حلقه‌ای بازگشتی با اتصالات بازخورد بین لایه‌ها برای پردازش توالی‌های طولانی‌تر.
معماری ترنسفورمر حلقه‌ای بازگشتی با اتصالات بازخورد بین لایه‌ها برای پردازش توالی‌های طولانی‌تر.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهومی به نام «عمق زمانی» که در آن تعداد دفعات عبور از لایه‌ها به‌جای تعداد لایه‌های فیزیکی، تعیین‌کننده قدرت استدلال مدل است.

تصور کنید مدل‌های هوش مصنوعی به‌جای داشتن تعداد لایه‌های ثابت، بتوانند با هر کلمه جدید، لایه‌های بیشتری از تفکر را طی کنند. این یعنی عمق استدلال مدل دیگر یک عدد ثابت نیست، بلکه با پیچیدگی مسئله رشد می‌کند.

Recurrent Looped Transformer (RLT) یک چرخش بنیادین در نحوه مدیریت رشد توالی‌هاست که رمزگشا را به عنوان یک محاسبه نهان پیوسته در نظر می‌گیرد. به نقل از گزارش فنی منتشر شده در ۱۳ سپتامبر ۲۰۲۶ توسط Yifan Zhang، این معماری اجازه می‌دهد عمق استدلال به‌جای ثابت ماندن در هر توکن، به‌طور متناسب با طول توالی افزایش یابد.

همان‌طور که در تحلیل قبلی ما درباره‌ی مدل ترنسفورمر (Transformer) اشاره کردیم، مدل‌های فعلی بر روی پشته‌های لایه‌ای ثابت متکی هستند. اما RLT یک هسته بازگشتی را معرفی می‌کند؛ در حالی که ترنسفورمرهای استاندارد توکن‌ها را از طریق تعداد مشخصی لایه پردازش می‌کنند، مسیر زمانی در RLT برای هر توکن تولید شده، کل رمزگشا را پیمایش می‌کند.

معماری فنی

این سامانه حجم کاری را بین دو مؤلفه اصلی تقسیم می‌کند:

  • رمزگذار علی (Causal Encoder): موازی‌سازی توکن‌های شناخته‌شده را برای ساخت یک حافظه کلید-مقدار (KV Cache) جهانی مدیریت می‌کند.
  • رمزگشای بازگشتی (Recurrent Decoder): محاسبات را با استفاده از یک حافظه پله‌ای لایه‌ای (SWA Cache) و یک خروجی بازگشتی که به توکن بعدی منتقل می‌شود، گسترش می‌دهد.

در یک پیکربندی عملیاتی، این مدل از ۴۸ لایه رمزگذار و ۴۸ لایه رمزگشا استفاده می‌کند. طبق مستندات، پس از پردازش $t$ توکن، مسیر زمانی ۴۸ ضربدر $t$ بلوک رمزگشا را پیمایش کرده است، هرچند تعداد بلوک‌های منطقی برای هر توکن روی عدد ۹۶ ثابت می‌ماند.

اجرا و ادغام با یادگیری تقویتی

RLT برای حفظ سازگاری در تمام چرخه حیات مدل طراحی شده است. چه در پیش‌آموزش، چه در تنظیم نظارت‌شده (SFT) و چه در بازپخش یادگیری تقویتی (RL)، مدل از یک انتقال وضعیت کامل استفاده می‌کند. در طول بازپخش RL، سامانه تمام تاریخچه — شامل وضعیت‌های پرامپت و KV Cache رمزگشا — را تحت پارامترهای فعلی بازسازی می‌کند تا سازگاری پیش‌رو تضمین شود.

این طراحی ناهماهنگی ساختاری را که معمولاً در مرزهای پرامپت دیده می‌شود، حذف می‌کند. با بازاستفاده از وزن‌ها و حافظه در حین ثبت نقاط بازرسی فعال‌سازها، این معماری هدفش بهینه‌سازی تعامل بین هسته بازگشتی و اجرای موازی سخت‌افزاری است.

برای جامعه فنی، این موضوع این فرض را می‌شکند که عمق استدلال یک ابرپارامتر (Hyperparameter) استاتیک است. اگر RLT بتواند پایداری خود را حفظ کند، نشان می‌دهد که «عمق نامحدود» را می‌توان از طریق گسترش زمانی به دست آورد، نه صرفاً با افزودن لایه‌های فیزیکی بیشتر به مدل.

با این حال، گزارش مذکور اشاره می‌کند که دستاوردهای واقعی در استدلال، بهره‌وری سخت‌افزاری و قوانین مقیاس‌پذیری RL برای این رویکرد حلقوی، هنوز باید در محک‌های مقیاس‌بزرگ به‌طور کامل ارزیابی شوند.

گام بعدی شما

  • بررسی مقایسه عملکرد RLT در برابر ترنسفورمرهای خطی در وظایف استدلال با زمینه بلند.
  • تحلیل پایداری گرادیان در این مدل برای اطمینان از عدم وقوع مشکل محوشدن گرادیان (Vanishing Gradient).
  • دنبال کردن پیاده‌سازی‌های متن‌باز احتمالی برای تست هزینه استنتاج در مقیاس کوچک.

اما چالش اصلی، سازگاری این ساختار با حافظه VRAM در استنتاجات طولانی است — به تحلیل ما درباره بهینه‌سازی‌های KV Cache مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با تکیه بر تخصص در بهینه‌سازی مسیرهای محاسباتی، امکان استدلال عمیق‌تر را بدون نیاز به افزایش حافظه گرافیکی فراهم می‌کند. اعتبار این رویکرد در گرو موفقیت آن در بنچمارک‌های استدلال پیچیده است.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران و در حال حاضر اثر مستقیمی بر کاربران نهایی ایرانی ندارد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی عمق فیزیکی با عمق زمانی، پارادایم «بزرگ‌تر بهتر است» را به «پیمایش بیشتر بهتر است» تغییر می‌دهد. این رویکرد در واقع تلاشی برای بازگرداندن مزایای RNNها در مدیریت توالی‌های نامحدود است، اما با حفظ قدرت توجه (Attention) ترنسفورمرها. اگر این مدل در برابر محوشدن گرادیان مقاوم باشد، هزینه آموزش مدل‌های استدلالی عمیق به‌شدت کاهش می‌یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.