تصور کنید مدلهای هوش مصنوعی بهجای داشتن تعداد لایههای ثابت، بتوانند با هر کلمه جدید، لایههای بیشتری از تفکر را طی کنند. این یعنی عمق استدلال مدل دیگر یک عدد ثابت نیست، بلکه با پیچیدگی مسئله رشد میکند.
Recurrent Looped Transformer (RLT) یک چرخش بنیادین در نحوه مدیریت رشد توالیهاست که رمزگشا را به عنوان یک محاسبه نهان پیوسته در نظر میگیرد. به نقل از گزارش فنی منتشر شده در ۱۳ سپتامبر ۲۰۲۶ توسط Yifan Zhang، این معماری اجازه میدهد عمق استدلال بهجای ثابت ماندن در هر توکن، بهطور متناسب با طول توالی افزایش یابد.
همانطور که در تحلیل قبلی ما دربارهی مدل ترنسفورمر (Transformer) اشاره کردیم، مدلهای فعلی بر روی پشتههای لایهای ثابت متکی هستند. اما RLT یک هسته بازگشتی را معرفی میکند؛ در حالی که ترنسفورمرهای استاندارد توکنها را از طریق تعداد مشخصی لایه پردازش میکنند، مسیر زمانی در RLT برای هر توکن تولید شده، کل رمزگشا را پیمایش میکند.
معماری فنی
این سامانه حجم کاری را بین دو مؤلفه اصلی تقسیم میکند:
- رمزگذار علی (Causal Encoder): موازیسازی توکنهای شناختهشده را برای ساخت یک حافظه کلید-مقدار (KV Cache) جهانی مدیریت میکند.
- رمزگشای بازگشتی (Recurrent Decoder): محاسبات را با استفاده از یک حافظه پلهای لایهای (SWA Cache) و یک خروجی بازگشتی که به توکن بعدی منتقل میشود، گسترش میدهد.
در یک پیکربندی عملیاتی، این مدل از ۴۸ لایه رمزگذار و ۴۸ لایه رمزگشا استفاده میکند. طبق مستندات، پس از پردازش $t$ توکن، مسیر زمانی ۴۸ ضربدر $t$ بلوک رمزگشا را پیمایش کرده است، هرچند تعداد بلوکهای منطقی برای هر توکن روی عدد ۹۶ ثابت میماند.
اجرا و ادغام با یادگیری تقویتی
RLT برای حفظ سازگاری در تمام چرخه حیات مدل طراحی شده است. چه در پیشآموزش، چه در تنظیم نظارتشده (SFT) و چه در بازپخش یادگیری تقویتی (RL)، مدل از یک انتقال وضعیت کامل استفاده میکند. در طول بازپخش RL، سامانه تمام تاریخچه — شامل وضعیتهای پرامپت و KV Cache رمزگشا — را تحت پارامترهای فعلی بازسازی میکند تا سازگاری پیشرو تضمین شود.
این طراحی ناهماهنگی ساختاری را که معمولاً در مرزهای پرامپت دیده میشود، حذف میکند. با بازاستفاده از وزنها و حافظه در حین ثبت نقاط بازرسی فعالسازها، این معماری هدفش بهینهسازی تعامل بین هسته بازگشتی و اجرای موازی سختافزاری است.
برای جامعه فنی، این موضوع این فرض را میشکند که عمق استدلال یک ابرپارامتر (Hyperparameter) استاتیک است. اگر RLT بتواند پایداری خود را حفظ کند، نشان میدهد که «عمق نامحدود» را میتوان از طریق گسترش زمانی به دست آورد، نه صرفاً با افزودن لایههای فیزیکی بیشتر به مدل.
با این حال، گزارش مذکور اشاره میکند که دستاوردهای واقعی در استدلال، بهرهوری سختافزاری و قوانین مقیاسپذیری RL برای این رویکرد حلقوی، هنوز باید در محکهای مقیاسبزرگ بهطور کامل ارزیابی شوند.
گام بعدی شما
- بررسی مقایسه عملکرد RLT در برابر ترنسفورمرهای خطی در وظایف استدلال با زمینه بلند.
- تحلیل پایداری گرادیان در این مدل برای اطمینان از عدم وقوع مشکل محوشدن گرادیان (Vanishing Gradient).
- دنبال کردن پیادهسازیهای متنباز احتمالی برای تست هزینه استنتاج در مقیاس کوچک.
اما چالش اصلی، سازگاری این ساختار با حافظه VRAM در استنتاجات طولانی است — به تحلیل ما درباره بهینهسازیهای KV Cache مراجعه کنید.




گفتگو