پرش به محتوای اصلی
پرش به محتوای مقاله

درون سازوکار Looped Transformers برای ارتقای بهره‌وری استنتاج

·۱۸ شهریور ۱۴۰۵۲۷ دقیقه مطالعه
نمایی هنری از معماری هوش مصنوعی پیشرفته با حلقه‌های بازگشتی و استدلال پنهان.
نمایی هنری از معماری هوش مصنوعی پیشرفته با حلقه‌های بازگشتی و استدلال پنهان.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی عمق فیزیکی (افزودن لایه‌ها) با عمق محاسباتی (تکرار لایه‌ها) برای افزایش توان استدلال بدون افزایش تعداد پارامترها.

تصور کنید مدل هوش مصنوعی شما دیگر فقط یک چت‌بات نیست، بلکه اپراتوری است که محیط دسکتاپ شما را می‌بیند و دقیقاً می‌داند کجا کلیک کند. GPT-6 Astra که در ۲ سپتامبر ۲۰۲۶ منتشر شد، مرز بین تولید متن و تعامل با دنیای دیجیتال را جابه‌جا کرده است. این مدل در حالی که رشد هوش خام را به صورت تدریجی ادامه داده، در زمینه استفاده از رابط‌های گرافیکی (GUI) جهشی نامتناسب با نسل قبلی خود، یعنی GPT-5.6 Sol، داشته است.

همان‌طور که در تحلیل قبلی ما درباره‌ی حافظه بلندمدت در مدل‌های زبانی اشاره کردیم، Astra اکنون این حافظه را با توانایی دستکاری محیط‌های محلی ترکیب کرده است. این تکامل، مدل‌های زبانی بزرگ (LLM) را از تولیدکننده‌های متن به عامل‌هایی تبدیل می‌کند که می‌توانند کارهای پیچیده‌ای مثل رندر کردن شهرها در نرم‌افزار Blender یا مدیریت اظهارنامه‌های مالیاتی در مرورگر را به طور کامل اجرا کنند.

جهش در کنترل رایانه

به نقل از تحلیل فنی سباستین راشکا، قدرت Astra در کنترل رایانه مدیون یک چارچوب آموزشی تخصصی است. این مدل صرفاً متن پیش‌بینی نمی‌کند، بلکه بر اساس اسکرین‌شات‌های لحظه‌ای از سیستم‌عامل، کلیک‌های موس، فشردن کلیدهای کیبورد و اسکرول کردن را پیش‌بینی می‌کند. این سازوکار به مدل اجازه می‌دهد از طریق اپلیکیشن Codex/ChatGPT، نرم‌افزارهای یک رایانه محلی را مدیریت کند.

بر اساس گزارش‌ها، OpenAI برای تسهیل این فرآیند، ده‌ها هزار دستگاه Mac Mini و Mac Studio خریداری کرده است. این ماشین‌ها برای آموزش مدل (که توسط GPUها انجام می‌شود) نیستند، بلکه برای مواجه کردن مدل با محیط macOS در حین آموزش به کار رفته‌اند تا مدل یاد بگیرد چگونه با ابزارهای سیستم‌عامل تعامل کند. مدیرعامل انویدیا اشاره کرد که GPT-6 Astra بر روی تقریباً ۱۰۰,۰۰۰ واحد GPU Grace Blackwell آموزش دیده است.

سازوکار آموزش کنترل رایانه

گردش کار آموزشی برای این قابلیت‌ها از یک حلقه مشخص پیروی می‌کند:

  • پرامپت‌نویسی: مدل تکلیفی دریافت می‌کند (مثلاً: «برنامه X را باز کن و عملیات Y را انجام بده»).
  • ورودی بصری: چارچوب آموزشی، اسکرین‌شات‌هایی از رابط macOS را ارائه می‌دهد.
  • پیش‌بینی: مدل زبانی، اقدامات موس و کیبورد (کلیک‌ها، فشردن کلیدها و اسکرول) را پیش‌بینی می‌کند.
  • اجرا: این اقدامات روی دستگاه مک اجرا می‌شوند.
  • بازخورد: اسکرین‌شات‌های جدید از محیط به‌روزرسانی شده به مدل بازگردانده می‌شوند.
  • بهینه‌سازی: سیگنال‌های موفقیت یا شکست و تاییدکننده‌ها به عنوان بازخورد آموزشی عمل می‌کنند. در این مرحله از یادگیری تقویتی با پاداش‌های قابل تایید (RLVR) در طول پس‌آموزش استفاده می‌شود.

تکامل گردش‌کارهای عامل‌محور

این چرخش به سمت کنترل رایانه نشان می‌دهد که ما وارد عصر پالایش لایه‌ی عامل (Agent) و مدل زبانی شده‌ایم. در حالی که ربات‌های انسان‌نما نسبت به ماشین‌های خط تولید با کاربرد خاص کارایی کمتری دارند اما تطبیق‌پذیرتر هستند؛ به همین ترتیب، استفاده از GUI به مدل‌های زبانی اجازه می‌دهد به نرم‌افزارهایی دسترسی یابند که هنوز رابط خط فرمان (CLI) ندارند.

به دلیل این پیشرفت‌ها، متخصصان (از جمله مدیر پروژه Claude Code) پیشنهاد می‌کنند که کاربران فایل‌های راهنمای قدیمی مثل AGENTS.md و SKILL.md را آرشیو یا حذف کنند. مدل‌های جدید در درک پرامپت‌ها و حل مسائل بسیار کارآمدتر شده‌اند. «دست‌نشانده» کردن بیش از حد آن‌ها در این فایل‌های دستورالعمل، می‌تواند به طور غیرضروری مدل‌های جدیدتر را محدود کرده و منجر به راهکارهای ضعیف‌تر شود، هرچند این فایل‌ها برای افزایش کارایی در گردش‌کارهای خاص و تکراری همچنان مفید هستند.

سازوکار ترنسفورمر حلقوی

فراتر از قابلیت‌های عاملی، شایعاتی وجود دارد که Astra از «عمق بازگشتی» یا ترنسفورمرهای حلقوی (Looped Transformers) استفاده می‌کند. در یک ترنسفورمر (Transformer) استاندارد، داده‌ها یک‌بار از پشته‌ای از بلوک‌ها عبور می‌کنند. اما در معماری حلقوی، نمایش‌های میانی چندین‌بار از همان بلوک‌ها عبور کرده و از همان وزن‌ها (Weights) مجدداً استفاده می‌کنند.

این رویکرد اجازه می‌دهد مدل عمق موثر خود را — یعنی تعداد دفعاتی که یک توکن (Token) پردازش می‌شود — بدون افزایش تعداد کل پارامترها (Parameters) افزایش دهد. برای مثال، مدلی با ۲۲ بلوک که دو بار اجرا شود، عمق محاسباتی ۴۴ بلوک را دارد اما برای ذخیره وزن‌ها تنها به نیمی از حافظه نیاز دارد. این یک جایگزین برای افزودن ساده‌ی بلوک‌های ترنسفورمر مجزا است.

جزئیات فنی حلقه‌سازی

برای درک این سازوکار، تعریف اجزا ضروری است:

  • بلوک ترنسفورمر: واحدی شامل توجه (Attention)، ماژول پیش‌خور، نرمال‌سازی و اتصالات میان‌بر. در مقالات پژوهشی اغلب به این‌ها «لایه‌های ترنسفورمر» می‌گویند.
  • پشته (Stack): توالی از این بلوک‌های ترنسفورمر.
  • اعمال بلوک: اجرای یک ورودی از یک بلوک برای یک‌بار.

در مدل Nanbeige4.2-3B (منتشر شده در جولای)، پشته‌ای از ۲۲ بلوک دو بار اعمال می‌شود. این کار تعداد پارامترها را کم می‌کند اما محاسبات را نه؛ زیرا مسیر پیش‌رو همچنان به ۴۴ بار اعمال بلوک نیاز دارد. همچنین، هیچ صرفه‌جویی در KV Cache رخ نمی‌دهد. از آنجایی که حالت‌های میانی در دور دوم متفاوت هستند، هر اجرا به ورودی‌های حافظه کش (KV cache entries) مخصوص به خود نیاز دارد. پژوهشگران Nanbeige دریافتند که اشتراک‌گذاری KV cache بین دورها در واقع باعث کاهش عملکرد مدل می‌شود.

پژوهش‌های اخیر روی مدل‌هایی مثل Nanbeige و Ouro شرکت بایت‌دنس، روش‌های مختلفی را برای پیاده‌سازی این موضوع پیشنهاد داده‌اند:

  • حلقه‌سازی ثابت: مدل همیشه تعداد دفعات مشخصی (مثلاً دو بار در Nanbeige) از پشته عبور می‌کند. در Nanbeige مشاهده شد که افزایش حلقه‌ها از ۲ به ۳ عملکرد را بهبود می‌بخشد، اما هزینه محاسباتی اضافی آن توجیه‌پذیر نبود.
  • توقف تطبیقی: این روش که در مقاله Universal Transformer سال ۲۰۱۸ معرفی شد، از یک تابع یادگیرنده برای خروجی دادن «احتمال توقف» برای هر موقعیت استفاده می‌کند. حلقه زمانی متوقف می‌شود که احتمال تجمعی از یک آستانه فراتر رود. همچنین یک حد حداکثری برای تعداد حلقه‌ها جهت محدود کردن محاسبات تعریف می‌شود.
  • ترکیب بازگشت‌ها (MoR): رویکردی در سال ۲۰۲۵ که در آن یک مسیریاب (Router) یاد می‌گیرد برای هر توکن چند بار عبور لازم است. این کار می‌تواند از طریق «مسیریابی انتخاب خبره» (مراحل بازگشت انتخاب می‌کنند کدام توکن‌ها پردازش شوند) یا «مسیریابی انتخاب توکن» (مسیریاب در ابتدا طول مسیر را تعیین می‌کند) انجام شود.
  • حلقه‌سازی شدید: مدل Ouro-Thinking 2.6B پشته‌ای از ۴۸ بلوک را چهار بار اجرا می‌کند که منجر به ۱۹۲ بار اعمال بلوک می‌شود، در حالی که فقط وزن‌های ۴۸ بلوک را ذخیره کرده است. این مدل از یک گیت خروجی یادگیرنده برای تعیین اینکه کدام دور خروجی نهایی را ارائه دهد، استفاده می‌کند.

محک‌ها و ردپای استدلال

از نظر عملکرد، GPT-6 Astra جهشی عظیم در تعمیم‌پذیری داشته و در محک ARC-AGI-3 به نمره ۹۹.۹٪ رسیده است، در حالی که GPT-5.6 Sol تنها ۷.۸٪ کسب کرده بود. با این حال، پیشتازی آن در شاخص عامل‌های کدنویسی Artificial Analysis v1.4 تدریجی‌تر بوده است.

باید توجه داشت که محک‌هایی مانند Intelligence Index v4.2 از چارچوب‌های مختلفی استفاده می‌کنند (مثلاً Terminal-Bench v2.1 از Terminus 2 و $\tau^3$-Banking از چارچوب $\tau$-Bench استفاده می‌کند). از آنجایی که مدل‌ها اغلب روی یک چارچوب اصلی تنظیم دقیق (Fine-tune) می‌شوند، برخی ارزیابی‌های عاملی ممکن است عملکرد Astra را در محیط بومی‌اش کمتر از حد واقعی تخمین بزنند.

گمانه‌زنی‌های زیادی وجود دارد که این معماری حلقوی، ردپای استدلال مدل یا همان زنجیره تفکر (Chain-of-Thought) را «پنهان» می‌کند. تئوری این است که اگر مدل محاسبات داخلی بیشتری از طریق حلقه‌ها انجام دهد، برای رسیدن به پاسخ به توکن‌های تفکر خارجی کمتری نیاز دارد.

بحث تفسیرپذیری

مدل‌های استدلالی معمولاً از یک «تخته یادداشت» (Scratchpad) از توکن‌های متنی میانی برای بازگشت و اصلاح اشتباهات استفاده می‌کنند. اگر Astra با دقت ثابت، توکن‌های کمتری نسبت به GPT-5.6 Sol مصرف کند، احتمالاً به این دلیل است که در تلاش اول اشتباهات کمتری مرتکب می‌شود. این شبیه تفاوت بین مدل‌های Luna و Sol است که Luna برای عملکرد مشابه، ۸۰٪ توکن بیشتری مصرف می‌کند.

یاکوب پاچوکی، دانشمند ارشد OpenAI، تصریح کرد که عمق گراف محاسباتی Astra در حد دو برابر GPT-4 است. او اشاره کرد که اگرچه نظارت بر ردپای استدلال «شکننده» است و روندی منفی دارد، اما این موضوع لزوماً به تغییرات معماری مثل حلقه‌سازی وابسته نیست. او تأکید کرد که OpenAI همچنان از نظارت بر زنجیره تفکر استفاده می‌کند تا ببیند همراستاسازی چگونه از توزیع‌های آموزشی تعمیم می‌یابد.

کارایی محاسباتی و مقیاس‌پذیری

پژوهش مقاله SMELT (سپتامبر ۲۰۲۶) نشان می‌دهد که ترنسفورمرهای حلقوی از نظر محاسباتی برتر هستند. با تطبیق محاسبات به ازای هر توکن و نیازهای KV cache، SMELT دریافت که ترنسفورمرهای حلقوی از نوع ترکیب خبره‌ها (MoE)، برای رسیدن به همان میزان زیان اعتبارسنجی مدل‌های متداول، به ۶.۸٪ تا ۱۸٪ محاسبات آموزشی کمتری نیاز دارند. پژوهشگران این نتیجه را با باریک‌تر کردن بُعد پنهان (Hidden Dimension) برای جبران اعمال اضافی بلوک‌ها و افزودن خبره‌ها برای بازیابی تعداد کل پارامترها به دست آوردند.

علاوه بر این، مطالعه Beyond Parameters (ژوئن ۲۰۲۵) دریافت که اگرچه حلقه‌سازی ظرفیت مدل برای ذخیره دانش (حفظ کردن) را افزایش نمی‌دهد، اما عملکرد در مسائل ریاضی چندمرحله‌ای را به طور قابل توجهی بهبود می‌بخشد. این تایید می‌کند که محاسبات اضافی، حتی با وزن‌های مشترک، مستقیماً قابلیت‌های استدلال را تقویت می‌کند.

گونه‌های پیشرفته بازگشتی

مقالات اخیر تکامل‌های بیشتری را برجسته کرده‌اند:

  • استدلال نهان (۲۰۲۵): مدلی ۳.۵ میلیارد پارامتری که یک پشته مشترک چهار بلوکی را بین دو بلوک ابتدایی و دو بلوک انتهایی قرار می‌دهد. پشته مشترک در ابتدای هر حلقه، خروجی بلوک ابتدایی را دریافت کرده و آن را با حالت پنهان حلقه قبلی ترکیب می‌کند. این مدل از یک آستانه KL-divergence بین دورهای متوالی برای تعیین زمان توقف استفاده می‌کند. عملکرد در HellaSwag بعد از هشت حلقه متوقف می‌شود، در حالی که GSM8K و HumanEval از حلقه‌های بیشتر بهره می‌برند.
  • ترنسفورمر پهنای‌باند کامل (اوت ۲۰۲۶): این مدل از بازگشت در موقعیت‌های توکن استفاده می‌کند و حالت پنهان نهایی توکن قبلی را با بردار معنایی (Embedding) توکن جدید از طریق یک گیت یادگیرنده ترکیب می‌کند. در مدل‌های پایه، این کار ردپاهای استدلال را در MATH500 کوتاه کرد، هرچند این اثر پس از تنظیم دستورالعمل (Instruction Tuning) از بین رفت.

تحلیل: چرخش به سمت استدلال نهان

برای جامعه فنی، حرکت به سمت ترنسفورمرهای حلقوی نشان‌دهنده تغییری از «مقیاس‌بندی پارامترها» به «مقیاس‌بندی محاسبات» است. ما شاهد گذاری هستیم که در آن هدف دیگر فقط ساختن یک مغز بزرگتر نیست، بلکه اجازه دادن به مدل است تا قبل از ارائه خروجی، روی یک توکن خاص «بیشتر فکر کند».

این موضوع یک اثر درجه دوم بر تفسیرپذیری دارد. هرچه مدل‌ها کارآمدتر می‌شوند، ردپاهای استدلال متنی آن‌ها کوتاه‌تر و کم‌اطلاع‌تر می‌شود. این لزوماً یک تلاش عمدی برای پنهان کردن استدلال نیست، بلکه نشانه‌ای از افزایش هوش است؛ یک مدل توانمندتر به فضای «تخته یادداشت» کمتری برای حل همان مسئله نیاز دارد. این دقیقاً مشابه دانشجویی است که در امتحان ریاضی به دلیل آمادگی بالا، به کاغذ کمتری نسبت به همکلاسی ضعیف‌تر خود نیاز دارد.

گام بعدی شما

  • منتظر انتشار مدل‌های حلقوی با وزن‌های باز (Open Weights) باشید تا پژوهشگران بتوانند بررسی کنند آیا بازگشت داخلی واقعاً ایمنی و همراستاسازی ردپاهای استدلال را مختل می‌کند یا خیر.
  • برای درک عمیق‌تر این سیستم‌ها، راهنمای «ساخت مدل استدلالی از صفر» را مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری ثابت می‌کند که می‌توان بدون افزایش حافظه (VRAM)، قدرت استدلال را با تکرار محاسبات ارتقا داد. این دستاورد به اعتبار ادعای OpenAI در مورد کاهش هزینه‌های استنتاج در عین افزایش هوش مدل کمک می‌کند.

تأثیر برای ایران

این تحول بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران. با این حال، کاهش نیاز به حافظه برای مدل‌های قدرتمند، در آینده مسیر استقرار مدل‌های استدلالی را روی سخت‌افزارهای محدودتر در ایران هموارتر می‌کند.

·نگاه ما
تحریریه دات‌هوش

انتقال از مقیاس‌بندی پارامترها به مقیاس‌بندی محاسبات، پارادایم جدیدی را در توسعه مدل‌ها ایجاد کرده است. در واقع هدف دیگر ساخت مغزی بزرگ‌تر نیست، بلکه اجازه دادن به مدل برای «بیشتر فکر کردن» روی هر توکن است. این موضوع لزوماً برای پنهان کردن استدلال نیست، بلکه نشانه‌ی افزایش هوش است؛ همان‌طور که یک دانش‌آموز مسلط در امتحان ریاضی، به کاغذ کمتری برای پیش‌نویس نیاز دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.