پرش به محتوای اصلی
پرش به محتوای مقاله

ترنسفورمرها با حذف پردازش ترتیبی گرهٔ حافظه و سرعت در NLP را گشودند

·۱۲ مرداد ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
راهنما
نقشه‌راه یادگیری: چرا پردازش زبان طبیعی به ترنسفورمرها نیاز داشت؟
نقشه‌راه یادگیری: چرا پردازش زبان طبیعی به ترنسفورمرها نیاز داشت؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

این متن یک بازبینی تاریخی است و خبر از قابلیت جدیدی نمی‌دهد؛ بلکه سیگنال اصلی آن تبیین این نکته است که ترنسفورمرها نه با بهبود تدریجی، بلکه با حذف کامل مفهوم «ترتیب» در پردازش، گره‌های ده ساله NLP را گشودند.

یک توالی ساده از کلمات می‌تواند معنای کل جمله را تغییر دهد، اما این معمای کوچک دهه‌ها هوش مصنوعی را فلج کرده بود. ظهور ترنسفورمر (Transformer) سرانجام با کنار گذاشتن کامل پردازش گام‌به‌گام زبان، این بن‌بست را شکست.

برای درک این چرخش، باید به تلاش‌های نافرجام برای مدل‌سازی ابهامات انسانی نگاه کنیم. طبق گزارشی که در ۲ آگوست ۲۰۲۶ در وب‌سایت dev.to منتشر شد، هوش مصنوعی‌های اولیه شکست می‌خوردند چون کلمه‌ای مثل «بانک» برای تفکیک بین «ساحل رودخانه» و «مؤسسه مالی» به دانش جهان واقعی نیاز دارد. برای مثال، جمله «من کنار بانک رودخانه نشستم» معنایی کاملاً متفاوت از «من در بانک پول گذاشتتم» دارد. این چالش بنیادی نشان می‌دهد که مدل‌های زبانی برای درک عمیق، به چیزی فراتر از الگوهای آماری نیاز دارند؛ موضوعی که در تحلیل ما درباره ضرورت مدل‌های جهانی برای ابداع نظریات علمی به تفصیل بررسی شده است. همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، این جهش معماری صرفاً برای ساخت چت‌بات‌های بهتر نیست، بلکه درباره‌ی تغییر بنیادین در نحوه‌ی نمایش معنا توسط ماشین‌هاست.

عصر قوانین سخت‌گیرانه

از دهه ۱۹۵۰ تا ۱۹۸۰، پردازش زبان طبیعی (NLP) — حوزه‌ای از هوش مصنوعی که هدفش درک، تفسیر و تولید زبان انسانی توسط کامپیوترهاست — بر قوانین دستی تکیه داشت. زبان‌شناسان و مهندسان، دستور زبان‌های نمادین و الگوهای منظم (Regex) یا همان عبارت‌های منظم (مانند [A-Z][a-z]*) را می‌نوشتند تا متن‌ها را دسته‌بندی کنند.

دستور زبان‌های نمادین نسخه‌ای پیشرفته از تطبیق الگو بودند که ساختار جمله را در نظر می‌گرفتند و بر عبارت‌های خاص اسمی و فعلی تمرکز داشتند. اما این سامانه‌ها به دلیل ابهام زیاد، ابعاد بالای داده‌ها و وابستگی شدید زبان به بستر متن، به بن‌بست رسیدند.

زبان تغییرات بی‌شماری دارد. نوشتن قانون دستی برای هر حالت خاص (edge case) منجر به پیچیدگی‌های riddled-with-bugs یا پر از خطایی شد که هرگز مقیاس‌پذیر نبود. علاوه بر این، این سیستم‌ها فقط آنچه را که صریحاً به عنوان قانون تعریف شده بود می‌فهمیدند و هیچ چیز بیشتر؛ آن‌ها فاقد توانایی حل ابهامات با استفاده از نظم‌ها و regularities آماری بودند.

چرخش به سمت آمار

در دهه ۱۹۹۰، این حوزه به سمت آمار متون (Corpus Statistics) حرکت کرد. به‌جای کدنویسی صریح دستور زبان از طریق قوانین دست‌نویس، مدل‌ها احتمال حضور یک کلمه را بر اساس کلمات قبلی تخمین می‌زدند و این کار را از طریق شمارش فراوانی‌ها در مجموعه‌های متنی بزرگ یاد می‌گرفتند. این کار نیاز به نویسندگی دستی قوانین را حذف کرد و اجازه داد مدل به‌جای تکیه بر شهود زبان‌شناسان، از داده‌ها تعمیم یابد.

یک n-gram نمونه‌ای کلاسیک از این رویکرد آماری اولیه است. n-gram صرفاً توالی‌ای از n کلمه پشت سر هم است. ایده اصلی این است که با پرسیدن این سوال که «در تمام متونی که دیده‌ام، چه کلمه‌ای معمولاً بعد از این توالی می‌آید؟»، کلمه n-ام را پیش‌بینی کند.

  • مثال از Trigram (n=3): مدل دو کلمه قبلی را می‌بیند تا کلمه سوم را پیش‌بینی کند. اگر در مجموعه‌داده‌های آموزشی جملاتی مثل «گربه روی فرش نشست»، «گربه روی صندلی نشست» و «سگ روی کف نشست» وجود داشته باشد و کاربر بنویسد «گربه روی»، مدل می‌شمارد که کلمه «نشست» ۲ بار از ۲ حالت بعد از «گربه روی» ظاهر شده است. سپس کلمه «نشست» را با اطمینان بالا پیش‌بینی می‌کند.
  • تنوع: این منطق در طول‌های مختلف، مثل bigram (۲ کلمه) یا trigram (۳ کلمه) مقیاس می‌یابد.

با این حال، n-gramها از یک پنجرهٔ زمینه (Context Window) ثابت رنج می‌بردند. مدلی که بر اساس n-1 کلمه قبلی شرطی شده است، هیچ مکانیزمی برای گنجاندن اطلاعاتی که در ابتدای توالی آمده بود ندارد. آن‌ها هیچ بازنمایی از معنا در سطح سند (document-level semantics) نداشتند و فقط الگوهای هم‌رخداد محلی (local co-occurrence) را ثبت می‌کردند.

یادگیری عمیق و نبرد با حافظه

مدل‌های یادگیری عمیق برای گسترش قابلیت‌های n-gram و درک معنا در سطح سند طراحی شدند. هدف آن‌ها حل دو مشکل اصلی بود: نخست، نمایش معنای توکن (Token) به شکلی غنی‌تر از یک شمارش ساده‌ی تکرار، و دوم، حفظ زمینه در توالی‌هایی با طول دلخواه.

برای نمایش توکن‌ها، پژوهشگران بردار معنایی یا جای‌گذاری‌ها (Embeddings) را توسعه دادند. این کار شامل نگاشت توکن‌ها به بردارهای متراکم (لیستی از اعداد) در یک فضای پیوسته است. در این سیستم، نزدیکی هندسی بین بردارها با شباهت معنایی یا نحوی رابطه مستقیم دارد. برای درک دقیق‌تر این فرآیند و نحوه تبدیل کلمات به اعداد، می‌توانید کالبدشکافی مهندسی مدل‌های زبانی از توکن‌سازی تا حافظه را مطالعه کنید.

برای مدیریت توالی‌ها، از شبکه‌های عصبی بازگشتی (RNN) استفاده شد. یک RNN جمله را کلمه به کلمه پردازش می‌کند و هر کلمه را یک «گام زمانی» (timestep) می‌بیند.

نمودار: چرا پردازش زبان طبیعی به ترنسفورمرها نیاز داشت؟ تحول از شبکه‌های بازگشتی به توجه خودکار.

در هر گام زمانی، RNN دو عمل انجام می‌دهد:
۱. کلمه فعلی را بررسی می‌کند.
۲. آن کلمه را با یک خلاصه جاری از تمام آنچه تا کنون دیده شده است ترکیب می‌کند که به آن بردار حالت پنهان (hidden state vector) می‌گویند.

برای عبارت «گربه نشست»، روند این‌گونه است:

  • گام ۱: خواندن «گربه» $ \rightarrow $ به‌روزرسانی حالت پنهان برای بازتاب «گربه».
  • گام ۲: خواندن «نشست» $ \rightarrow $ ترکیب آن با حالت گام اول $ \rightarrow $ به‌روزرسانی حالت پنهان برای بازتاب «گربه نشست».

RNNها با یک نقص حیاتی روبرو بودند: اندازه حالت پنهان ثابت است و پیش از آموزش انتخاب می‌شود. برای باز کردن جا برای کلمات جدید، مدل مجبور است اطلاعات قدیمی را فشرده کند. این منجر به «مشکل محوشدن گرادیان» (Vanishing Gradient Problem) شد که در آن جزئیات ابتدایی متن به‌سادگی محو یا رقیق می‌شدند و از بین می‌رفتند.

مدل‌های حافظه کوتاه-مدت بلندمدت (LSTM) نسخه‌ی ارتقایافته‌ای از RNN بودند که مشخصاً برای مبارزه با این مشکل طراحی شدند. LSTMها اجزای یادگیرنده‌ی کوچکی به نام «درگاه‌ها» (Gates) را در هر گام زمانی اضافه کردند تا تصمیم بگیرند:

  • چه چیزی از حالت پنهان قدیمی فراموش شود (اطلاعات قدیمی بی‌ربط).
  • چه چیزی از کلمه فعلی اضافه شود (اطلاعات جدید مرتبط).
  • چه چیزی به گام بعدی ارسال شود.

به‌جای فشرده‌سازی کورکورانه، LSTM یاد می‌گیرد فعالانه تصمیم بگیرد کدام جزئیات به اندازه‌ای اهمیت دارند که نگه داشته شوند. با این حال، مشکل محوشدن گرادیان فقط تا حدی کاهش یافت؛ توالی‌های بسیار بلند همچنان احتمال از دست دادن اطلاعات را داشتند.

جهش ترنسفورمر

با وجود پیشرفت LSTMها، دو گلوگاه باقی مانده بود: زوال اطلاعات در توالی‌های بلند و «گلوگاه ترتیبی». چون در RNNها گام دوم به خروجی گام اول وابسته است، نمی‌توان آموزش را در طول زمان موازی کرد.

مقاله سال ۲۰۱۷ با عنوان «Attention Is All You Need»، ترنسفورمر را معرفی کرد که بازگشت ترتیبی (Sequential Recurrence) را به‌طور کامل کنار گذاشت. این معماری، پنجره‌های لغزان و حالت‌های پنهان فشرده را با مکانیزمی به نام خودتوجهی (Self-attention) جایگزین کرد.

خودتوجهی یاد می‌گیرد که کدام کلمات در یک جمله با کدام کلمات دیگر مرتبط هستند و این را کاملاً از طریق الگوهای موجود در داده‌های آموزشی می‌آموزد. به‌جای انتقال یک خلاصه توکن-به-توکن، یک نمایش وزنی از تمام توکن‌های توالی را به‌طور مستقیم در یک عملیات واحد محاسبه می‌کند.

این تغییر دو مشکل اصلی را حل کرد:

  • دقت: چون خودتوجهی امتیاز ارتباط را با تمام توکن‌های دیگر می‌سنجد، هر دو توکن در یک توالی، فارغ از فاصله، مسیر محاسباتی مستقیم به یکدیگر دارند. این کار زوال اطلاعاتی را که در انتقال ترتیبی ذاتی بود، حذف کرد.
  • کارایی آموزش: چون توجه نیازی به پردازش ترتیبی سخت‌گیرانه ندارد، محاسبات به‌طور بهینه روی سخت‌افزارهای شتاب‌دهنده مدرن مثل GPUها و TPUها موازی می‌شوند.

ترکیب مدل‌سازی موثر زمینه و کارایی آموزش بود که ترنسفورمرها را به یک گسست تکنولوژیک (Discontinuity) تبدیل کرد و نه فقط یک بهبود تدریجی؛ امری که اجازه داد مقیاس مدل‌ها و مجموعه‌داده‌ها چندین مرتبه (Orders of magnitude) افزایش یابد. برای مدیریت این مقیاس عظیم بدون افزایش بی‌رویه هزینه‌ها، معماری‌های جدیدتری مانند ترکیب خبره‌ها (MoE) برای کاهش هزینه استنتاج توسعه یافتند.

خلاصه تکاملی

هر معماری، دقیقاً برای حل محدودیت معماری قبلی طراحی شد:

  • سیستم‌های قاعده‌مند: به دلیل تغییرات بی‌شمار زبان، در پوشش جامع شکست خوردند.
  • مدل‌های آماری: مشکل پوشش را حل کردند اما در اندازه پنجره زمینه و معنا در سطح سند شکست خوردند.
  • یادگیری عمیق بازگشتی (RNN/LSTM): انتقال زمینه را در تئوری حل کردند اما در حفظ اطلاعات بلندمدت و موازی‌سازی آموزش شکست خوردند.
  • ترنسفورمرها: هر دو مشکل دقت و کارایی را با بهره‌گیری از خودتوجهی حل کردند.

ترنسفورمرها ارتباط و معنا را مستقیماً از داده‌ها می‌گیرند، بدون نیاز به قوانین دستی یا محدودیت‌های ترتیبی سخت‌گیرانه. برای توسعه‌دهندگان مدرن، تمرکز از «چگونه قانون بنویسیم» به «چگونه داده‌ها را گلچین کنیم» تغییر کرده است. گلوگاه دیگر حافظه معماری نیست، بلکه کیفیت اطلاعاتی است که به مدل خورانده می‌شود.

برای مشاهده این سازوکار در عمل، می‌توانید بررسی کنید که چگونه «ماسک‌های توجه» (Attention Masks) به مدل‌ها اجازه می‌دهند پنجره‌های متنی عظیم را در کاربردهای بلادرنگ مدیریت کنند.

گام بعدی شما

  • بررسی مقاله «Attention Is All You Need» برای درک ریاضیات لایه‌های توجه.
  • آزمایش تفاوت پاسخ‌دهی مدل‌های RNN قدیمی با ترنسفورمرها در متون بالای ۱۰۰۰ کلمه.
  • مطالعه درباره «ماسک‌های توجه» برای درک نحوه مدیریت پنجره‌های متنی عظیم در کاربردهای بلادرنگ.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول با تکیه بر اعتبار پژوهشی گوگل در سال ۲۰۱۷، امکان آموزش مدل‌هایی با میلیاردها پارامتر را فراهم کرد که پیش از آن به‌دلیل محدودیت‌های RNN غیرممکن بود. بدون ترنسفورمرها، عصر مدل‌های زبانی بزرگ و ابزارهایی مثل ChatGPT هرگز آغاز نمی‌شد.

تأثیر برای ایران

این مفاهیم پایه برای هر برنامه‌نویس ایرانی که قصد توسعه یا Fine-tuning مدل‌های زبانی را دارد ضروری است. درک تفاوت RNN و ترنسفورمر، به بهینه‌سازی هزینه‌های استنتاج در پروژه‌های داخلی کمک می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی پردازش ترتیبی با موازی‌سازی در ترنسفورمرها، در واقع تغییر پارادایم از «درک زبان به مثابه یک جریان زمانی» به «درک زبان به مثابه یک گراف از روابط» بود. این جهش نشان می‌دهد که در هوش مصنوعی، هرگاه بتوانیم یک محدودیت فیزیکی (مثل زمان یا ترتیب) را با قدرت محاسباتی (Compute) جایگزین کنیم، به جهشی در کیفیت دست می‌یابیم. اکنون محدودیت ما دیگر ساختار مدل نیست، بلکه کیفیت داده‌های آموزشی است که سقف توانایی مدل‌ها را تعیین می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.