پرش به محتوای اصلی
پرش به محتوای مقاله

«جایگزینی پردازش متوالی»؛ کلید درک زمینه در مدل‌های زبانی مدرن

·۲۱ شهریور ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
نمودار معماری ترنسفورمر در مدل‌های زبانی بزرگ با بلوک‌های انکدر و دیکدر و مکانیزم توجه چندسره
نمودار معماری ترنسفورمر در مدل‌های زبانی بزرگ با بلوک‌های انکدر و دیکدر و مکانیزم توجه چندسره
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

این متن یک بازبینی بنیادین در معماری ترنسفورمر است؛ تغییر ساختاری جدیدی رخ نداده اما درک مکانیسم Query-Key-Value کلید فهم تمام مدل‌های مدرن است.

تصور کنید می‌خواهید متنی را بخوانید، اما تنها یک چراغ‌قوه کوچک دارید که در هر لحظه فقط یک کلمه را روشن می‌کند؛ شما هرگز نمی‌توانید معنای کل جمله را تا پیش از رسیدن به کلمه آخر درک کنید. مدل‌های زبانی قدیمی دقیقاً همین‌گونه عمل می‌کردند و متن را به‌صورت متوالی پردازش می‌کردند. اما معماری ترنسفورمر (Transformer) این چراغ‌قوه را به یک لامپ بزرگ تبدیل کرد که تمام صفحه را به‌طور هم‌زمان روشن می‌کند و به هوش مصنوعی اجازه می‌دهد تمام کلمات یک جمله را به‌صورت هم‌زمان تحلیل کند.

طبق مستندات منتشرشده توسط پژوهشگران گوگل در سال ۲۰۱۷، این معماری با حذف پردازش متوالی، اساس پردازش زبان توسط کامپیوترها را تغییر داد و به موتور محرک سیستم‌های مدرنی مانند ChatGPT، Google Gemini و Claude تبدیل شد. این پیشرفت یک محدودیت حیاتی را برطرف کرد: مدل‌های متوالی اغلب تا زمانی که به انتهای یک جمله طولانی می‌رسیدند، زمینه (Context) ابتدای جمله را «فراموش» می‌کردند. برای مثال، در عبارت «بانک رودخانه تند بود»، یک مدل متوالی ممکن بود تا رسیدن به کلمه «تند»، در تشخیص اینکه «بانک» به یک مؤسسه مالی اشاره دارد یا ساحل رودخانه دچار مشکل شود. ترنسفورمرها با تحلیل جهانی و هم‌زمان تمام کلمات، این ابهام را در لحظه برطرف می‌کنند.

فرآیند کار با توکن‌سازی (Tokenization) — شبیه بریدن یک کیک طولانی به تکه‌های کوچک برای بلعیدن راحت‌تر — آغاز می‌شود. پیش از آنکه ترنسفورمر بتواند متنی را پردازش کند، ورودی را به واحدهای کوچک‌تری به نام توکن می‌شکند. این مفهوم توکن‌سازی اکنون فراتر از متن رفته است و در مدل‌های چندوجهی برای تبدیل پیکسل‌های تصویر به توکن‌های زبانی نیز به کار گرفته می‌شود تا مدل بتواند تصویر و متن را در یک فضای معنایی واحد درک کند. سپس این توکن‌ها به بردار معنایی (Embedding) تبدیل می‌شوند؛ یعنی نمایش‌های ریاضی یا بردارهای عددی که مدل می‌تواند آن‌ها را دستکاری کند و هر کلمه یک کارت معرفی عددی می‌گیرد که می‌گوید این واژه همسایه‌ی کدام کلمات دیگر است.

اما چون ترنسفورمرها همه چیز را هم‌زمان می‌بینند، حس ذاتی ترتیب کلمات که در گفتار انسانی وجود دارد را گم می‌کنند. برای حل این مشکل، از رمزگذاری موقعیت (Positional Encoding) استفاده می‌شود. این مرحله یک امضای ریاضی منحصربه‌فرد به هر توکن اضافه می‌کند که به‌طور مؤثر مانند شماره‌گذاری صفحات یک کتاب عمل می‌کند. این کار تضمین می‌کند که مدل تفاوت بین «سگ مرد را گاز گرفت» و «مرد سگ را گاز گرفت» را به‌درستی بفهمد.

همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، قدرت این مدل‌ها در لایه‌های پنهان آن‌هاست. قلب تپنده ترنسفورمر، مکانیزم توجه (Attention) و به‌ویژه خودتوجهی (Self-attention) است. این نوآوری واقعی به مدل اجازه می‌دهد فارغ از فاصله کلمات از یکدیگر، وزن اهمیت کلمات مختلف در یک جمله را به‌طور پویا بسنجد. برای این کار از سه مؤلفه استفاده می‌شود:

  • پرس‌وجو (Query): مدل می‌پرسد «من در حال حاضر دنبال چه چیزی هستم؟»
  • کلید (Key): مشخص می‌کند کدام کلمات دیگر در توالی متن مرتبط هستند.
  • مقدار (Value): معنای واقعی و معنایی کلمات مرتبط را ارائه می‌دهد.

به نقل از تحلیل‌های فنی، وقتی مدل عبارت «Le chat noir» را به انگلیسی ترجمه می‌کند، مکانیزم توجه تضمین می‌کند که هنگام پردازش کلمه «chat» (گربه)، مدل به‌طور هم‌زمان به «noir» (سیاه) توجه کند تا صفت به‌درستی اعمال شود.

با روی هم قرار دادن چندین لایه از این مکانیزم‌های توجه و شبکه‌های عصبی (Neural Network) پیش‌خور (Feed-forward) — که شبیه نقشه مترویی است و سیگنال را از ورودی به جواب می‌رساند — ترنسفورمرها می‌توانند روابط بسیار پیچیده زبانی را استخراج کنند. این قابلیت پردازش موازی نه تنها دقت خروجی را بالا برد، بلکه اجازه داد این مدل‌ها روی مجموعه‌داده‌های عظیم (Massive Datasets) بسیار کارآمدتر از معماری‌های قبلی آموزش ببینند. در توسعه‌های جدیدتر، برای بهینه‌سازی بازیابی اطلاعات در سیستم‌های RAG، رویکردهای پیشرفته‌ای مانند Multi-Vector برای جایگزینی متدهای سنتی فشرده‌سازی معرفی شده‌اند تا دقت استخراج معنایی افزایش یابد.

همین مقیاس‌پذیری بود که ما را از چت‌بات‌های ساده به مدل‌های زبانی بزرگ (LLM) رساند؛ مدل‌های پیشرفته‌ای که اکنون قادر به کدنویسی، استدلال و نویسندگی خلاق با روانی شبیه به انسان هستند.

گام بعدی شما

  • برای درک عمیق‌تر، مقاله اصلی گوگل با عنوان «Attention Is All You Need» را مطالعه کنید.
  • تفاوت بین مدل‌های Encoder-only (مثل BERT) و Decoder-only (مثل GPT) را بررسی کنید.
  • سعی کنید با ابزارهای بصری‌سازی Attention، نحوه ارتباط کلمات در یک جمله را مشاهده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک اینکه چرا GPUها برای این معماری حیاتی هستند، به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری استاندارد طلایی تمام مدل‌های مولد فعلی است و بدون آن، پردازش زبان طبیعی در سطح انسانی غیرممکن بود. اعتبار این مدل از توانایی آن در مقیاس‌پذیری (Scaling) می‌آید که اجازه می‌دهد با افزودن داده و سخت‌افزار، هوشمندی مدل افزایش یابد.

تأثیر برای ایران

این معماری زیربنای تمام مدل‌های فارسی‌زبان است. توسعه‌دهندگان ایرانی برای بهینه‌سازی مدل‌های محلی باید روی تکنیک‌های کاهش هزینه استنتاج در لایه‌های Attention تمرکز کنند.

·نگاه ما
تحریریه دات‌هوش

ترنسفورمرها در واقع مفهوم «حافظه» را در مدل‌های زبانی از یک نوار خطی به یک فضای چندبعدی تبدیل کردند. این تغییر باعث شد مدل‌ها به‌جای پیش‌بینی کلمه بعدی بر اساس تاریخچه، بر اساس «ارتباطات معنایی» عمل کنند. به نظر ما، نقطه شکست مدل‌های فعلی، همان مکانیسم توجه است که با افزایش طول متن، هزینه‌های محاسباتی را به‌صورت نمایی افزایش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.