پرش به محتوای اصلی
پرش به محتوای مقاله

درون معماری ترنسفورمرهای چندوجهی؛ تبدیل پیکسل‌ها به توکن‌های زبانی

·۱۵ شهریور ۱۴۰۵۱۸ دقیقه مطالعه۲ بازدید
ترنسفورمرهای چندوجهی: چگونه مدل‌های زبانی بزرگ یاد می‌گیرند ببینند
ترنسفورمرهای چندوجهی: چگونه مدل‌های زبانی بزرگ یاد می‌گیرند ببینند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «آموزش بینایی به مدل زبانی» به «ترجمه بینایی به توکن‌های زبانی»؛ این یعنی مدل زبانی نیازی به تغییر ندارد و فقط یک مترجم (Connector) برای داده‌های جدید می‌خواهد.

تصور کنید می‌خواهید به یک نابینا توصیف کنید که در یک عکس چه می‌گذرد؛ شما تصویر را به کلمات تبدیل می‌کنید تا او بتواند با منطق زبانی‌اش آن را بفهمد. هوش مصنوعی چندوجهی دقیقاً همین کار را می‌کند: تبدیل پیکسل‌ها به توکن‌هایی که برای یک مدل زبانی قابل درک باشد.

به نقل از شریجیت ونکاترامانا (Shrijith Venkatramana)، راز این فناوری در این است که مدل زبانی را مجبور نمی‌کنند پیکسل‌ها را ببیند، بلکه یک نمایش مشترک ایجاد می‌کنند تا مدل بتواند روی داده‌های بصری به‌گونه‌ای استدلال کند که انگار با متن طرف است. این رویکرد به این دلیل ممکن است که یک ترنسفورمر (Transformer) — ساختاری که مثل یک مدیر پروژه، توجه را بین بخش‌های مختلف داده تقسیم می‌کند — اساساً اهمیتی نمی‌دهد که توکن ورودی از یک کلمه آمده باشد یا از یک تکه تصویر.

این چرخش، ترنسفورمر را از ابزاری صرفاً زبانی به یک رابط عمومی برای داده‌های ناهمگون تبدیل می‌کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی استانداردسازی ساختارهای داده برای مدل‌های زبانی اشاره کردیم، صنعت اکنون به سمت استانداردسازی داده‌های بصری و شنیداری حرکت می‌کند. برای یک توسعه‌دهنده، این یعنی بخش «بینایی» مدل در واقع یک سرویس تخصصی است که یک قرارداد API استاندارد را به هسته استدلالی مدل می‌فرستد. در همین راستا، برخی از نوآوری‌های اخیر در بازطراحی معماری ترنسفورمر تلاش می‌کنند تا هزینه‌های عملیاتی این مدل‌های پیچیده را کاهش دهند.

گلوگاه پیکسل‌ها

دادن یک تصویر خام به یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — از نظر محاسباتی غیرممکن است. یک تصویر استاندارد ۱۰۲۴ در ۱۰۲۴ شامل بیش از یک میلیون پیکسل است. از آنجا که هزینه خودتوجهی (Self-Attention) به‌صورت مربعی رشد می‌کند، افزایش ۱۰۰ برابری طول توالی، فشار محاسباتی را تقریباً ۱۰ هزار برابر می‌کند.

برای حل این مشکل، سامانه‌های چندوجهی از فشرده‌سازی استفاده می‌کنند. آن‌ها تصاویر عظیم را به توکیالی کوتاهی از بردارهای اطلاعاتی تبدیل می‌کنند. چالش اصلی مهندسی اینجاست: حفظ جزئیات کافی برای استدلال، در حالی که تعداد توکن‌ها برای استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی نه دوره آموزش آشپز — پایین بماند. این فشار بر روی استنتاج است که باعث شده مدل‌های زبانی کوچک‌تر به دلیل کاهش هزینه‌های عملیاتی در محیط‌های تولیدی محبوبیت بیشتری پیدا کنند.

تکامل ترنسفورمرهای بینایی

نخستین جهش بزرگ در سال ۲۰۲۰ رخ داد؛ زمانی که گوگل ریسرچ (Google Research) مدل Vision Transformer (ViT) را معرفی کرد. ViT به‌جای بررسی تک‌تک پیکسل‌ها، تصویر را به تکه‌های کوچک (Patches) تقسیم می‌کند.

در یک تصویر ۲۲۴ در ۲۲۴، این مدل ممکن است از تکه‌های ۱۶ در ۱۶ پیکسل استفاده کند که در نهایت ۱۹۶ تکه ایجاد می‌شود. هر تکه تخت شده و از طریق یک تصویرسازی خطی به ابعاد مدل منتقل می‌شود. این کار باعث می‌شود تصویر برای ترنسفورمر شبیه به یک جمله به نظر برسد. با افزودن اطلاعات موقعیتی، مدل می‌فهمد کدام تکه در بالا-چپ و کدام در پایین-راست است.

همراستاسازی جهان‌ها با CLIP

در سال ۲۰۲۱، OpenAI مدل CLIP را معرفی کرد تا به تصاویر و متن‌ها بیاموزد از یک سیستم مختصاتی مشترک استفاده کنند. CLIP به‌جای استفاده از برچسب‌های ثابت، با استفاده از ۴۰۰ میلیون جفت تصویر-متن از اینترنت، یاد گرفت کدام شرح با کدام تصویر سازگار است.

این مدل قدرت نظارت ضعیف را نشان داد. با نزدیک کردن بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که می‌گوید این کلمه همسایه‌ی چه کلمات دیگری است — عبارت «سگی در حال دویدن» و تصویر یک سگ در یک فضای مشترک، زبان به ابزاری برای اشاره به مفاهیم بصری تبدیل شد. این مفهوم از نمایش‌های برداری، مشابه آن چیزی است که در بهینه‌سازی بازیابی اسناد تخصصی از طریق تنظیم دقیق مدل‌های چندبرداری مشاهده می‌کنیم. با این حال، CLIP یک مدل مولد نیست و نمی‌تواند به سوالات پیچیده پاسخ دهد؛ برای این کار، باید به یک مدل زبانی متصل شود.

سه معماری اصلی چندوجهی

سامانه‌های مدرن از سه روش برای اتصال بینایی و زبان استفاده می‌کنند:

  • الحاق (Concatenation): ساده‌ترین روش است که بردارهای بصری را مستقیماً به ابتدای توکن‌های متنی می‌چسباند. اما چون فضای معنایی این دو متفاوت است، این کار شبیه ارسال حافظه خام یک برنامه به برنامه دیگر بدون داشتن رابط (Interface) است.
  • متصل‌کننده‌های یادگیرنده (Learned Connectors): در مدل‌هایی مثل BLIP-2 استفاده می‌شود. یک جزء کوچک مثل Q-Former بین رمزگذار بینایی و مدل زبانی قرار می‌گیرد و خلاصه‌ای فشرده (مثلاً تبدیل ۵۷۶ توکن بصری به ۳۲ پرس‌وجوی یادگرفته‌شده) تولید می‌کند تا محاسبات کاهش یابد.
  • توجه متقاطع (Cross-Attention): در مدل Flamingo شرکت DeepMind استفاده شده است. ویژگی‌های بصری در سراسر مدل زبانی تزریق می‌شوند و مدل می‌تواند هنگام تولید متن، به‌صورت انتخابی به بخش‌های تصویر توجه کند.

ریاضیات توجه متقاطع

در این سازوکار، پرس‌وجوها (Q) از متن و کلیدها (K) و مقادیر (V) از تصویر می‌آیند. مدل در واقع می‌پرسد: «کدام بخش‌های تصویر با کلمه‌ای که اکنون پیش‌بینی می‌کنم مرتبط است؟»

اگر تصویر شامل سگ، چمن و یک دیسک پرنده قرمز باشد و مدل در حال پیش‌بینی عبارت «سگ در حال گرفتن...» باشد، وزن بالایی به ویژگی‌های دیسک پرنده و وزن کمی به چمن اختصاص می‌دهد. مدل در حال شمارش نمادین نیست، بلکه ویژگی‌های بصری توزیع‌شده را به بسترهای زبانی نگاشت می‌کند.

اقتصاد توکن‌های بصری

بستر بصری رایگان نیست. یک تصویر می‌تواند صدها یا هزاران توکن به پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — اضافه کند. برای مثال، ۱۰ تصویر با ۵۷۶ توکن برای هر کدام، ۵۷۶۰ توکن به پرامپت اضافه می‌کند.

ویدیوها بسیار گران‌تر هستند. یک ویدیوی ۱۰ دقیقه‌ای که هر نیم ثانیه یک فریم از آن نمونه‌برداری شود، ۲۰۰ فریم ایجاد می‌کند که در مجموع ۱۱۵,۲۰۰ توکن بصری می‌سازد. این حجم از داده اکثر خطوط استنتاج را مختل می‌کند. بنابراین، سامانه‌های عملیاتی باید به‌شدت نمونه‌برداری کنند یا از برش‌های انتخابی استفاده کنند.

واقعیت‌های تأخیر و توان عملیاتی

اگر یک مدل زبانی ۱۰۰ توکن در ثانیه تولید کند، پاسخی با ۱۰۰۰ توکن متن ۱۰ ثانیه زمان می‌برد. اما اگر افزودن یک تصویر ۲۰۰۰ توکن محاسباتی اضافه کند، زمان پاسخ‌دهی به حدود ۳۰ ثانیه می‌رسد. هرچند بهینه‌سازی‌های سخت‌افزاری این زمان را کم می‌کنند، اما اصل موضوع باقی است: بستر بصری یک مالیات محاسباتی سنگین است.

کارایی آموزش و LLaVA

یکی از یافته‌های مهم BLIP-2 این است که نیازی به آموزش مجدد مدل زبانی عظیم نیست. با ثابت نگه داشتن مدل‌های بنیادی و تنها آموزش متصل‌کننده کوچک، این مدل در آزمون‌های پرسش‌وپاسخ تصویری (VQA) با پارامترهای آموزشی ۵۴ برابر کمتر، از Flamingo 80B پیشی گرفت.

این مسیر به مدل‌هایی مثل LLaVA منجر شد که از تنظیم دستوری بصری برای ساخت دستیارهای تعاملی استفاده می‌کنند. اکنون توسعه‌دهندگان می‌توانند تصاویری را به‌عنوان بخشی از یک آرایه JSON به مدل بفرستند تا مدل خطاهای خاص (مثلاً تضاد پورت‌های شبکه در یک اسکرین‌شات) را شناسایی کند.

نقاط شکست معماری

با وجود قدرت زیاد، این مدل‌ها نقاط ضعف سیستماتیکی دارند:

  • شمارش: آن‌ها در شمارش دقیق مشکل دارند. مدل ممکن است «چند سیب» را تشخیص دهد اما در شمارش دقیق ۷ سیب شکست بخورد چون نمایش‌های پیوسته، شمارش نمادین تولید نمی‌کنند.
  • استدلال فضایی: تشخیص «چپ» یا «راست» ساده است، اما مختصات پیچیده (مثلاً «دو جایگاه چپ و یک ردیف پایین‌تر از مثلث») دشوار است.
  • از دست رفتن وضوح: اگر جزئیات حیاتی (مثل یک کد خطای کوچک) در اثر فشرده‌سازی حذف شوند، مدل هرگز آن‌ها را نمی‌بیند.
  • توهم (Hallucination): وقتی شواهد بصری ضعیف باشند، پیش‌فرض‌های زبانی مدل غلبه می‌کنند و مدل توصیفی روان اما کاملاً غلط ارائه می‌دهد.

چرخش به سمت مهندسی نمایش

درس بزرگ این است که مدل زبانی در حال تبدیل شدن به مرکز یک شبکه حسگر است. ترنسفورمر دیگر فقط یک مدل زبانی نیست، بلکه یک هسته استدلال عمومی است. چالش مهندسی از «اندازه مدل» به «تعامل‌پذیری نمایش‌ها» تغییر کرده است.

توسعه‌دهندگان اکنون باید تصمیم بگیرند چه اطلاعاتی، با چه وضوحی و با چه هزینه محاسباتی از مرز بینایی به زبان عبور کند تا تعادلی بین جزئیات و تأخیر ایجاد شود.

ارزیابی سامانه‌های چندوجهی

برای ارزیابی یک مدل، باید فراتر از نام مدل بینایی رفت و پرسید:

  • هر تصویر چند توکن تولید می‌کند؟
  • متصل‌کننده چگونه ویژگی‌ها را به مدل زبانی نگاشت می‌کند؟
  • آیا ویژگی‌ها یک‌بار وارد می‌شوند یا از طریق توجه متقاطع دسترسی دارند؟
  • مدل چگونه ویدیوها یا تصاویر با وضوح بالا را مدیریت می‌کند؟

کیفیت چندوجهی صرفاً مجموع کیفیت بینایی و کیفیت زبانی نیست؛ یک رمزگذار بینایی عالی با یک متصل‌کننده ضعیف، مدلی متوسط تولید می‌کند.

گام بعدی شما

  • هنگام انتخاب مدل چندوجهی، ابتدا تعداد توکن‌های تولید شده برای هر تصویر را بررسی کنید تا از انفجار هزینه استنتاج جلوگیری کنید.
  • برای کارهای حساس به جزئیات (مثل تحلیل کد یا اسناد)، از مدل‌هایی استفاده کنید که قابلیت پردازش تصاویر با وضوح بالا (High-Res) یا برش‌های پویا را دارند.
  • در پرامپت‌های خود، مدل را مجبور کنید ابتدا توصیف بصری را بنویسد و سپس استدلال کند تا نرخ توهم کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری هزینه افزودن حس‌های جدید (صوت، ویدیو، حسگر) را به‌شدت کاهش می‌دهد و مدل‌های زبانی را به هسته‌های استدلال عمومی تبدیل می‌کند. اعتبار این رویکرد با موفقیت مدل‌هایی چون LLaVA در کاهش پارامترهای آموزشی ثابت شده است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی، استفاده از مدل‌های بازوزن مثل LLaVA فرصتی است تا بدون نیاز به سخت‌افزارهای عظیم، مدل‌های تخصصی بینایی-زبانی برای صنایع داخلی بسازند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از افزایش پارامترها به سمت بهینه‌سازی «پهنای باند نمایش» تغییر کرده است. این یعنی برنده نهایی لزوماً مدلی با بیشترین داده نیست، بلکه مدلی است که بتواند با کمترین توکن، بیشترین معنای بصری را به هسته استدلالی منتقل کند. در واقع، ترنسفورمر در حال تبدیل شدن به یک سیستم‌عامل برای هر نوع داده‌ای است، نه فقط متن.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.