پرش به محتوای اصلی
پرش به محتوای مقاله

سازوکار تبدیل نویز ریاضی به ویدیوهای واقع‌گرایانه در هوش مصنوعی زاینده

·۴ مهر ۱۴۰۵۸ دقیقه مطالعه۲ بازدید
راهنما
سگ‌ها در حال قدم زدن روی مریخ هستند
سگ‌ها در حال قدم زدن روی مریخ هستند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر بنیادین از پردازش پیکسل‌محور به پردازش توکن‌های بصری در فضای نهان (DiT)؛ این یعنی ویدیوها دیگر مجموعه‌ای از عکس‌ها نیستند، بلکه شبیه‌سازی‌های سه‌بعدی زمان-مکان هستند.

تصور کنید یک جمله ساده بتواند سگی طلایی‌رنگ با لباس فضانوردی را در حال کاوش در مریخ خلق کند؛ این دیگر جادوی سینمایی نیست، بلکه نتیجه‌ی یک خط لوله‌ی پیچیده است که واقعیت را از نویز ریاضی خالص می‌سازد. همان‌طور که در تحلیل فنی منتشر شده در ۲۶ سپتامبر ۲۰۲۶ در وب‌سایت dev.to آمده است، این قابلیت به جای جست‌وجو در تصاویر موجود، آن‌ها را از ابتدا سنتز می‌کند.

بسیاری از کاربران تصور می‌کنند هوش مصنوعی زاینده (Generative AI) شبیه به یک کلاژ دیجیتال کار می‌کند که تکه‌های مختلف را از تصاویر موجود برش داده و کنار هم می‌چسباند، اما سازوکار واقعی آن بیشتر شبیه به یک فرآیند مجسمه‌سازی ریاضی است. در این سیستم، مدل ابتدا باید زبان انسان را به یک نقشه‌ی بصری ترجمه کند و سپس بومی از برفک‌های تصادفی را به صورت تکرار شونده به یک صحنه‌ی منسجم تبدیل نماید.

پل ارتباطی زبانی

برای شروع، سیستم باید کلمات را به مفاهیم بصری متصل کند و برای این کار از یک رمزگذار متن-تصویر چندوجهی استفاده می‌کند. CLIP (Contrastive Language-Image Pre-training) متعلق به OpenAI در اینجا نقش یک لغت‌نامه‌ی جهانی را ایفا می‌کند که کلمات و تصاویر را روی یک شبکه‌ی ریاضی مشترک قرار می‌دهد. این معماری از یک رمزگذار متن (Transformer) و یک رمزگذار بینایی (ViT/CNN) استفاده می‌کند تا بردارهای معنایی (Embedding) ایجاد کند که در یک فضای برداری چندوجهی مشترک با هم تلاقی می‌کنند.

در طول مرحله‌ی آموزش، CLIP صدها میلیون جفت تصویر-شرح را که از وب جمع‌آوری شده‌اند، تحلیل کرده است. این مدل یاد گرفته است که هرگاه کلمه‌ی «پُرزدار» در یک شرح ظاهر می‌شود، تصویر مربوطه معمولاً دارای خز نرم، پر یا ابر است. با گذشت زمان، CLIP این مفاهیم را در یک فضای ریاضی مشترک ترسیم می‌کند، به طوری که کلماتی با معانی مشابه، مانند «سگ» و «سگ‌سان»، در نزدیکی یکدیگر قرار می‌گیرند.

وقتی شما یک پرامپت وارد می‌کنید، رمزگذار متن شما را به یک بردار عددی — یا یک نقشه‌ی راه — تبدیل می‌کند که دقیقاً جایگاه آن مفاهیم را در فضای بصری مشترک مشخص می‌کند. این فرآیند تضمین می‌کند که تصویر یک سگ دقیقاً در کنار کلمه‌ی متنی «سگ» و تصویر یک سیاره‌ی قرمز در کنار کلمه‌ی «مریخ» نقشه‌برداری شود.

بهره‌وری از طریق فضای نهان

پردازش تک‌تک پیکسل‌های یک تصویر 4K برای تولید آنی از نظر محاسباتی غیرممکن است. اگر یک هوش مصنوعی بخواهد هر پیکسل را به طور هم‌زمان پردازش کند، تولید یک عکس ساعت‌ها زمان می‌برد و مقدار عظیمی از قدرت پردازشی را مصرف می‌کند. برای حل این مشکل، پژوهشگران از مدل‌های انتشار نهان (Latent Diffusion Models) استفاده می‌کنند، همان‌طور که در مقاله‌ی جریان‌ساز High-Resolution Image Synthesis with Latent Diffusion Models تشریح شده است.

یک خودرمزگذار وردشی (VAE) پیکسل‌های خام را به یک نقشه‌ی ریاضی سبک به نام فضای نهان (Latent Space) فشرده می‌کند. این فرآیند شبیه به یک فایل ZIP یا پیش‌نویس گلی یک مجسمه‌ساز عمل می‌کند و یک «گلوگاه فشرده‌سازی» ایجاد می‌کند که به موتور انتشار اجازه می‌دهد روی نسخه‌ی ساده‌شده‌ای از تصویر عملیات انجام دهد.

جزئیات این فشرده‌سازی ادراکی به شرح زیر است:

  • گلوگاه: یک تصویر خام با رزولوشن بالا (۱۰۲۴ در ۱۰۲۴ در ۳ کانال RGB) دارای حدود ۳,۱۴۵,۷۲۸ مقدار است. رمزگذار VAE این مقدار را با مقیاس ۸ برابر فشرده می‌کند.
  • فضای نهان: فضای نهان حاصل (۶۴ در ۶۴ در ۴) تنها حاوی حدود ۱۶,۳۸۴ مقدار است. این یعنی کاهش ۶۴ برابری در تقاضای محاسباتی.
  • حذف نویز: در فضای پیکسل، یک دانه‌ی شن کوچک روی مریخ به اندازه‌ی کل شکل سگ انرژی پردازشی می‌برد، اما در فضای نهان، این جزئیات میکروسکوپی و غیرقابل تشخیص موقتاً کنار گذاشته می‌شوند.
  • تمرکز اصلی: این کار به مدل اجازه می‌دهد تمام تمرکز خود را روی ساختارهای اصلی، از جمله ترکیب‌بندی، نورپردازی، فیگور و سیلوئت بگذارد.

سگ‌ها در حال قدم زدن در مریخ هستند. تصویری از چند سگ در فضای سیاره سرخ با آسمان نارنجی.

با کاهش تقاضای محاسباتی به میزان ۶۴ برابر، هوش مصنوعی می‌تواند ده‌ها مرحله‌ی ترسیم پیچیده را در کسری از ثانیه انجام دهد، پیش از آنکه رمزگشای VAE نتیجه را دوباره به پیکسل‌های با رزولوشن بالا گسترش دهد.

فرآیند حذف نویز (Denoising)

خلق واقعی تصویر از طریق انتشار گوسی (Gaussian Diffusion) رخ می‌دهد که دقیقاً شبیه به مجسمه‌سازی با تراشیدن یک تکه سنگ مرمر است. مدل با بومی از نویز تصادفی گوسی — شبیه به برفک تلویزیون‌های قدیمی یا «برف» — شروع می‌کند.

در ۲۰ تا ۵۰ مرحله‌ی متوالی، یک شبکه عصبی تکه‌های نویز تصادفی را حذف می‌کند تا فرم‌ها ظاهر شوند. این فرآیند معکوسِ مرحله‌ی آموزش (Forward Diffusion) است؛ در مرحله‌ی آموزش، تصاویر پاک به تدریج از طریق افزودن گام‌به‌گام نویز (از t=10 و t=30 تا t=50) به نویز خالص تبدیل شده بودند.

توالی معکوس انتشار به این صورت است:

  • گام ۰ (t=50): بوم ۱۰۰٪ برفک خالص است.
  • گام ۱۵ (t=35): خطوط مبهم و سیلوئت افق ظاهر می‌شوند (حدود ۷۰٪ نویز).
  • گام ۳۵ (t=15): فرم و رنگ‌ها قابل تشخیص می‌شوند؛ شکل سگ و لباس فضانوردی نمایان است (حدود ۳۰٪ نویز).
  • گام ۵۰ (t=0): خروجی نهایی با جزئیات واقع‌گرایانه، بازتاب‌های نوری دقیق و لبه‌های تیز آماده است (۰٪ نویز).

برای اینکه نویز به جای گربه، به سگ تبدیل شود، سیستم از مکانیزم‌های توجه متقاطع (Cross-Attention) استفاده می‌کند. این کار یک حلقه‌ی بازخورد ایجاد می‌کند که در آن پیش‌نویس نهان فعلی با بردار نقشه‌ی متنی مقایسه می‌شود. سیستم از یک ماتریس توجه متقاطع متشکل از پرس‌وجوها (پیکسل‌های نهان)، کلیدها (توکن‌های متنی) و مقادیر (ویژگی‌های بصری) برای پیش‌بینی باقی‌مانده‌ی نویز استفاده می‌کند.

در هر یک از مراحل حذف نویز، شبکه پیش‌نویس خود را با نقشه‌ی متنی CLIP تطبیق می‌دهد و می‌پرسد: «آیا این ناحیه شبیه لباس فضانوردی درخواستی است؟ آیا این بخش با خاک مریخ مطابقت دارد؟». اگر همراستایی درست نباشد، شبکه مرحله‌ی بعدی کاهش نویز را تنظیم می‌کند تا مسیر را به سمت پرامپت هدایت کند.

مقیاس‌پذیری با ترنسفورمرها

در حالی که مدل‌های اولیه از معماری U-Net استفاده می‌کردند — که بر اساس کاهش نمونه (downsampling)، یک گلوگاه و سپس افزایش نمونه (upsampling) از طریق کانولوشن بود — مدل‌های مدرنی مثل Stable Diffusion 3 و FLUX به سمت ترنسفورمرهای انتشار (DiT) حرکت کرده‌اند. این تغییر توسط Peebles و Xie در مقاله‌ی Scalable Diffusion Models with Transformers معرفی شد.

معماری DiT با داده‌های بصری مانند یک زبان برخورد می‌کند. این مدل بوم فشرده‌ی نهان را به تکه‌های مربع‌شکل کوچک یا «پچ» (Patch) تقسیم می‌کند. سپس این توکن‌های پچ بصری را دقیقاً به همان روشی پردازش می‌کند که یک مدل زبانی بزرگ (مانند ChatGPT) کلمات را در یک جمله تحلیل می‌کند.

اجزای معماری DiT عبارتند از:

  • پچ‌سازی (Patchification): بوم نهان (مثلاً ۶۴ در ۶۴) به شبکه‌ای از پچ‌ها (P1, P2 و غیره) تقسیم می‌شود.
  • توکن‌های پچ بصری: این پچ‌ها با رمزگذاری‌های موقعیتی (Positional Embeddings) ترکیب می‌شوند تا ساختار فضایی تصویر حفظ شود.
  • بدنه ترنسفورمر: سیستم از توجه چندسر (Multi-Head Self-Attention) و نرمال‌سازی لایه‌ای تطبیقی (adaLN) استفاده می‌کند.
  • توجه متقاطع: توکن‌های متن مستقیماً در بلوک‌های ترنسفورمر ادغام می‌شوند تا خروجی بصری را هدایت کنند.

این معماری اجازه می‌دهد مدل‌ها به صورت نمایی مقیاس‌پذیر شوند. هرچه قدرت محاسباتی و داده‌های بیشتری فراهم شود، مدل در درک پرامپت‌های پیچیده، نوشتن متن‌های خوانا و منسجم در داخل تصاویر و رندر کردن جزئیات آناتومیک سخت (مانند انگشتان دست انسان) بهتر عمل می‌کند.

شبیه‌سازی بُعد سوم

تبدیل تصویر به ویدیو نیازمند افزودن بُعد زمان است. ویدیو توالی سریعی از تصاویر است (معمولاً ۲۴ تا ۶۰ فریم در ثانیه). اگر فریم‌ها به طور مستقل تولید شوند، نتیجه به دلیل تغییر رنگ و شکل در هر میلی‌ثانیه، دچار لرزش شدید (Flickering) می‌شود.

مدل‌های پیشرو مثل Sora متعلق به OpenAI، ویدیو را به عنوان یک ترنسفورمر نهان زمان-مکان سه‌بعدی می‌بینند، همان‌طور که در گزارش فنی Sora ذکر شده است. این مدل به جای پچ‌های دوبعدی، «مکعب‌های» سه‌بعدی از داده‌های بصری را می‌برد که هم‌زمان فضا و زمان را در بر می‌گیرند و ویدیو را به عنوان یک مکعب نهان زمان-مکان (ارتفاع × عرض × زمان) پردازش می‌کند. این رویکرد در ابزارهای تخصصی‌تر نیز به کار گرفته شده است؛ برای مثال، قابلیت رندرینگ عصبی در TalkPix نشان می‌دهد چگونه می‌توان پرتره‌های ایستا را به ویدیوهای سخنگوی باکیفیت تبدیل کرد.

سازوکار تولید ویدیو شامل موارد زیر است:

  • پچ‌های زمان-مکان سه‌بعدی: مدل مختصات ارتفاع، عرض و زمان را به عنوان یک واحد واحد پردازش می‌کند، نه به صورت برش‌های تخت دوبعدی.
  • توجه زمانی (Temporal Attention): این مکانیزم اشیا را در چندین فریم ردیابی می‌کند. اگر سگ فضانورد پشت یک تخته‌سنگ مریخی برود و دوباره ظاهر شود، مدل جزئیات ظاهر سگ، لباس و نورپردازی او را به خاطر می‌آورد تا تداوم بصری حفظ شود.
  • پایداری اشیا (Object Permanence): این قابلیت اجازه می‌دهد دنیایی شبیه‌سازی شود که در آن اشیا حتی وقتی در کادر نیستند، وجود دارند و تضمین می‌کند که نژاد سگ یا رنگ لباسش هنگام پوشانده شدن تغییر نکند.
  • مدل‌های تداوم: برای مدیریت نیازهای پردازشی عظیم، از مدل‌های تداوم زمان-پیوسته (sCM) استفاده می‌شود. این مدل‌ها به سیستم اجازه می‌دهند در چند گام (به جای صدها گام) از نویز به فریم‌های نهایی بپرد و سرعت تولید را به شدت افزایش دهد.

گذار به شبیه‌سازی جهان

این تکامل فنی، گذاری از ابزارهای ساده‌ی «متن به عکس» به شبیه‌سازهای دنیای دیجیتال است. با ترکیب همراستاسازی زبانی، فشرده‌سازی نهان و انتشار تکرار شونده، هوش مصنوعی در حال درک فیزیک نور، پرسپکتیو و حرکت است. در همین راستا، ابزارهایی مانند Solaris در حال تغییر تعریف رابط‌های کاربری هستند تا طراحی‌ها را به جای کدهای استاتیک، به صورت ویدیوهای بلادرنگ رندر کنند.

برای یک سازنده‌ی محتوا، این یعنی مرز بین تخیل و اجرای بصری در حال ناپدید شدن است. تمرکز از توانایی فنی «کشیدن» به توانایی مفهومی «کارگردانی» یک محیط شبیه‌سازی شده تغییر می‌کند.

با ادغام عمیق‌تر درک فیزیکی در این مدل‌ها، می‌توان انتظار داشت که رسانه‌های سنتتیک از تقلید بصری فراتر رفته و به سمت شبیه‌سازی واقعی قوانین فیزیکی حرکت کنند. ادغام موتورهای فیزیک در لحظه (Real-time Physics Engines) در مدل‌های انتشار، می‌تواند «توهمات» باقی‌مانده در توالی‌های حرکتی پیچیده را کاملاً حذف کند.

گام بعدی شما

  • برای درک بهتر تفاوت در کیفیت، خروجی‌های مدل‌های مبتنی بر U-Net را با مدل‌های DiT (مثل FLUX) مقایسه کنید.
  • در پرامپت‌های خود از توصیفات مربوط به نورپردازی و پرسپکتیو (مثلاً Cinematic Lighting یا Wide Shot) استفاده کنید تا قدرت مدل‌های انتشار را به چالش بکشید.
  • گزارش‌های فنی Sora را برای درک مفهوم «پچ‌های زمان-مکان» مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول بر اساس تخصص در معماری‌های ترنسفورمر، هزینه تولید محتوای بصری باکیفیت را به شدت کاهش داده و استانداردهای صنعت سینما و تبلیغات را تغییر می‌دهد. اعتبار این رویکرد با موفقیت مدل‌هایی چون Sora در شبیه‌سازی قوانین فیزیکی به اثبات رسیده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به مدل‌های پیشرو مثل Sora برای توسعه‌دهندگان ایرانی دشوار است، اما استفاده از مدل‌های وزن‌باز مانند Stable Diffusion 3 فرصتی برای خلق ابزارهای محتوایی بومی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی معماری U-Net با ترنسفورمرها (DiT) نشان می‌دهد که دنیای بینایی در حال ادغام کامل با منطق پردازش زبان است. این یعنی مدل‌های آینده دیگر فقط «تصویر» نمی‌سازند، بلکه جهان را به صورت توکن‌های بصری می‌فهمند و استدلال می‌کنند. در نتیجه، مرز بین مدل‌های زبانی و مدل‌های تولید تصویر در حال تبدیل شدن به یک مدل واحد و همه‌منظوره است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.