تصور کنید ماشینی با میلیونها پیچ تنظیم دارید که قادر است نویز خالص و تصادفی را به خروجیهایی با ساختار داده تبدیل کند. این شبکه عصبی عمیق (Deep Neural Network) — شبکهای از سلولهای کوچک، شبیه نقشهٔ مترو، که سیگنال را از ورودی به جواب میرساند — مکانیسم مرکزی تمام مدلهای مولد مدرن است؛ از شبکههای GAN گرفته تا مدلهای انتشار (Diffusion). این مفاهیم در یادداشتهای فنی ۱۰ اکتبر ۲۰۲۶، بر اساس سخنرانیهای پروفسور پراتوش ایپی (Prof. Prathosh AP) درباره مبانی ریاضی هوش مصنوعی زاینده، به تفصیل شرح داده شده است.
برای درک این موضوع، تصور کنید یک توزیع هدف دارید — یعنی همان دادههای «واقعی» — اما فرمول ریاضی آن را نمیبینید. شما فقط نمونههایی از آن را در اختیار دارید، مانند لاگهای رفتار کاربران یا مجموعهای از تصاویر. هدف این است که مولدی بسازیم که نمونههایی چنان شبیه به دادههای واقعی تولید کند که تفاوت آنها از نظر ریاضی ناچیز و قابل چشمپوشی شود.
دستورالعمل سهمرحلهای
طبق تحلیل فنی وبسایت dev.to، اصل کلی مدلسازی زاینده از یک توالی سختگیرانه و سهمرحلهای پیروی میکند:
- فرض پارامتریک (Parametric Assumption): فرض بر این است که توزیع واقعی دادهها ($P_x$) را میتوان با یک خانواده پارامتریک $P_\theta$ تقریب زد. این خانواده پارامتریک در واقع توسط یک شبکه عصبی عمیق نمایش داده میشود.
- تعریف واگرایی (Divergence Definition): یک امتیاز ریاضی به نام واگرایی $\mathcal{D}(P_x \mid P_\theta)$ تعریف میشود تا اندازهگیری شود که خروجی مدل دقیقاً چقدر از دادههای واقعی فاصله دارد.
- بهینهسازی (Optimization): یک مسئله بهینهسازی حل میشود تا وزنهای خاصی ($\theta^*$) پیدا شوند که این مقدار واگرایی را به کمترین حد ممکن برسانند.
مکانیسم نویز و تبدیل
هر فرآیند تولید با یک بذر تصادفی آغاز میشود که معمولاً یک توزیع گوسی استاندارد $\mathcal{N}(0, I)$ است. این نویز به این دلیل انتخاب میشود که نمونهگیری از آن بسیار ساده است و هیچ ساختار ذاتی یا پیشفرض خاصی را با خود حمل نمیکند.
وقتی این نویز $z$ از یک تابع مولد $g_\theta$ (که همان شبکه عصبی است) عبور میکند، دچار تحولی به نام «Pushforward» یا انتقال به جلو میشود. برای درک ساده، یک تابع خطی مانند $g_\theta(z) = az + b$ میتواند مرکز منحنی زنگولهای نویز را جابهجا کند یا پهنای پخش آن را تغییر دهد. اما یک شبکه عمیق و غیرخطی میتواند این نویز را به اشکال بسیار پیچیدهای خم کند؛ اشکالی که توزیع چهرههای انسانی یا ساختار زبان طبیعی را بازسازی میکنند.
نقش واگرایی در ارزیابی
واگرایی در واقع امتیازی برای «تفاوت» است که باید دو شرط اساسی را داشته باشد: اول اینکه مقدار آن هرگز منفی نباشد و دوم اینکه مقدار آن تنها و تنها زمانی صفر شود که دو توزیع کاملاً یکسان باشند.
یک مثال رایج، واگرایی KL (Kullback-Leibler) است. در دنیایی ساده با دو نتیجه ممکن (مانند پرتاب سکه)، اگر دادههای واقعی یک سکه عادلانه باشند (۰.۵، ۰.۵) و مدل ما پیشبینی کند (۰.۹، ۰.۱)، مقدار واگرایی KL تقریباً ۰.۵۱۱ خواهد بود. هرچه مدل بهبود یابد و مثلاً به (۰.۶، ۰.۴) برسد، این امتیاز به ۰.۰۲۰ کاهش مییابد و تنها در صورت تطابق کامل، به صفر میرسد.
چرا شبکههای عمیق اجباری هستند؟
مدلهای ساده زمانی که دادهها پیچیده میشوند، شکست میخورند. برای مثال، یک مولد خطی فقط میتواند یک «برآمدگی» یا یک توزیع گوسی واحد تولید کند. اگر دادههای هدف دارای دو برآمدگی مجزا (Bimodal) باشند، هیچ مقدار تنظیم روی یک مدل خطی نمیتواند واگرایی را به صفر برساند.
به همین دلیل است که شبکههای عمیق ضروری هستند؛ آنها انعطافپذیری لازم را فراهم میکنند تا $P_\theta$ بتواند توپولوژی پیچیده و ظریف $P_x$ را به دقت تقلید کند. فرآیند آموزش در واقع همان عمل چرخاندن «پیچهای» شبکه (وزنها) است تا توزیع خروجی با توزیع هدف منطبق شود.
نقشهبرداری از چشمانداز مدلهای زاینده
معماریهای مختلف هوش مصنوعی در واقع انتخابهای متفاوتی هستند که در همین دستورالعمل سهمرحلهای جایگذاری شدهاند:
- GANs (شبکههای مولد تخاصمی): از یک توزیع ضمنی و یک بازی مین-مکس (Min-Max) با یک تشخیصدهنده استفاده میکنند تا واگرایی جنسن-شانون (Jensen-Shannon) را به حداقل برسانند.
- VAEs (خودرمزگذارهای وردشی): از یک مدل نهان (Latent Model) استفاده کرده و مقدار ELBO را بیشینه میکنند تا واگرایی KL کم شود.
- مدلهای انتشار (DDPM): از یک زنجیره معکوس از توزیعهای گوسی و رگرسیون روی نویز افزوده شده بهره میبرند.
- ترنسفورمرها (Transformers): از حاصلضرب توزیعهای شرطی برای کم کردن آنتروپی متقاطع (Cross-Entropy) استفاده میکنند که از نظر ریاضی معادل کم کردن واگرایی KL است.
دشواری بنیادین
سختترین بخش این فرآیند، محاسبه «امتیاز» یا همان واگرایی است. در کاربردهای دنیای واقعی، ما فرمول ریاضی توزیع واقعی رفتار کاربر یا توزیع واقعی تصاویر را نداریم؛ ما فقط لاگها یا مجموعهای از دادهها (Dataset) را در اختیار داریم. این شکاف — یعنی تخمین واگرایی از روی نمونهها به جای فرمولهای صریح — چالش مرکزی است که تکامل پژوهشهای هوش مصنوعی زاینده را تعریف میکند.
این چارچوب، دیدگاه ما را از نگاه به هوش مصنوعی به عنوان یک «جادو»، به یک مسئله بهینهسازی دقیق تغییر میدهد. با تبدیل تولید به یک مسئله تطبیق توزیع، پژوهشگران میتوانند به صورت سیستماتیک با جایگزینی معیار واگرایی یا افزایش انعطافپذیری شبکه مولد، کیفیت مدل را ارتقا دهند.
برای مشاهده عملی این موضوع، میتوان تبدیلهای خطی ساده روی نویز گوسی را آزمایش کرد تا بصورت بصری دیده شود که چگونه تغییر پارامترهای جابهجایی و مقیاسبندی، توزیع دادههای خروجی را تغییر میدهد.
گام بعدی شما
- برای درک بصری، تبدیلهای خطی ساده روی نویز گوسی را در محیط پایتون پیادهسازی کنید تا اثر تغییر پارامترها را ببینید.
- مقالات مربوط به واگرایی KL و JS را بخوانید تا تفاوت در نحوه جریمه کردن خطاهای مدل را درک کنید.
- بررسی کنید که مدل مورد استفاده شما در حال حاضر از کدام استراتژی واگرایی برای آموزش استفاده میکند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو