تصور کنید ویدیویی با کیفیت سینمایی از یک سیاستمدار معروف بسازید که جملاتی را میگوید که هرگز بر زبان نیاورده است؛ این کابوس امنیتی اکنون بزرگترین چالش مقیاسپذیر برای اوپنایآی (OpenAI) است. در ۳۰ سپتامبر ۲۰۲۵، این شرکت مدل سورا ۲ (Sora 2) را معرفی کرد که اگرچه شبیهسازیهای فیزیکی و همگامسازی صدا را به شدت بهبود بخشیده، اما چالشهای امنیتی پیچیدهای را نیز به همراه آورده است.
تولید ویدیو از کلیپهای ساده به شبیهسازیهای دقیق دینامیک سیالات و تعاملات اشیا تبدیل شده است. هرچه این ابزارها واقعگرایانهتر شوند، خطر تولید محتوای فریبنده یا همان جعل عمیق (Deepfake) — شبیه به یک ماسک دیجیتالی بسیار دقیق که میتوان آن را روی چهره هر کسی انداخت — افزایش مییابد. این تغییر پارادایم باعث شده است که لایه حاکمیتی و نظارتی اکنون به اندازه خودِ معماری مولد اهمیت یابد.
زمینه و قابلیتها
سورا ۲ در تولید ویدیوهای با کیفیت بالا که دقیقاً مطابق پرامپت کاربر باشند، تخصص دارد. این مدل شبیهسازیهای فیزیکی پیشرفتهای را معرفی کرده است که اجازه میدهد اثرات محیطی بسیار واقعگرایانهای خلق شوند. برای مثال، کاربران اکنون میتوانند صحنههایی با حرکات پیچیده بسازند، مانند اشیایی که با تکانه (Momentum) واقعی میپرند یا موجهایی که با جزئیات دقیق به ساحل برخورد میکنند. با این حال، دستیابی به خروجیهای نهایی و حرفهای همچنان با چالشهایی روبروست؛ موضوعی که در تحلیل ما درباره دلایل شکست مدلهای پیشرو در تولید ویدیوهای نهایی به تفصیل بررسی شده است.
علاوه بر تولید ساده، این ابزار امکان ویرایش ویدیوهای موجود، بازترکیب محتوا (Remixing) و گنجاندن چهره و شباهتهای کاربر را فراهم میکند، به شرطی که رضایت صریح فرد گرفته شده باشد. طبق اعلام شرکت، این اپلیکیشن تا نوامبر ۲۰۲۵ در مناطقی چون آمریکا، کانادا، ژاپن و کره در دسترس است و برنامههایی برای عرضه گستردهتر در سطح جهانی در دست اجراست.
یکپارچهسازی و دسترسی
دسترسی به این مدل بسته به پلتفرم متفاوت است. در حالت عادی، نسخه Sora 2 Pro تنها برای کاربرانی در دسترس است که اشتراک ماهانه ChatGPT Pro را با هزینه ۲۰۰ دلار تهیه کرده باشند. با این حال، پلتفرم CometAPI با ادغام Sora-2-pro، این امکان را فراهم کرده تا کاربران بتوانند هزینه اشتراک گرانقیمت رسمی را دور بزنند. این رویکرد در راستای هدف جدید اوپنایآی برای اتوماسیون استودیوها از طریق رابطهای برنامهنویسی پیشرفته است. از طریق CometAPI، کاربران میتوانند ویدیوهایی تا طول ۲۵ ثانیه تولید کنند.
به گزارش وبسایت dev.to، سورا ۲ از یک معماری نظارتی سه لایه برای حفظ ایمنی استفاده میکند. این پشته (Stack) نظارتی تضمین میکند پرامپتی که در متن بیخطر به نظر میرسد، در مراحل پاییندستی منجر به تولید توالی فریمهای متخلف نشود.
لایه اول: فیلترینگ پیش از تولید
اولین خط دفاعی پیش از آنکه مدل حتی شروع به رندر کردن کند، فعال میشود. سیستم، پرامپتهای متنی، تصاویر مرجع آپلود شده و پیشفرضهای انتخابی را برای شناسایی پرچمهای قرمز (Red Flags) بررسی میکند:
- محتوای صریح: مسدود کردن درخواستهای مربوط به پورنوگرافی یا خشونت گرافیکی. محتوای جنسی صریح شامل افراد زیر سن قانونی اکیداً ممنوع است و محتوای مربوط به بزرگسالان با رضایت نیز در زمینههای رندرینگ خاص، به شدت تنظیم یا مسدود میشود.
- حفاظت از هویت: شناسایی و علامتگذاری درخواستهای مربوط به افراد زنده نامبرده شده بدون داشتن مجوز. این کار از تولید ویدیوهای واقعگرایانه از افراد واقعی که کارهایی انجام میدهند یا جملاتی میگویند که در واقعیت رخ نداده، جلوگیری میکند.
- حق نشر: توقف بازتولید شخصیتهای مشهور تحت حمایت قانون کپیرایت یا تقلید از سبکهای هنری دارای حق نشر. این موضوع بهویژه در صنعت سینمای هالیوود و ژاپن به یک نقطه اصطکاک تبدیل شده است.
- محتوای غیرقانونی: مسدود کردن ویدیوهایی که اقدامات مجرمانه را نمایش داده یا آموزش میدهند، مانند دستورالعمل ساخت مواد منفجره یا سایر تخلفات خشونتآمیز.
- اطلاعات نادرست حساس: محدود کردن محتوایی که توصیههای نادرست و حیاتی در زمینههای پزشکی، حقوقی یا مالی ارائه میدهد، که این کار از طریق هشدارهای سیستمی انجام میشود.
- نفرتپراکنی و افراطگرایی: فیلتر کردن محتوایی که ایدئولوژیهای متنفره، آزار و اذیت یا افراطگرایی خشونتآمیز را ترویج میکند.
لایه دوم: هدایت در سطح مدل
اگر پرامپت از فیلتر اول عبور کند، لایه دوم در حین فرآیند واقعی تولید عمل میکند. این لایه در وزنها (Weights) داخلی مدل و مکانیزمهای نمونهگیری (Sampling) تعبیه شده است.
اوپنایآی از اجرای سیاستها در سطح مدل استفاده میکند تا خروجیها را از محتوای ممنوعه دور کند. این فرآیند شامل سرکوب توکنهای (Tokens) خاص، تغییر در نحوه نمونهگیری یا اعمال محدودیتهای سبکی است تا احتمال تولید یک شباهت صریح یا ممنوعه کاهش یابد. این مهندسی ایمنی، همانطور که در کارت مدل (Model Card) و راهنمای سیستم اوپنایآی ذکر شده، بخشی بنیادین از طراحی سورا ۲ است.
لایه سوم: تحلیل پس از تولید
پس از رندر شدن کلیپ، آشکارسازهای خودکار، ویدیو و متنهای صوتی نهایی را اسکن میکنند تا هرگونه تخلفی که از دو لایه اول گریخته را شناسایی کنند.

این مرحله نهایی همچنین مسئول شفافیت و منشأ اثر (Provenance) است. داراییهای تولید شده با متادیتای C2PA و واترمارکهای بصری علامتگذاری میشوند تا پلتفرمهای ثالث بتوانند تشخیص دهند که این رسانه سنتز شده (مصنوعی) است. این اقدامات، حذف محتوا (Takedown) را تسهیل کرده، از درخواستهای تجدیدنظر پشتیبانی میکند و به ردیابی منشأ اثر کمک میکند.
اقدامات کنترلی برای ریسکهای بالا
برای مدیریت حساسترین مسائل، اوپنایآی کنترلهای برنامهریزیشده و محصولی خاصی را ادغام کرده است:
- طبقهبندهای چندوجهی (Multimodal Classifiers): این ابزارها بهطور همزمان روی متن، فریمهای تصویر و صدا آموزش دیدهاند تا نمادهای نفرتپراکن، محتوای جنسی، خشونت، دستورالعملهای خودآزاری یا جعلهای غیرمجاز را شناسایی کنند. این طبقهبندها در مراحل ورودی، میانی و خروجی عمل میکنند.
- جریانهای تأیید شده (Authenticated Cameo Flows): تولید یا درج شباهت یک فرد واقعی در یک کلیپ، نیازمند یک فرآیند صریح پذیرش (Opt-in) و تأیید هویت است تا جعلهای غیررضایتی کاهش یابد.
- بازبینی انسانی: در مواردی که طبقهبندها مردد هستند — مثلاً در تشخیص تفاوت بین طنز (Satire) و جعل بدخواهانه — ناظران انسانی وارد عمل میشوند. اگرچه این روند کندتر است، اما برای تصمیمات با تأثیر بالا استفاده میشود.
- کنترل فید: محتوای شناسایی شده توسط طبقهبندها ممکن است رتبه 낮은تری بگیرد، از نمایش در فیدهای اجتماعی مسدود شود یا برای بازبینی انسانی ارسال گردد.
- لیستهای سفید و سیاه سیاستها: اوپنایآی از لیستهای خاصی برای مسدود کردن چهرههای عمومی، محدودیتهای شخصیتهای دارای کپیرایت و حفاظت از سنین مختلف استفاده میکند که این لیستها با ورودیهای آژانسهای استعدادیابی و شرکای صنعتی اصلاح میشوند.
چالش هوش مصنوعی «بدون سانسور»
با وجود این لایهها، هنوز محتوای مشکلساز دیده میشود. این اتفاق معمولاً زمانی رخ میدهد که شکافی در طبقهبندها وجود داشته باشد؛ مثلاً جایی که مدل نتواند یک تصویر بیخطر را با یک صدای مضر مرتبط کند. چون سورا ۲ یک مدل چندوجهی (Multimodal) است، ممکن است پرامپت متنی در ظاهر بیخطر باشد اما توالی فریمهای تولید شده، سیاستهای تصویری را نقض کنند.
از نظر فنی، محتوای «بدون سانسور» زمانی رخ میدهد که مدلها در یک یا چند لایه فاقد نظارت قوی باشند یا کاربران عمداً آنها را دور بزنند. پیچیدگی همگامسازی ویدیو، صدا و متن، دشواری تشخیص را افزایش میدهد. گزارشهای اولیه پس از عرضه، وجود کلیپهای خشونتآمیز و نژادپرستانه در فیدها را تأیید کرد که ثابت میکند هیچ مکانیزمی بهتنهایی ۱۰۰٪ قابل اعتماد نیست.
زیرساخت فنی
سورا ۲ بر پایه معماریهای ترکیبی و ترنسفورمرهای (Transformer) چندوجهی بنا شده است. این مدل با استفاده از فرآیندهای انتشار (Diffusion) یا سنتز خودبازگشتی (Autoregressive)، فریمهای ویدیو را بر اساس پرامپتهای متنی شرطی میکند تا حرکتی منسجم ایجاد شود.
یکی از تمایزهای اصلی، همگامسازی بومی صدا است. مدل از سنتز عصبی صدا و مدلهای گفتاری برای تولید دیالوگها و محیطهای صوتی استفاده میکند که کاملاً با اکشن بصری مطابقت دارند. این فناوریها ابزارهایی خنثی هستند و اثر اجتماعی آنها کاملاً به لایه حاکمیتی وابسته است که در اطراف آنها ساخته شده است.
دسترسی توسعهدهندگان از طریق CometAPI
برای توسعهدهندگان، دسترسی به این قابلیتها میتواند گران باشد. در حالی که اشتراک رسمی ۲۰۰ دلار در ماه است، پلتفرم CometAPI دسترسی به Sora-2-pro (با قابلیت تولید ویدیو تا ۲۵ ثانیه) را در نقطه قیمتی پایینتری فراهم کرده است. با این حال، توسعهدهندگان باید به تغییرات زیرساختی حساس باشند، چرا که توقف دسترسی به برخی APIهای مدل Sora میتواند باعث اختلال در یکپارچهسازیهای موجود شود.
CometAPI یک پلتفرم یکپارچه است که بیش از ۵۰۰ مدل هوش مصنوعی از جمله Gemini گوگل، Claude آنتروپیک، Midjourney و Suno را تجمیع کرده است. این پلتفرم با ارائه احراز هویت یکسان، فرمت درخواستهای ثابت و مدیریت پاسخها، یکپارچهسازی را ساده میکند و به توسعهدهندگان اجازه میدهد بدون پرداخت هزینه اشتراک رسمی، به API سورا ۲ دسترسی داشته باشند. توسعهدهندگان میتوانند هم به API نسخه Sora-2-pro و هم به API استاندارد سورا ۲ دسترسی یابند و نسخههای مدلها همیشه با وبسایت رسمی بهروزرسانی میشوند.
برای شروع، توسعهدهندگان میتوانند قابلیتهای مدل را در Playground بررسی کرده و برای دستورالعملهای دقیق به راهنمای API مراجعه کنند. کاربران باید ابتدا در CometAPI وارد شده و یک کلید API دریافت کنند.
این رویکرد چندلایه نشاندهنده تغییری در ایمنی هوش مصنوعی است. اوپنایآی دیگر به یک «فیلتر» واحد تکیه نمیکند، بلکه ایمنی را به عنوان یک خط لوله (Pipeline) میبیند که از پرامپت شروع و به واترمارک ختم میشود.
برای سازندگان، این یعنی نرخ آزمون و خطا هنگام جابهجایی در مرزهای ابزار بیشتر خواهد بود. درک این قوانین برای موفقیت در تولید ویدیو ضروری است؛ بهویژه محدودیتهای مربوط به شخصیتهای دارای کپیرایت و چهرههای واقعی که محتملترین نقاط شکست در گردش کار شما هستند.
گام بعدی شما
- اگر از Sora 2 استفاده میکنید، برای کاهش نرخ رد شدن پرامپتها، از توصیفات کلی بهجای نام بردن مستقیم از چهرههای مشهور استفاده کنید.
- برای پروژههای تجاری، حتماً متادیتای C2PA را بررسی کنید تا از شفافیت منشأ ویدیوهای خود مطمئن شوید.
- توسعهدهندگان میتوانند برای کاهش هزینههای استنتاج، جایگزینهای API مانند CometAPI را برای تست اولیه مدل بررسی کنند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو