پرش به محتوای اصلی
پرش به محتوای مقاله

معماری GPT Image 2: ۳ لایه نظارتی برای مسدودسازی پرامپت‌های پرتره

·۱۵ مرداد ۱۴۰۵۶ دقیقه مطالعه
راهنما
پرامپت‌های پرتره در ChatGPT: چه چیزی واقعاً از مoderation GPT Image 2 عبور می‌کند
پرامپت‌های پرتره در ChatGPT: چه چیزی واقعاً از مoderation GPT Image 2 عبور می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

عبور از فیلترینگ متنی (Stop-words) به نظارت لایه‌بندی شده‌ی بصری؛ جایی که عکس مرجع تعیین‌کنندهٔ پذیرش یا رد پرامپت است، حتی اگر متن کاملاً ایمن باشد.

اگر امروز سعی دارید با ابزارهای OpenAI یک پرتره واقع‌گرایانه بسازید، احتمالاً متوجه شده‌اید که تغییر چند کلمه در پرامپت یا استفاده از کلمات جایگزین هیچ اثر مفیدی ندارد. شما با سیستمی می‌جنگید که نه فقط متن، بلکه زاویه چهره و کیفیت عکس مرجع شما را هم‌زمان تحلیل می‌کند تا تصمیم بگیرد آیا تصویر نهایی یک «جعل عمیق» خطرناک است یا خیر. در واقع، کسانی که برای دور زدن فیلترها به «عبارات جادویی» تکیه می‌کنند، در تقابل با سیستمی هستند که تصویر، متن و قصد کاربر را به‌طور هم‌زمان در سه سطح مختلف بررسی می‌کند.

این مکانیسم بر پایه طبقه‌بند چندوجهی (Multimodal Classifier) طراحی شده است؛ ابزاری که برخلاف لیست‌های ساده‌ی کلمات ممنوعه (stop-words)، مانند نگهبانی عمل می‌کند که همزمان لباس، کارت شناسایی و چهره‌ی فرد را چک می‌کند تا اجازه ورود دهد. همان‌طور که در تحلیل قبلی ما درباره‌ی این موضوع که چرا رد درخواست‌های تصویری ChatGPT اغلب فاقد منطقی ثابت است اشاره کردیم، این جزئیات معماری جدید توضیح می‌دهد چرا بسیاری از کاربران احساس سرخوردگی می‌کنند. سیستم تنها متن شما را نمی‌خواند، بلکه زاویه عکس مرجع، کیفیت آن و ترکیب کلی بستر صحنه را پیش از تصمیم‌گیری درباره‌ی ایمن بودن نتیجه، ارزیابی می‌کند.

طبق نقشه‌ی سیستمی OpenAI که در ۲۱ آوریل ۲۰۲۶ هم‌زمان با عرضه GPT Image 2 منتشر شد، موتور نظارت این مدل نرخ موفقیت ۹۶.۱ درصدی در طبقه‌بندی محتوای ناقض و دقت ۸۷.۳ درصدی در تحلیل تصاویر دارد. در نهایت، این سیستم گزارش می‌دهد که ۹۹.۱ درصد از خروجی‌های نهایی به عنوان محتوای ایمن شناسایی می‌شوند. با این حال، باید توجه داشت که این اعداد بنچمارک‌های داخلی فروشنده هستند و مورد بازرسی مستقل قرار نگرفته‌اند، بنابراین نباید آن‌ها را به عنوان حقیقت مطلق پذیرفت. این تضاد بین آمارهای رسمی و تجربه کاربر یادآور شکاف موجود میان گزارش‌های رسمی پایداری سرویس‌های OpenAI و واقعیت دسترسی کاربران است که پیش‌تر بررسی کردیم.

فیلتر سه‌لایه

نظارت در سه مرحله متوالی رخ می‌دهد: پیش از تولید (Before Generation)، هنگام تحلیل ورودی (Input Analysis) و در نهایت روی خروجی نهایی (Final Output). این واقعیت معماری بسیار مهم‌تر از آمارهای درصدی است. این بدان معناست که یک پرامپت ممکن است با یک چهره خاص کار کند، اما با چهره‌ای دیگر مسدود شود، زیرا طبقه‌بند ریسک بالای ایجاد یک «جعل عمیق متقاعدکننده» را تشخیص داده است.

پرامپت‌های پرتره در ChatGPT: چه چیزی واقعاً از مoderation GPT Image 2 عبور می‌کند

رضایت در برابر سبک هنری

یک باور غلط رایج وجود دارد که OpenAI تبدیل چهره‌های واقعی به سبک‌های هنری مانند پیکسار، جیبلی یا نقاشی رنگ روغن را به‌طور کلی ممنوع کرده است. برای مثال، یک پست در وبلاگ Medium در اوت ۲۰۲۵ ادعا کرد که چنین تغییراتی کاملاً ممنوع شده‌اند، اما این ادعا بدون استناد به هیچ منبع اولیه‌ای بیان شده بود.

مستندات رسمی در learn.chatgpt.com شفاف‌سازی می‌کنند که شرط اصلی، «رضایت» (Consent) است. هنگام کار با تصویر یک فرد واقعی، کاربران باید «در صورت لزوم یک عکس مرجع ارائه دهند و تایید کنند که اجازه استفاده از آن تصویر را دارند». لحن قوانین استفاده در این بخش سخت‌گیرانه‌تر است و صراحتاً ذکر می‌کند که استفاده از تصویر شخص دیگر «بدون رضایت مناسب» ممنوع است. شایان ذکر است که صفحه رسمی قوانین گاهی خطای سرور ۴۰۳ می‌دهد، به این معنی که این فرمولاسیون‌ها اغلب از قطعات ذخیره شده در موتورهای جستجو استخراج شده‌اند و باید به‌صورت دستی تایید شوند.

هدف واقعی از این محدودیت‌ها، همان‌طور که در نقشه‌ی سیستمی ذکر شده، جلوگیری از ایجاد «جعل‌های عمیق متقاعدکننده، از جمله تصاویر سیاسی، جنسی یا سایر تصاویر حساس از افراد واقعی» است. در این مستندات، «سبک‌بندی» (Stylization) به عنوان یک فعالیت ممنوعه ذکر نشده است. سیستم بین زیبایی‌شناسی (Aesthetics) و آسیب به هویت (Identity Harm) تمایز قائل می‌شود و GPT Image 2 به‌طور خاص برای مقابله با مورد دوم تنظیم شده است.

چرا یک پرامپت نتایج متفاوتی می‌دهد؟

در مارس ۲۰۲۵، جوآن جانگ، مدیر مدل‌های OpenAI، در ۲۸ مارس ۲۰۲۵ در گفتگو با TechCrunch درباره تغییر سیاست‌های عمومی شرکت توضیح داد. او بیان کرد که شرکت در حال حرکت «از مسدودسازی پیش‌فرض در مناطق حساس به سمت رویکردی دقیق‌تر با تمرکز بر جلوگیری از آسیب‌های واقعی» است. اگرچه این تغییر فلسفی بیش از یک سال قبل از عرضه GPT Image 2 رخ داد، اما نحوه اجرای آن همچنان مورد بحث است.

در عمل، تجربه کاربران متفاوت است. گراهام، ویراطور TechRadar، ویژگی‌های جدید تولید تصویر را چنان آزاردهنده توصیف کرد که گفت احساس می‌کند باید «لپ‌تاپش را دور بیندازد».

این تضاد به این دلیل است که طبقه‌بند ترکیبی از عوامل را به طور کامل ارزیابی می‌کند. یک پرامپت متنی واحد که با دو عکس مرجع متفاوت جفت شود، می‌تواند نتایج متفاوتی داشته باشد. عوامل زیر به اندازه کلمات شما در نتیجه اثر می‌گذارند:

  • زاویه چهره در عکس مرجع.
  • کیفیت فنی تصویر مرجع.
  • بستر کلی صحنه.

جایگزینی کلمات با مترادف‌ها در پرامپت شما این مشکل را حل نخواهد کرد؛ زیرا طبقه‌بند کلمات را تنها به عنوان بخشی از یک ورودی داده‌ای بزرگتر می‌بیند. برای کاهش واقعی ریسک، باید در چارچوب‌های تاییدشده حرکت کنید: استفاده از عکس خودتان، اطمینان از رضایت صریح، اجتناب از جنسی‌سازی و حذف هرگونه بستر مرتبط با جعل عمیق.

فرمول تاییدشده برای پرامپت‌نویسی

برای کاهش رد درخواست‌ها و اجتناب از ابهام، مستندات OpenAI (منبع ۶) یک فرمول ساختاری خاص برای پرامپت‌ها پیشنهاد می‌کند:

  • هدف (Purpose): تعریف قصد تصویر (مثلاً: «آواتار برای پروفایل»).
  • سوژه و کنش (Subject & Action): چه اتفاقی در حال رخ دادن است (مثلاً: «فردی کنار پنجره نشسته»).
  • عناصر بصری (Visual Elements): جزئیات سبک و صحنه (مثلاً: «شهر تار در پس‌زمینه»).
  • مشخصات فنی (Technical Specs): نورپردازی، لنز و کادربندی (مثلاً: «لنز ۸۵ میلی‌متری، f/2.8، نمای سینه‌یک در سطح چشم»).
  • محدودیت‌های صریح (Explicit Constraints): ذکر دقیق مواردی که نباید ظاهر شوند. این بخش به عنوان یک «بیمه» عمل می‌کند تا سیستم درخواست را به‌طور مبهم تفسیر نکند.

پرامپت‌های پرتره در ChatGPT: چه چیزی واقعاً از مدیریت GPT Image 2 عبور می‌کند

برای کاربرد عملی، مجموعه NanoPrompts یک بررسی نهایی را پیشنهاد می‌کند: پیش از انتشار، تایید کنید که نتیجه به‌طور اتفاقی شبیه به یک چهره مشهور نباشد تا سیاست‌های مربوط به شخصیت‌های عمومی فعال نشود.

قالب‌های پیشنهادی برای عکس‌های مرجع

بر اساس فرمول OpenAI، سه سناریوی کاربردی را امتحان کنید:

۱. پرتره استودیویی
پرامپت: «آواتار برای پروفایل. پرتره از کمر به بالا، پس‌زمینه خاکستری خنثی، نگاه به دوربین، لبخند ملایم. نورپردازی دو نقطه‌ای استودیویی، لنز ۸۵ میلی‌متری، f/2.8، تمرکز روی چشم‌ها، نمای سینه‌یک در سطح چشم. ویژگی‌های چهره را تغییر نده، فرد اضافی اضافه نکن و از ژست‌ها یا لباس‌های جنسی استفاده نکن.»

۲. نور نرم پنجره
پرامپت: «پرتره لایف‌استایل برای آرشیو شخصی. فردی کنار پنجره نشسته، نگاه به بیرون، شهر تار در پس‌زمینه. نور روز پخش‌شده و نرم از کنار، لنز ۵۰ میلی‌متری، عمق میدان کم، نمای سینه‌یک. نوع بدن، رنگ پوست و مدل مو را از عکس مرجع حفظ کن؛ فرد اضافی اضافه نکن و سن را تغییر نده.»

۳. ساعت طلایی
پرامپت: «پرتره برای استوری. فردی بیرون در غروب خورشید، باد ملایم در موها. نور پس‌زمینه گرم ساعت طلایی، لنز ۳۵ میلی‌متری، بوکه در پس‌زمینه، نمای نیم‌تنه. تناسبات چهره را تغییر نده، متنی به تصویر اضافه نکن و تصویری شبیه به یک چهره مشهور خاص ایجاد نکن.»

مدیریت ثبات هویت

از آنجا که GPT Image 2 حافظه پایداری از ظاهر یک شخص در درخواست‌های متعدد ندارد، چهره‌ها در مجموعه‌ای از پرتره‌ها دچار «لغزش» (Drift) می‌شوند. مدل حافظه دائمی از هویت بین پرامپت‌های مجزا ذخیره نمی‌کند.

برای مقابله با این مشکل، پلتفرم fal.ai که این مدل را از طریق API ارائه می‌دهد، یک راهکار دستی پیشنهاد می‌کند. به‌جای تکیه بر حافظه سیستم، کاربران باید توصیفات متنی کامل ظاهر شخص را در هر پرامپت جدید تکرار کنند، از جمله:

  • رنگ پوست
  • S-shape یا فرم بدن
  • جزئیات دست‌ها
  • مدل و رنگ مو
  • حالات چهره

مدیریت سهمیه‌ها و مسدودسازی‌ها

دسترسی به این مدل همچنین با سهمیه‌های سخت‌گیرانه محدود شده است. طبق گزارش CometAPI در آوریل ۲۰۲۶، کاربران رایگان ChatGPT تنها به حدود ۲ تا ۳ تصویر در هر پنجره ۲۴ ساعته دسترسی دارند. از آنجا که OpenAI جدول رسمی و ثابتی برای محدودیت‌ها منتشر نمی‌کند، کاربران باید به پیام‌های داخل رابط کاربری تکیه کنند که ممکن است بسته به حساب کاربری متفاوت باشد.

اگر پرامپت شما بدون دلیل واضح (بدون برهنگی، بدون چهره غریبه یا کودکان) به‌طور مداوم مسدود می‌شود، مشکل احتمالاً از عکس مرجع است. این موضوع می‌تواند به دلیل کیفیت پایین تصویر، زاویه نامناسب یا شباهت ترکیبی با بسترهای سیاسی یا عمومی باشد. در چنین مواردی، تغییر مترادف‌ها بی‌فایده است؛ شما باید عکس یا صحنه را عوض کنید.

برای کسانی که نیاز به یک پرتره کاربردی دارند بدون اینکه با حساسیت یک مدل خاص بجنگند، استفاده از تجمیع‌کننده‌هایی مانند provod.ai اجازه می‌دهد تا از طریق یک API بین مدل‌های مختلف تولید تصویر جابجا شوند. این رویکرد مشابه استفاده از تجمیع‌کننده‌های API برای کاهش هزینه‌های دسترسی به ChatGPT است که به کاربران اجازه می‌دهد محدودیت‌های دسترسی و هزینه‌ها را بهینه کنند. این کار با حذف نیاز به بازنویسی یکپارچه‌سازی‌ها برای هر سرویس، در زمان صرفه‌جویی می‌کند.

این تحول ثابت می‌کند که مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن برای گرفتن بهترین جواب از مدل — از «حدس زدن کلمات کلیدی» به «مدیریت محدودیت‌های ساختاری» تغییر مسیر داده است. هرچه یک پرامپت درباره مورد استفاده قانونی خود (مانند آواتار شخصی یا جلسه عکاسی خودتان با رضایت) صادقانه‌تر و شفاف‌تر باشد، احتمال فعال شدن مثبت کاذب (False Positive) توسط طبقه‌بند کمتر خواهد بود.

گام بعدی شما

  • عکس‌های مرجع خود را با کیفیت بالا و زاویه مستقیم آپلود کنید تا احتمال خطای طبقه‌بند کاهش یابد.
  • از فرمول پنج‌گانه (هدف، سوژه، عناصر، تکنیک، محدودیت) برای نوشتن پرامپت‌ها استفاده کنید.
  • برای حفظ ثبات چهره در چندین عکس، توصیفات فیزیکی را در تمام پرامپت‌ها تکرار کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر معماری نشان می‌دهد OpenAI برای مقابله با جعل عمیق، امنیت را بر سادگی استفاده ترجیح داده است. این رویکرد اعتبار سیستم‌های نظارتی را بالا می‌برد اما تجربه کاربری را برای افرادی که به دنبال انعطاف در خلق هنری هستند، دشوارتر می‌کند.

تأثیر برای ایران

دسترسی به GPT Image 2 برای کاربران ایرانی همچنان نیازمند ابزارهای تغییر IP و حساب‌های فعال است. برای توسعه‌دهندگان ایرانی، استفاده از APIهای تجمیع‌کننده جایگزین بهتری برای دور زدن محدودیت‌های سخت‌گیرانه سهمیه است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی لیست کلمات ممنوعه با طبقه‌بندهای چندوجهی، پایان عصر «جادوی کلمات» در مهندسی پرامپت است. اکنون مدل‌ها نه بر اساس آنچه می‌گوییم، بلکه بر اساس آنچه می‌بینند و استنباط می‌کنند تصمیم می‌گیرند. این یعنی کنترل محتوا از حالت متنی به حالت معنایی و بصری منتقل شده و راه خروج برای کاربران تنها پذیرش ساختارهای رسمی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.