پرش به محتوای اصلی
پرش به محتوای مقاله

درون معماری Tsubaki.3؛ چرا تصاویر مرجع در مقیاس بالا شکست می‌خورند

·۱۰ شهریور ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
راهنما
یک تصویر مرجع، هشت اجرای برگه شخصیت، و چیزی که مدل ابداع کرد
یک تصویر مرجع، هشت اجرای برگه شخصیت، و چیزی که مدل ابداع کرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مفهوم «بودجه رزولوشن» در مدل‌های تبدیل متن به تصویر؛ اثبات اینکه افزایش تعداد پنل‌ها در یک قاب، به‌طور مستقیم باعث حذف جزئیات مرجع می‌شود، حتی اگر مدل توانایی رندر آن جزئیات را در تک‌تصویر داشته باشد.

تصور کنید یک طراح شخصیت هستید که برای انتقال جزئیات لباس یک قهرمان به همکارش، یک کاربرگان (Character Sheet) کامل می‌کشد؛ اما هرچه تعداد زوایای تصویر را بیشتر می‌کنید، جزئیات لباس ناپدید می‌شوند. این دقیقاً همان نقطه‌ای است که «تخیل» مدل Tsubaki.3 از شرکت PixAI به بن‌بست می‌رسد. در یک آزمون کنترل‌شده، یک پژوهشگر اندازه‌گیری کرد که مدل چگونه با داده‌های تعریف‌نشده برخورد می‌کند؛ به‌ویژه زمانی که هوش مصنوعی باید برای فیلدهایی که هرگز تنظیم نشده‌اند مقادیری تولید کند، مانند نمای پشت یک کت یا شیئی که از بند لباس در پشت لگن آویزان است.

کاربرگان‌ها برای هنرمندان استاندارد طلایی هستند چون نماهای جلو، کنار و پشت، طیفی از حالات چهره و مجموعه‌ای از ژست‌ها را ارائه می‌دهند تا اطمینان حاصل شود که شخص دیگری می‌تواند بدون پرسیدن سؤالات اضافی، بر اساس آن برگه کار کند. برای یک هوش مصنوعی، این یک چالش مهندسی است. این وضعیت تضادی میان پیش‌فرض‌های قطعی (Deterministic Defaults) و «بودجه‌ای» که مدل برای هر پنل اختصاص می‌دهد، ایجاد می‌کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی محدودیت‌های مدل‌های انتشار (Diffusion Model) اشاره کردیم، مدل‌ها همیشه در تعادل میان کلیات و جزئیات دست‌وپنجه نرم می‌کنند. در این مورد، مدل Tsubaki.3 — که شبیه به نقاشی است که سعی می‌کند چندین تابلوی کوچک را در یک بوم بزرگ جای دهد — با مشکل تخصیص فضا روبروست.

پارامترها و ساختار آزمون

برای اطمینان از دقت، پژوهشگر از یک محیط سخت‌گیرانه و کنترل‌شده استفاده کرد. این ساختار شامل یک شخصیت اصلی بود که تنها یک‌بار از طریق متن تولید شد و سپس به عنوان تنها مرجع برای تمام اجراهای بعدی قرار گرفت. این آزمون شامل ۸ مورد تولید خاص بود:

  • یک نمای دورگرد (Turnaround)
  • همان نمای دورگرد با بذر (Seed) متفاوت
  • نمای دورگرد با افزودن یک جمله به پرامپت
  • کاربرگان expressions شش‌پنلی
  • کاربرگان expressions نه‌پنلی
  • کاربرگان چهار-ژست
  • یک ژست تک‌نفره
  • کاربرگان لباس

تمام تنظیمات ثابت نگه شد: حالت Pro فعال بود، در حالی که پیش‌فرض‌های استایل (Style Presets) و Prompt Helper خاموش شدند. پرامپت منفی پیش‌فرض دست‌نخورده باقی ماند و از فرمت مربع با یک تصویر مرجع ضمیمه شده استفاده شد.

پایداری جزئیات ابداعی

طراحی شخصیت به سه دسته تقسیم شد تا میزان انحراف (Drift) ردیابی شود. گروه «کنترل» که در هر پرامپت نام برده شده بود، شامل طول مو، رنگ مو، رنگ چشم، یک شال‌گردن قرمز و یک کت زیتونی روی پلیور خاکستری بود. این جزئیات در هیچ‌یک از ۸ اجرا دچار انحراف نشدند.

یک یافته جالب زمانی رخ داد که مدل مجبور شد جزئیاتی را ابداع کند که در تصویر مرجع وجود نداشت، مانند پشت کت. نمای دورگرد سه نما با مقیاس یکسان تولید کرد: ارتفاع آن‌ها در یک قاب ۱۰۲۴ پیکسلی، به ترتیب ۹۸۳، ۹۷۸ و ۹۷۸ پیکسل بود. نمای پشت به صورت یک پنل لایه‌دار (Quilted) ساده با یک درز مرکزی ابداع شد. وقتی دقیقاً همان پرامپت، بایت به بایت، روی یک بذر متفاوت اجرا شد، نتیجه یکسان بود: همان پشت ابداعی و همان درز مرکزی. این موضوع نشان می‌دهد که فیلدهای تعریف‌نشده دارای یک پیش‌فرض پایدار هستند و مدل برای پر کردن شکاف‌های ابتدایی قابل‌اعتماد است.

یک تصویر مرجع، هشت اجرای برگه شخصیت، و چیزهایی که مدل اختراع کرد.

هزینهٔ اعمال محدودیت‌ها

با این حال، افزودن محدودیت‌های خاص می‌تواند باعث ایجاد یک «پرداخت» یا هزینه در جای دیگری از تصویر شود. در تصویر مرجع، بندی وجود داشت که از روی سینه می‌گذشت و به چیزی در پشت لگن متصل می‌شد. در دو اجرای اول نمای دورگرد، مدل ترجیح داد بند را در نمای پشت کاملاً حذف کند تا مجبور به حل کردن پیچیدگی آن نباشد.

برای اجرای سوم، پژوهشگر بذر اول را حفظ کرد و یک جمله برای نام بردن از کیف اضافه کرد. در حالی که کیف با متریال و جایگاه درست در لگن ظاهر شد، دو خطای جدید ایجاد شد: یک بند دوم که روی بند اول در نمای پشت قرار گرفته بود (چیزی که هیچ کیف تک‌شانه‌ای تولید نمی‌کند) و ناپدید شدن کامل بند از نماهای جلو و کنار در همان برگه. در واقع، یک محدودیت اضافه که در نقطه مورد نظر برآورده شده بود، هزینه خود را در بخش‌های دیگر خروجی پرداخت کرد.

بودجهٔ رزولوشن

حیاتی‌ترین کشف این پژوهش مربوط به «بودجهٔ پنل» است. توانایی مدل در حفظ جزئیات با افزایش تعداد پنل‌های درخواستی به‌شدت افت می‌کند:

  • شبکه ۶-پنلی: این قوی‌ترین خروجی بود. هر ۶ چهره از نظر بصری متمایز بودند و عرض آن‌ها بین ۲۴۳ تا ۲۶۰ پیکسل بود. حتی یک لغزنده فلزی که تنها چند پیکسل عرض داشت، در ابعاد تقریبی ۳۴۱ در ۵۱۲ پیکسل برای هر پرتره باقی ماند.
  • شبکه ۹-پنلی: مدل قاب‌بندی را ساده کرد. تمام پنل‌ها کاملاً رو به دوربین شدند و موها به‌طور متقارن افتادند. جزئیاتی که فقط در مرجع بودند و در تمام ۶ پنل برگه کوچک‌تر زنده مانده بودند، در اینجا ناپدید شدند. علاوه بر این، دو جفت از احساسات به هم نزدیک شدند، به این معنی که ۹ جایگاه تنها ۷ چهره متفاوت تولید کرد.
  • تک-فیگور: یک فیگور در حالت چمباتمه، دفترچه‌ای در جیب سینه را با عرض ۷۱ پیکسل رندر کرد، در حالی که این عدد در کاربرگان‌های چند-ژسته تنها ۳۲ پیکسل بود. در این نمای تمام‌قاب، جلد، بلوک صفحات و ضخامت عطف دفترچه همگی خوانا بودند و دست در حال رسیدن، به پنج انگشت مجزا تفکیک شده بود.

یک تصویر مرجع، هشت اجرای برگه شخصیت، و چیزی که مدل ابداع کرد.

این ثابت می‌کند که مشکل مدل در «نقاشی کردن» نیست، بلکه در تخصیص قاب ۱۰۲۴ پیکسلی است. یک‌چهارم از یک قاب، به‌سادگی فضای کافی برای رندر کردن جزئیات ظریف را ندارد.

سلسله‌مراتب بقای جزئیات

در بررسی ۲۶ فیگور، پژوهشگر جزئیاتی را ردیابی کرد که «فقط در مرجع» بودند (چیزهایی که در پرامپت نام برده نشده بودند، مانند اینکه موها از کدام طرف پشت گوش می‌روند یا لبه شال‌گردن کجا آویزان است). این جزئیات با ترتیب مشخصی باقی ماندند:

  • دفترچه در جیب سینه: ۲۵ از ۲۶ فیگور (کنتراست بالا، موقعیت ثابت).
  • بند سینه: ۲۳ از ۲۶ نمای جلو و کنار.
  • لبه شال‌گردن در یک طرف: ۱۰ از ۱۷ فیگور تمام‌قد.
  • موهای پشت گوش: ۱۴ از ۲۶ نمای رو به بیننده.

یک تصویر مرجع، هشت اجرای برگه شخصیت، و چیزی که مدل ابداع کرد.

یک نکته مهم: دفترچه و بند در کاربرگان لباس کاملاً ناپدید شدند چون کتی که روی آن بودند جایگزین شد. هویت بصری که توسط یک شیء حمل می‌شود، دقیقاً تا زمانی دوام می‌آورد که آن شیء وجود داشته باشد.

تحلیل: طراحی برای مدل

برای سازندگان، این بدان معناست که هویت به اشیاء گره خورده است، نه به سیلوئت‌ها (طرح کلی). اگر ویژگی متمایز یک شخصیت، مدل خاصی از فرق مو باشد، احتمالاً هوش مصنوعی ابتدا آن را گم می‌کند. اما اگر آن ویژگی یک نشان با کنتراست بالا روی ژاکت باشد، پایداری بیشتری خواهد داشت.

این موضوع جریان کاری را از «پرامپت دادن برای رسیدن به نتیجه» به «طراحی برای فرمت» تغییر می‌دهد. کاربران باید با کاربرگان‌های هوش مصنوعی به عنوان مراجع کاری — یا حدس‌های محتمل — برخورد کنند، نه به عنوان نقشه‌های آماده برای تولید نهایی. شکاف بین یک تصویر تک‌نفره مفصل و یک برگه چند-پنلی، شکافی در بودجه رزولوشن است، نه در توانایی هنری. این چالش در واقع بازتابی از همان خطاهای بصری و توهماتی است که در مدل‌های زبانی مشاهده می‌شود، جایی که مدل با وجود اطمینان بالا، در بازتولید دقیق جزئیات شکست می‌خورد.

برای بهره‌برداری حداکثری از Tsubaki.3، باید نماهای دورگرد را دو بار اجرا کنید تا تأیید شود که نمای پشت یک پیش‌فرض پایدار است یا یک چرخش تصادفی. اگر جزئیاتی برای شما غیرقابل‌جایگزین است، آن را به جای یک پنل در کاربرگان، به صورت یک تصویر تک‌نفره با رزولوشن بالا تولید کنید. نمای کلی و جزئیات، دو وظیفه متفاوت هستند. برای درک بهتر اینکه چگونه می‌توان عملکرد واقعی مدل را از شانس تفکیک کرد، معیارهای جدید سنجش مدل‌های بصری دیدگاه‌های مفیدی ارائه می‌دهند.

گام بعدی شما

  • برای تایید پایداری نمای پشت، نمای دورگرد را دو بار با بذرهای مختلف اجرا کنید تا بفهمید خروجی یک پیش‌فرض پایدار است یا تصادفی.
  • اگر جزئیاتی برای شما غیرقابل‌جایگزین است، آن را به جای یک پنل در کاربرگان، به صورت یک تصویر تک‌نفره با رزولوشن بالا تولید کنید.
  • از اشیاء با کنتراست بالا برای تثبیت هویت شخصیت در پنل‌های متعدد استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی کنترل‌شده، ثابت می‌کند که محدودیت‌های بصری در AI ناشی از ضعف هنری نیست، بلکه یک محدودیت ریاضی در تخصیص پیکسل است. این درک برای استودیوهای بازی‌سازی و انیمیشن که به دنبال اتوماسیون طراحی شخصیت هستند، حیاتی است.

تأثیر برای ایران

برای طراحان ایرانی که از ابزارهای رایگان یا اشتراکی PixAI استفاده می‌کنند، این تحلیل راهکاری برای کاهش مصرف اعتبار (Credit) است تا به جای تکرار بی‌حاصل کاربرگان‌های شلوغ، روی تک‌تصویرهای باکیفیت تمرکز کنند.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها نشان می‌دهد که در مدل‌های مولد تصویر، «هویت» شخصیت بیش از آنکه به فرم کلی (Silhouette) وابسته باشد، به اشیاء متصل است. این موضوع جریان کاری را از «پرامپت‌نویسی برای نتیجه» به «طراحی برای فرمت» تغییر می‌دهد؛ یعنی کاربر باید بداند هر فرمت خروجی، چه مقدار از جزئیات را می‌بلعد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.