پرش به محتوای اصلی
پرش به محتوای مقاله

درون سازوکار Tsubaki.3 برای جلوگیری از پدیده تغییر شخصیت

·۲۶ مرداد ۱۴۰۵۱۷ دقیقه مطالعه۴ بازدید
راهنما
دوازده تست هوش مصنوعی برای شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم.
دوازده تست هوش مصنوعی برای شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از متد Prompt-only به Character Reference در مدل Tsubaki.3؛ این مدل برخلاف نسل‌های قبل، ویژگی‌های بصری را از روی تصویر قفل می‌کند نه از روی تفسیر متن.

تصور کنید یک طراح دیجیتال یا وی‌توبری (VTuber) باشید که می‌خواهد شخصیت اصلی خود را در ۱۰ صحنه مختلف قرار دهد، اما در هر تصویر، رنگ چشم‌ها جابه‌جا شده یا جزئیات لباس تغییر می‌کند. این کابوس «تغییر شخصیت» (Character Drift) اکنون با مدل Tsubaki.3 از شرکت PixAI به پایان رسیده است. آیا یک تک تصویر از یک شخصیت اصلی (OC) می‌تواند به عنوان یک لنگر بصری دائمی عمل کند و نیاز به بازسازی طراحی از طریق متن را برای هر نسل جدید از تصاویر از بین ببرد؟ تست‌های انجام شده روی جدیدترین مدل PixAI، یعنی Tsubaki.3، نشان داد که هوش مصنوعی مرجع شخصیت می‌تواند ویژگی‌های شناسایی خاص — مانند تفاوت رنگ چشم‌ها (Heterochromia) و جزئیات دقیق لباس — را در ۱۲ سناریوی متنوع به‌طور کامل حفظ کند.

برای هنرمندان دیجیتال و وی‌توبرها، چالش همیشگی «لغزش شخصیت» بوده است. در استودیوهای سنتی انیمه، یک انیماتور معمولاً شخصیت را صرفاً از روی حافظه نمی‌کشد. آن‌ها با یک «برگه مدل» (Model Sheet) کار می‌کنند: یک مرجع قفل‌شده که طراحی را از چندین زاویه با تمام جزئیاتی که باید ثابت بمانند، نشان می‌دهد. بدون این برگه، یک شخصیت در طول ده‌ها قسمت به آرامی به فرد دیگری تبدیل می‌شود. تولیدکننده‌های تصویر با هوش مصنوعی نیز با همین محدودیت روبرو هستند و هوش مصنوعی مرجع شخصیت دقیقاً برای پر کردن این شکاف ساخته شده است.

هیچ تولیدکننده شخصیت انیمه‌ای که ادعای ثبات داشته باشد، نمی‌تواند به تنهایی یک طراحی را از یک تصویر به تصویر بعدی منتقل کند. هر بار که دکمه «Generate» را می‌زنید، مدل شخصیت شما را دوباره بر اساس هر آنچه در پرامپت شما آمده است، می‌سازد. این موضوع هنگام طراحی شخصیتی به نام «رن» (Ren) کاملاً مشهود بود؛ جادوگری جوان با موهای سرمه‌ای تیره که رگه‌ای روشن روی یک چشمش دارد، عینک‌های طلایی گرد و چشم‌های ناهماهنگ (یک چشم کهربایی و دیگری تیره). در حالی که اولین تصویر از رن که در کتابخانه‌ای ایستاده بود و جغدش روی شانه چپش بود عالی بود، تصویر دوم در اتاقی دیگر با استفاده از همان پرامپت، منجر به جابه‌جایی رنگ چشم‌ها، بازترسیم شنل و تبدیل شدن جغد به پرنده‌ای کاملاً متفاوت شد.

دوازده تست هوش مصنوعی برای شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم.

سیستم مرجع شخصیت در Tsubaki.3 این شکاف را با جایگزینی «توصیف متنی» با «داده‌های تصویری» پر می‌کند. در حالی که یک پرامپت توصیف می‌کند که شخصیت باید چگونه به نظر برسد، یک تولیدکننده مرجع بر اساس آنچه شخصیت هم‌اکنون هست عمل می‌کند. این تغییر حیاتی است زیرا پرامپت‌ها فضای زیادی برای تفسیر باقی می‌گذارند، در حالی که یک تصویر مجموعه‌ای از واقعیت‌های بصری قفل‌شده را ارائه می‌دهد. پنل‌های کمیک، تصویرسازی‌های داستانی، آثار هنری فصلی و دارایی‌های تبلیغاتی وی‌توبرها، همگی نیاز دارند که یک شخصیت در ده‌ها تصویر یکسان بماند و یک پرامپت به تنهایی نمی‌تواند این کار را انجام دهد.

دوازده تست هوش مصنوعی برای شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم.

مکانیسم تغییر شخصیت

تولید تصویر صرفاً با متن اغلب در جزئیات «شمارشی» یا «جهتی» شکست می‌خورد. یک پرامپت صرفاً یک توصیف است و توصیفات به هوش مصنوعی اجازه می‌دهند تا ابداع کند. برای مثال، عبارت «موهای سرمه‌ای با رگه روشن، یک چشم کهربایی و یک چشم تیره، شنل سبز، جغدی روی شانه» توصیف درستی از رن است، اما این توصیف برای هزاران پسر مختلف دیگر نیز صدق می‌کند. همه آن‌ها از نظر فنی درست هستند، اما فقط یکی از آن‌ها «رن» است.

ویژگی‌های کلی مانند رنگ مو، رنگ چشم و شکل کلی لباس معمولاً باقی می‌مانند. با این حال، جزئیات ظریف‌تر لغزش می‌کنند:

  • هندسه ظریف: نحوه تقسیم شدن چتری‌های مو، قرارگیری چشم‌ها و عرض فک.
  • جزئیات شمارشی: تبدیل سه دکمه به دو دکمه، یا ساده شدن سرآستین‌های گلدوزی شده به سرآستین‌های ساده.
  • ثبات همراهان: بازگشت جغد به عنوان گونه‌ای متفاوت از پرندگان.

دشواری همچنین با میزان تغییر درخواستی افزایش می‌یابد. تغییر پس‌زمینه آسان است زیرا شخصیت دست‌نخورده باقی می‌ماند. تغییر فیگور (Pose) سخت‌تر است. تغییر لباس یا زاویه دوربین سخت‌ترین حالت است، زیرا مدل باید بخش‌هایی را که شما برای شناسایی شخصیت به آن‌ها تکیه می‌کردید، از نو بسازد.

دوازده تست هوش مصنوعی شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم

کالبدشکافی تست‌های Tsubaki.3

پژوهشگران برای تست Tsubaki.3 از یک تصویر مرجع از رن و استراتژی «پرامپت حداقلی» استفاده کردند. Tsubaki.3 با تمرکز بیشتری بر کنترل و ثبات ساخته شده است و می‌تواند تا سه تصویر مرجع را بپذیرد که یا از تولیدات خود PixAI استخراج شده‌اند یا از فایل‌های کاربر آپلود شده‌اند.

راه‌اندازی ساده بود: انتخاب Tsubaki.3، افزودن تصویر رن به عنوان مرجع شخصیت و نوشتن پرامپتی که فقط شامل مواردی باشد که باید تغییر کنند. در اولین تست، یک پرامپت ساده هفت‌کلمه‌ای درخواست یک شمع روشن در دست او را داشت. چون تمام اطلاعات مدل درباره رن از تصویر می‌آمد، نتیجه بر این اساس قضاوت شد که آیا او با اضافه شدن شمع، همچنان خودش باقی مانده است یا خیر.

دوازده تست هوش مصنوعی شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم

تیم ارزیابی برای رسیدن به نتیجه عینی، ۶ نشانگر را در هر تصویر چک کرد:

  • چشم چپ کهربایی و راست تیره.
  • رگه روشن مو و سمت دقیقی که روی پیشانی می‌افتد.
  • عینک طلایی با فریم گرد و ظریف.
  • سه دکمه برنزی.
  • گلدوزی‌های روشن و پیچ‌درپیچ روی یقه و سرآستین.
  • حفظ گونه‌ی دقیق جغد و اینکه آیا همان پرنده قبلی است یا خیر.

تغییرات محیطی

در مرحله بعد، رن به محیط‌های کاملاً جدید منتقل شد. تیم رن را به عنوان مرجع نگه داشت و هر آنچه اطراف او بود را جایگزین کرد. آن‌ها در هر پرامپت نام جغد را آوردند تا مدل بداند باید او را بگنجاند، اما هرگز ظاهر پرنده را توصیف نکردند تا هوش مصنوعی مجبور شود کاملاً به تصویر مرجع تکیه کند.

سه پرامپت اجرا شد:
۱. «او در یک غرفه بازار شب با جغدش روی شانه ایستاده است، فانوس‌های کاغذی بالای سرش هستند و به چیزی خارج از کادر نگاه می‌کند»
۲. «او در غروب آفتاب روی تپه‌ای نشسته و جغدش کنار اوست و علف‌های بلند دور او را گرفته‌اند»
۳. «او زیر باران شدید در حالی که چتری را نگه داشته راه می‌رود، جغدش روی شانه زیر چتر پناه گرفته و سنگ‌فرش‌ها خیس هستند»

در هیچ‌یک از این پرامپت‌ها اشاره‌ای به مو، چشم، عینک، دکمه‌ها یا گلدوزی‌های رن نشد. با این حال، اکثر موارد چک‌لیست دست‌نخورده باقی ماندند. به‌ویژه جغد، در هر سه تصویر همان پرنده پف‌کرده با دسته موهای روی سر باقی ماند، در حالی که در تست‌های مبتنی بر متن، در هر بار به گونه‌ای متفاوت تبدیل می‌شد.

دوازده تست هوش مصنوعی برای شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم.

دوازده تست هوش مصنوعی شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم

تغییر لباس و فیگور

تغییر لباس سخت‌تر است زیرا مدل باید بدن شخصیت را دوباره ترسیم کند. تیم سه پرامپت را تست کرد تا ببیند وقتی شنل — و دکمه‌ها و گلدوزی‌های مرتبط با آن — حذف می‌شود، چه چیزهایی باقی می‌مانند:

  • تغییر لباس: «او به جای شنل، یک پلیور بافتنی ضخیم و شال‌گردن پوشیده است، جغدش روی شانه‌اش است و در فضای باز در برف ایستاده است»
  • تغییر فیگور: «او چمباتمه زده تا به چیزی روی زمین نگاه کند، یک دستش روی زانویش است، جغدش روی شانه‌اش است، خیابان سنگ‌فرش»
  • تغییر ترکیبی: «او یک یوکاتای تابستانی و صندل پوشیده است، روی پله‌های چوبی نشسته و یک دستش روی زانو است، جغدش کنار اوست»

ویژگی‌های شناسایی در هر سه حالت حفظ شدند. چشم کهربایی در سمت چپ، چشم تیره در راست و رگه مو در سمت درست باقی ماند. عینک و جغد حتی در لباس یوکاتا بدون تغییر بودند. تنها یک ناهماهنگی در تصویر چمباتمه رخ داد: مدل دهان رن را باز ترسیم کرد و زاویه دوربین را بالا برد، در حالی که هیچ‌کدام در پرامپت نبودند. این نشان می‌دهد وقتی پرامپت خلأ ایجاد کند، مدل آن را با ابداعات خود پر می‌کند.

دوازده تست هوش مصنوعی برای شخصیت‌پردازی روی یک شخصیت اصلی اجرا کردیم.

چالش زوایای سخت

زوایای شدید دوربین سخت‌ترین آزمون برای هوش مصنوعی مرجع هستند زیرا تصویر مرجع (که معمولاً روبروست) دیگر با خروجی هم‌راستا نیست. مدل باید هندسه را استنباط کند و بخش‌هایی را ابداع کند که هرگز به او نشان داده نشده است. سه پرامپت استفاده شد:

  • «نمای زاویه پایین (Low angle) که به او نگاه می‌کند، او در مقابل آسمان عصرگاهی ایستاده و جغدش روی شانه‌اش است»
  • «از پشت دیده می‌شود، او در حال دور شدن در یک راهرو است و از روی شانه به عقب نگاه می‌کند، جغدش روی شانه‌اش است»
  • «نمای بسیار نزدیک (Extreme close-up) از صورت او که سه-چهارم از دوربین دور شده است، جغدش در پشت او کمی دیده می‌شود»

هویت رن زنده ماند. تفاوت رنگ چشم‌ها حتی در نمای نزدیک درست بود. با این حال، مدل در برابر زوایای دوربین مقاومت کرد؛ نمای سه-چهارم را نزدیک‌تر به نمای روبرو کشید و زاویه پایین ملایم‌تر از توصیف بود. Tsubaki.3 اولویت را به «طراحی» داد تا «ترکیب‌بندی». این موضوع ارزش سه اسلات مرجع را برجسته می‌کند؛ استفاده از نماهای روبرو، کنار و پشت، داده‌های واقعی را به جای حدس و گمان برای زوایای دراماتیک در اختیار مدل قرار می‌دهد.

ادغام در گردش‌کار سازندگان

این قابلیت روش تولید دارایی‌های بصری را برای سازندگان OC و وی‌توبرهای دیجیتال تغییر می‌دهد. برای سازندگان OC، این سیستم موارد زیر را پشتیبانی می‌کند:

  • تصویرسازی داستان: جابه‌جایی شخصیت‌ها در مکان‌های مختلف بدون تغییر در طراحی آن‌ها.
  • لباس‌های جایگزین: ایجاد کمد لباس‌های فصلی یا مناسبتی برای یک فرد ثابت.
  • آرت‌های مناسبتی: استفاده مجدد از یک طراحی برای آثار تولد یا سالگردها در ماه‌های بعد.
  • صحنه‌های چندشخصیتی: حفظ ظاهر یک شخصیت وقتی در کنار یک OC دیگر قرار می‌گیرد.

برای وی‌توبرها، این ابزار در تولید دارایی‌های تبلیغاتی کمک می‌کند:

  • آرت‌های اعلان و تامنیل‌ها: اطمینان از اینکه آواتار برای شناسایی فوری، دقیقاً مطابق مدل است.
  • رونمایی از لباس‌ها: یکسان نگه داشتن چهره در حالی که لباس‌ها تغییر می‌کنند.
  • تنوع در حالات چهره: ایجاد ایموت‌ها (Emotes)، لایه‌ها و تصاویر واکنشی که در کنار هم قرار می‌گیرند.
  • دارایی‌های فصلی: حفظ ثبات برای برنامه‌های استریم و گرافیک‌های رویدادها.

نکته: این سیستم تصاویر تخت تولید می‌کند، نه یک ریگ (Rig). این ابزار جایگزین هنرمندان Live2D یا ریگرها نیست، بلکه هنر تبلیغاتی استاتیک اطراف یک آواتار را پوشش می‌دهد.

گسترش کتابخانه دارایی‌ها

یک تصویر مرجع می‌تواند برای چیزی بیش از تصویرسازی‌های ساده استفاده شود. با استفاده از پرامپت «تولید یک برگه سه-نمای از شخصیت در تصویر @image1»، سازندگان می‌توانند یک Character Turnaround تولید کنند که نماهای جلو، کنار و پشت را نشان می‌دهد.

سایر دارایی‌های ممکن عبارتند از:

  • برگه‌های حالت‌های چهره (Expression Sheets): شبکه‌ای از یک چهره در حالات روحی مختلف.
  • پنل‌های مانگا: هنر متوالی بدون نیاز به بازترسیم شخصیت برای هر فریم.
  • استیکرها: مجموعه‌ای از فیگورها و واکنش‌های برش‌خورده برای چت یا استریم‌ها.
  • رندرهای استایل فیگور: برخورد با طراحی به عنوان یک شیء فیزیکی برای پیش‌نمایش‌های محصولات تجاری (Merch).
  • تغییرات نورپردازی: تست یک ترکیب‌بندی در ساعات مختلف روز یا مودهای مختلف.

مرجع تصویری در برابر LoRA و ویرایش

هوش مصنوعی مرجع شخصیت یکی از سه رویکرد اصلی برای رسیدن به ثبات است که هر کدام مشکلی متفاوت را حل می‌کنند:

  • مرجع شخصیت (Character Reference): از روی یک تصویر موجود کار می‌کند. نیازی به آموزش ندارد. سریع‌ترین راه برای انتقال یک طراحی نهایی به یک صحنه یا فیگور جدید است.
  • لورا (LoRA - Low-Rank Adaptation): یک فایل افزونه کوچک است که به مدل پایه، یک شخصیت یا استایل خاص را می‌آموزد. نیاز به مجموعه‌ای از تصاویر آموزشی و زمان انتظار دارد، اما اجازه می‌دهد شخصیت از طریق یک کلمه کلیدی (Trigger word) فراخوانده شود. این روش برای پروژه‌های بلندمدت که ماه‌ها ادامه دارند، بهترین است.
  • ویرایش تصویر (Image Editing): ابزاری برای تعمیر است که برای اصلاح خطاهای خاص در تصویری که در کل عالی است، استفاده می‌شود.

در یک خط لوله حرفه‌ای، این‌ها اغلب با هم استفاده می‌شوند: یک مرجع، مجموعه‌ای از تصاویر تمیز را تولید می‌کند، آن تصاویر به مجموعه آموزشی LoRA تبدیل می‌شوند و ویرایش نهایی، نتایج را صیقل می‌دهد.

حکم نهایی Tsubaki.3

در طول ۱۲ تست، رن همیشه به طور قابل شناسایی «رن» باقی ماند. چهره، تناسبات و تفاوت رنگ چشم‌ها در تمام تغییرات صحنه و لباس کاملاً ثابت بودند. لباس‌ها پایدارتر از حد انتظار بودند و تعداد سه دکمه و گلدوزی‌ها حتی در باران شدید و زوایای پایین دوام آوردند.

با این حال، این مدل یک «لنگر» است، نه یک «قفل». برخی تغییرات ناخواسته رخ داد:

  • تغییرات لباس: باران، شنل را به یک اورکوت جذب‌شده تبدیل کرد.
  • حالات چهره: حالت چمباتمه باعث باز شدن دهان شد.
  • ابداع: مدل برای نمای پشت، شلواری را ابداع کرد زیرا تصویر مرجع آن‌ها را نشان نمی‌داد.

برای سازندگان، نتیجه روشن است: دیگر شخصیت‌هایتان را از صفر بازسازی نکنید. با استفاده از یک تصویر مرجع در Tsubaki.3 در PixAI، شما از «حدس زدن با متن» به «اجرا با طراحی» حرکت می‌کنید.

گام بعدی شما

  • اگر شخصیت اصلی (OC) دارید، یک تصویر مرجع با کیفیت بالا از نمای روبرو تهیه کنید و در Tsubaki.3 تست کنید.
  • برای زوایای سخت، از هر سه اسلات مرجع (جلو، کنار، پشت) استفاده کنید تا مدل مجبور به تخیل نشود.
  • ترکیبی از مرجع تصویری و LoRA را برای پروژه‌هایی که بیش از ۲۰ تصویر نیاز دارند امتحان کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با حل مشکل ثبات بصری، ورود هوش مصنوعی به تولیدات تجاری مانند کمیک و انیمیشن را که نیازمند تکرار دقیق شخصیت هستند، تسهیل می‌کند. اعتبار این مدل از طریق تست‌های سخت‌گیرانه روی جزئیات شمارشی (مانند تعداد دکمه‌ها) به اثبات رسیده است.

تأثیر برای ایران

برای طراحان گرافیک و تولیدکنندگان محتوای بصری ایرانی که در حوزه وی‌توبینگ و کمیک فعال‌اند، این ابزار هزینه تولید دارایی‌های بصری را به‌شدت کاهش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی توصیفات متنی با لنگرهای تصویری، پایان عصر «شانس» در تولید کاراکترهای AI است. این رویکرد نشان می‌دهد که آینده‌ی مدل‌های مولد نه در افزایش حجم پرامپت‌ها، بلکه در ایجاد سیستم‌های کنترل بصری (Visual Control) است که اجازه می‌دهد هنرمند به جای نقش «نویسنده»، دوباره نقش «کارگردان» را بازی کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.