پرش به محتوای اصلی
پرش به محتوای مقاله

«ثبات شخصیت»؛ نقطه قوت PixAI در تقابل با Tensor.Art

·۱۸ مهر ۱۴۰۵۹ دقیقه مطالعه
مقایسه Tensor.Art و PixAI: کدام ژنراتور انیمه AI بهتر است؟
مقایسه Tensor.Art و PixAI: کدام ژنراتور انیمه AI بهتر است؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر رویکرد از مهندسی پرامپت به مدیریت شخصیت؛ مدل Tsubaki.3 به‌جای تمرکز بر تنوع، روی حفظ هویت بصری در محیطی یکپارچه (Studio) تمرکز کرده است.

تصور کنید می‌خواهید یک کمیک یا استوری‌بورد بسازید، اما هر بار که زاویه دوربین عوض می‌شود، چهره قهرمان داستان شما تغییر می‌کند. این «شکاف ثبات» همان مرز میان یک تولیدکننده تصادفی تصویر و ابزاری است که واقعاً برای خلق اثرات بصری متوالی کاربرد دارد. این تجربه شبیه به فیلم‌برداری از فیلمی است که در آن بازیگر نقش اول با هر کات دوربین، چهره‌اش تغییر می‌کند؛ تجربه‌ای که اکثر کاربران مدل‌های هوش مصنوعی فعلی با آن دست و پنجه نرم می‌کنند.

برای اکثر سازندگان، چالش اصلی ساخت یک تصویر زیبا نیست، بلکه این است که یک شخصیت واحد در ۱۰ ژست مختلف ظاهر شود بدون اینکه لباس یا اجزای صورتش تغییر کند. هوش مصنوعی زاینده (Generative AI) — شبیه نقاشی که هر بار از حافظه می‌کشد و ممکن است جزئیات را فراموش کند — در این زمینه ضعف دارد. طبق گزارش‌های منتشر شده در ۱۶ سپتامبر ۲۰۲۶، مدل Tsubaki.3 از شرکت PixAI ادعا می‌کند که با اولویت دادن به «حفظ هویت» به‌جای «تنوع تصویری»، این مشکل را حل کرده است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدل‌های انتشار (Diffusion Models) اشاره کردیم، ثبات بصری همواره پاشنه آشیل این فناوری بوده است. برای سنجش این ادعا، یک آزمون سخت‌گیرانه بین Tsubaki.3 و محیط Anime Lab در پلتفرم Tensor.Art (که در مارس ۲۰۲۶ عرضه شد) انجام شد.

اقتصاد اعتبار و دسترسی

در این تست از شخصیتی خاص استفاده شد تا معیاری دقیق برای سنجش وجود داشته باشد: فروشنده‌ای در اواخر دهه ۲۰ سالگی با موهای سرمه‌ای تیره که تا خط فک کوتاه شده، چشم‌های طلایی، ژاکت قرمز کوتاه روی لباس سفید یقه بلند و یک آویز یشم. این ۶ ویژگی قابل ردیابی، به عنوان بنچ‌مارک یا محک ثبات مدل‌ها در نظر گرفته شدند.

هزینه دسترسی به این ابزارها به شدت متفاوت است. PixAI از طریق یک سیستم «چک-این» روزانه ۱۰,۰۰۰ اعتبار رایگان در اختیار کاربر قرار می‌دهد. هر تصویر با رزولوشن 2K که با مدل Tsubaki.3 تولید شود، بین ۴,۰۰۰ تا ۴,۴۰۰ اعتبار هزینه دارد؛ این یعنی کاربران رایگان محدود به تولید تقریباً دو یا سه تصویر باکیفیت در روز هستند.

در مقابل، Tensor.Art بودجه روزانه بسیار محدودتری (۱۰۰ اعتبار) ارائه می‌دهد، هرچند مستندات این پلتفرم متناقض است و در برخی صفحات عدد ۵۰ اعتبار ذکر شده است. از آنجایی که هزینه اکثر تولیدات بیش از یک اعتبار است، بودجه تکرار و اصلاح (Iteration) در این پلتفرم به طور قابل توجهی narrower یا محدودتر از PixAI است.

مسیر ورود و انتخاب مدل

شروع کار در این دو پلتفرم نیازمند دو طرز فکر متفاوت است. در PixAI مسیر خطی و ساده است: شما مستقیماً به سراغ مدل Tsubaki.3 می‌روید. ساختار پرامپت‌ها در اینجا از «زبان طبیعی» پیروی می‌کند؛ به این معنا که شما شخصیت را همان‌طور که برای یک انسان توصیف می‌کنید، برای هوش مصنوعی شرح می‌دهید.

اما در Tensor.Art، اولین تصمیم، سرنوشت‌سازترین تصمیم است. کتابخانه Anime Lab یکی از بزرگ‌ترین منابع در دسترس کاربران رایگان است، اما همین موضوع باعث ایجاد «پارادوکس انتخاب» می‌شود. کاربر باید بین صدها گزینه در معماری‌های مختلف پیمایش کند، از جمله:

  • SDXL: مدل‌های پایه با رزولوشن بالا.
  • Pony: مدل‌هایی که برای زیبایی‌شناسی خاص و تخصصی انیمه بهینه شده‌اند.
  • Flux: معماری جدیدتر برای دستیابی به دقت و وفاداری بصری (Fidelity) بالاتر.

این مدل‌ها طیفی از سبک‌ها، از تصویرسازی‌های نرم تا «سل-شیدینگ» (Cel-shading) تیز و مشخص را پوشش می‌دهند و هر کدام قراردادهای برچسب‌گذاری (Tagging) متفاوتی می‌طلبند. برای این تست، مدلی انتخاب شد که بر تصویرسازی انیمه با خطوط تعریف‌شده تمرکز داشت. یک هشدار حیاتی برای کاربران: تغییر مدل در میانه پروژه به معنای یادگیری مجدد تمام تنظیمات از نقطه صفر است.

دو هوش مصنوعی تنسورآرت و پیکس‌ای‌آی در حال تولید تصاویر انیمه مقایسه می‌شوند

آزمون اول: تطبیق با دستورات

اولین تسک، خلق یک صحنه پیچیده بود: شخصیت پشت یک غرفه جشنواره در شب، در حالی که فانوسی را به سمت مشتری می‌گیرد و تنها ساعد مشتری در کادر دیده می‌شود. این تست ۷ نیاز بصری و مکانی هم‌زمان را به چالش می‌کشید.

پرامپت Tsubaki.3 بسیار مفصل بود: «زنی جوان در اواخر دهه ۲۰ سالگی با موهای سرمه‌ای تیره کوتاه تا خط فک، چتری صاف، چشم‌های طلایی با بازتاب نور، پوشیده در یک ژاکت قرمز کوتاه روی لباس سفید یقه بلند، آویز یشم کوچک با بند نازک. او پشت پیشخوان یک غرفه جشنواره در شب ایستاده است، دست چپش به صورت تخت روی سطح چوبی پیشخوان قرار دارد و دست راستش یک فانوس کاغذی کوچک و درخشان را به سمت مشتری می‌گیرد. تنها ساعد مشتری از لبه راست کادر وارد شده است. تزیینات قرمز کاغذی جشنواره در پس‌زمینه محو شده‌اند. نور فانوس صورت او را از پایین گرم می‌کند و در لبه‌های کادر سایه‌های عمیقی وجود دارد. حالت چهره او کاری و کمی خسته است. سبک تصویرسازی انیمه، رزولوشن 2K.»

Tsubaki.3 در اولین تلاش، معماری صحنه را به طور کامل پیاده کرد. پیشخوان در جای درست بود و دست چپ او دقیقاً طبق دستور با انگشتان باز روی چوب قرار داشت. ژاکت قرمز روی لباس سفید یقه بلند به صورت تمیز اجرا شد و آویز یشم به عنوان یک شکل سبز در خط گردن کاملاً مشهود بود. این مدل ۶ مورد از ۶ ویژگی ردیابی را درست اجرا کرد. تنها نقص، حالت چهره بود؛ او به‌جای «کاری-خسته»، «متین و محتاط» به نظر می‌رسید.

در مقابل، Tensor.Art نیازمند تطبیق با پرامپت‌های برچسب‌گونه (Tag-style) برای مدل SDXL بود. با اینکه اتمسفر بسیار قوی بود — شامل فانوس‌های رشته‌ای گرم، بنرهای قرمز و بازاری شبانه با انرژی واقعی جمعیت — اما منطق مکانی شکست خورد. دست‌های شخصیت به‌جای روی پیشخوان، در کنار بدنش بود. فانوس با یک اثر کریستالی درخشان و توجیه‌ناپذیر در پایین کادر جایگزین شد. علاوه بر این، به‌جای یک ساعد تک، چندین فیگور کامل در پس‌زمینه ظاهر شدند. این مدل تنها ۳ مورد از ۶ ویژگی کلیدی را درست اجرا کرد.

مقایسه Tensor.Art و PixAI: کدام ژنراتور انیمه AI بهتر است؟

تست برگه حالات (Expression Sheet)

برای تست دارایی‌های ساختاریافته، شخصیت در ۵ حالت احساسی قرار گرفت: متانت خنثی، عصبانیت آشکار، غافلگیری محتاطانه، گرمی واقعی و تمرکز. این یک تست حیاتی برای هر هنرمندی است که به یک برگه مرجع (Reference Sheet) نیاز دارد.

PixAI از یک گردش کار مبتنی بر ویرایش (Edit-based) استفاده کرد؛ یعنی هر حالت احساسی را بر اساس یک تصویر پایه ساخت، نه اینکه ۵ تصویر جداگانه را از صفر تولید کند. این روش باعث شد بنیاد تصویر ثابت بماند: مدل موی کوتاه تا فک، چتری و آویز یشم در ۴ پنل از ۵ پنل کاملاً ثابت ماندند. حالات چهره واقعاً متمایز بودند و برگه نهایی را به یک دارایی مرجع کاربردی تبدیل کرد. اگرچه یک پنل نیاز به اصلاح جزئی در فرم صورت داشت، اما هر ۵ پنل نقاط شروع مناسبی بودند.

Tensor.Art از مدل Wan2.7-Image استفاده کرد که از حداکثر ۹ ورودی مرجع برای ثبات شخصیت پشتیبانی می‌کند. با تغذیه یک تصویر مرجع، ۴ پنل از ۵ پنل توانستند موهای تیره، چشم‌های طلایی، ژاکت قرمز و آویز یشم را حفظ کنند. با این حال، در پنل پنجم، چهره کاملاً از کادر خارج شد. همچنین همان اثر کریستالی درخشان از تست اول دوباره ظاهر شد. به‌دلیل بودجه محدود ۱۰۰ اعتباری روزانه، تکرار برای رفع این خطاها بسیار هزینه‌بر و دشوار است.

مقایسه Tensor.Art و PixAI: کدام ژنراتور انیمه AI بهتر است؟

مقایسه Tensor.Art و PixAI: کدام ژنراتور انیمه AI بهتر است؟

ویرایش متوالی در استودیو

آخرین تست شامل دو ویرایش متوالی روی صحنه اصلی بازار شب بود. این فرآیند بررسی می‌کرد که آیا هوش مصنوعی می‌تواند روی نتیجه قبلی بسازد یا هر بار تصویر را ریست می‌کند.

PixAI Studio مانند یک فضای کاری یکپارچه عمل می‌کند که توالی ویرایش‌ها را سازماندهی می‌کند. در ویرایش اول، نورپردازی از اولویت فانوس به یک چراغ خیابان سردتر در بالای سر تغییر یافت. نتیجه بی‌نقص بود: درخشش گرم روی صورت حذف شد، اما موهای سرمه‌ای، ژاکت، موقعیت دست‌ها و فیگور مشتری کاملاً ثابت ماندند.

در ویرایش دوم، حالت چهره به «غافلگیر» (در حد بازنگری، نه وحشت‌زده) تغییر کرد. جهت چشم‌ها ثابت ماند، در حالی که دهان و ابروها کمی تغییر کردند. تحسین‌برانگیزترین بخش این بود که این تغییر روی نتیجه ویرایش اول اعمال شد، نه روی تصویر پایه. تنها انحراف این بود که شکل آویز یشم کمی پرتر شد.

مقایسه Tensor.Art و PixAI: کدام ژنراتور انیمه AI بهتر است؟

Tensor.Art فاقد یک فضای کاری یکپارچه است و کاربر مجبور است به صورت دستی بین ابزارهای Smart Edit و Inpainting (ترمیم تصویر) جابه‌جا شود. در حالی که تغییر نورپردازی از نظر جهت‌دهی درست بود و یک شست‌وشوی آبی سرد ایجاد کرد، اما یک «درز» (Seam) بصری در محل اتصال ناحیه ترمیم‌شده به کادر اصلی باقی گذاشت. المان درخشان روی پیشخوان نیز کمی از ترکیب‌بندی جدا به نظر می‌رسید.

مقایسه Tensor.Art و PixAI: کدام ژنراتور انیمه AI بهتر است؟

ویرایش حالت چهره نیازمند Inpainting دقیق ناحیه صورت بود. مدل در اینجا بیش از حد واکنش نشان داد (Overcorrected) و چهره‌ای با دهان باز از شدت شوک، دندان‌های نمایان و چشم‌های گشاد تولید کرد. شخصیت به‌جای متفکر بودن، «وحشت‌زده» به نظر می‌رسید. در حالی که هویت و جهت چشم‌ها حفظ شده بود، اما ظرافت‌های احساسی از دست رفت. درز بصری در اینجا حتی مشهودتر بود، زیرا ناحیه صورت با موها و یقه ژاکت هم‌مرز است.

مقایسه Tensor.Art و PixAI: کدام ژنراتور انیمه AI بهتر است؟

تلاش عملی و دسترسی

هنگام انتخاب بین این دو پلتفرم، هزینه «پنهان»، همان تلاش دستی است که برای رسیدن به نتیجه نهایی لازم است.

  • PixAI: ابزار Inpainting در سطح رایگان در دسترس است. اگرچه قابلیت «Reference Pro» نیازمند اشتراک پولی است، اما مدل Tsubaki.3 بخش بزرگی از ثبات را از طریق زبان طبیعی و فضای استودیو مدیریت می‌کند.
  • Tensor.Art: دسترسی به Anime Lab و مدل‌های جامعه رایگان است، اما بودجه اعتباری روزانه (۵۰-۱۰۰ اعتبار) محدودکننده اصلی است. هیچ سیستم جمع‌آوری اعتبار غیرفعالی مانند چک-این PixAI در اینجا وجود ندارد.

حکم نهایی درباره گردش کار

گردش کار مبتنی بر زبان طبیعی در PixAI به طور قابل توجهی شهودی‌تر است. این سیستم به کاربران اجازه می‌دهد صحنه را همان‌طور که برای یک انسان توصیف می‌کنند شرح دهند، به‌جای اینکه توده‌هایی از کلمات کلیدی با وزن‌های مختلف بسازند. این امر بار شناختی سازنده را کاهش می‌دهد.

قدرت Tensor.Art در کتابخانه عظیم آن نهفته است. اگر به یک سبک بصری بسیار خاص — از تصویرسازی نرم تا سل-شیدینگ — نیاز دارید، احتمالاً Anime Lab مدلی برای آن دارد. با این حال، ثبات در این پلتفرم به‌جای توصیف ساده، از طریق تنظیمات مرجع و جابه‌جایی دستی بین ابزارها به دست می‌آید.

در نهایت، شکاف در ثبات شخصیت، عامل تعیین‌کننده است. Tsubaki.3 مسیری قابل‌اعتماد از یک ایده واحد به یک پروژه چندصحنه‌ای فراهم می‌کند بدون اینکه نیاز به اصلاحات دستی مداوم باشد.

برای کاربر عادی، انتخاب ساده است: از Tensor.Art برای تک‌تصویرهای با استایل بالا استفاده کنید. اگر در حال ساخت شخصیتی هستید که قصد دارید در کل یک داستان از او استفاده کنید، PixAI را انتخاب کنید. این تغییر نشان می‌دهد که صنعت در حال حرکت از «مهندسی پرامپت» به سمت «مدیریت شخصیت» است. ارزش دیگر در یک تصویر واحد نیست، بلکه در تداوم دارایی دیجیتال در طول یک گردش کار است.

گام بعدی شما

  • اگر روی یک رمان تصویری یا کمیک کار می‌کنید، مدل Tsubaki.3 را برای تست ثبات شخصیت‌هایتان امتحان کنید.
  • در Tensor.Art به‌جای تکیه بر پرامپت، از قابلیت ورودی‌های مرجع (Reference Inputs) برای کاهش تغییرات چهره استفاده کنید.
  • برای کاهش هزینه‌های استنتاج، ابتدا طرح‌بندی صحنه را با مدل‌های ارزان‌تر انجام دهید و در مرحله نهایی از مدل‌های باکیفیت‌تر استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رقابت نشان می‌دهد که مدیریت هویت بصری به یک استاندارد صنعتی تبدیل شده است. برنده این میدان، ابزاری است که بتواند جریان کاری (Workflow) را از تولید تصادفی به مدیریت دارایی‌های دیجیتال تغییر دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های پرداخت و API، دسترسی به نسخه‌های Pro این ابزارها برای کاربران ایرانی دشوار است، اما مدل‌های رایگان آن‌ها برای تولیدکنندگان محتوای بصری داخلی جایگزین مناسبی برای مدل‌های پیچیده محلی هستند.

·نگاه ما
تحریریه دات‌هوش

ارزش ابزارهای تولید تصویر در حال جابه‌جایی از «کیفیت تک‌فریم» به «پایداری دارایی دیجیتال» است. Tsubaki.3 ثابت کرد که برای کاربر حرفه‌ای، قابلیت پیش‌بینی‌پذیری مدل بسیار ارزشمندتر از تنوع تصادفی است. این یعنی مدل‌هایی که بتوانند یک «حافظه بصری» از شخصیت ایجاد کنند، جایگزین مدل‌های عمومی خواهند شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.