تصور کنید میخواهید یک کمیک یا استوریبورد بسازید، اما هر بار که زاویه دوربین عوض میشود، چهره قهرمان داستان شما تغییر میکند. این «شکاف ثبات» همان مرز میان یک تولیدکننده تصادفی تصویر و ابزاری است که واقعاً برای خلق اثرات بصری متوالی کاربرد دارد. این تجربه شبیه به فیلمبرداری از فیلمی است که در آن بازیگر نقش اول با هر کات دوربین، چهرهاش تغییر میکند؛ تجربهای که اکثر کاربران مدلهای هوش مصنوعی فعلی با آن دست و پنجه نرم میکنند.
برای اکثر سازندگان، چالش اصلی ساخت یک تصویر زیبا نیست، بلکه این است که یک شخصیت واحد در ۱۰ ژست مختلف ظاهر شود بدون اینکه لباس یا اجزای صورتش تغییر کند. هوش مصنوعی زاینده (Generative AI) — شبیه نقاشی که هر بار از حافظه میکشد و ممکن است جزئیات را فراموش کند — در این زمینه ضعف دارد. طبق گزارشهای منتشر شده در ۱۶ سپتامبر ۲۰۲۶، مدل Tsubaki.3 از شرکت PixAI ادعا میکند که با اولویت دادن به «حفظ هویت» بهجای «تنوع تصویری»، این مشکل را حل کرده است.
همانطور که در تحلیلهای قبلی ما دربارهی مدلهای انتشار (Diffusion Models) اشاره کردیم، ثبات بصری همواره پاشنه آشیل این فناوری بوده است. برای سنجش این ادعا، یک آزمون سختگیرانه بین Tsubaki.3 و محیط Anime Lab در پلتفرم Tensor.Art (که در مارس ۲۰۲۶ عرضه شد) انجام شد.
اقتصاد اعتبار و دسترسی
در این تست از شخصیتی خاص استفاده شد تا معیاری دقیق برای سنجش وجود داشته باشد: فروشندهای در اواخر دهه ۲۰ سالگی با موهای سرمهای تیره که تا خط فک کوتاه شده، چشمهای طلایی، ژاکت قرمز کوتاه روی لباس سفید یقه بلند و یک آویز یشم. این ۶ ویژگی قابل ردیابی، به عنوان بنچمارک یا محک ثبات مدلها در نظر گرفته شدند.
هزینه دسترسی به این ابزارها به شدت متفاوت است. PixAI از طریق یک سیستم «چک-این» روزانه ۱۰,۰۰۰ اعتبار رایگان در اختیار کاربر قرار میدهد. هر تصویر با رزولوشن 2K که با مدل Tsubaki.3 تولید شود، بین ۴,۰۰۰ تا ۴,۴۰۰ اعتبار هزینه دارد؛ این یعنی کاربران رایگان محدود به تولید تقریباً دو یا سه تصویر باکیفیت در روز هستند.
در مقابل، Tensor.Art بودجه روزانه بسیار محدودتری (۱۰۰ اعتبار) ارائه میدهد، هرچند مستندات این پلتفرم متناقض است و در برخی صفحات عدد ۵۰ اعتبار ذکر شده است. از آنجایی که هزینه اکثر تولیدات بیش از یک اعتبار است، بودجه تکرار و اصلاح (Iteration) در این پلتفرم به طور قابل توجهی narrower یا محدودتر از PixAI است.
مسیر ورود و انتخاب مدل
شروع کار در این دو پلتفرم نیازمند دو طرز فکر متفاوت است. در PixAI مسیر خطی و ساده است: شما مستقیماً به سراغ مدل Tsubaki.3 میروید. ساختار پرامپتها در اینجا از «زبان طبیعی» پیروی میکند؛ به این معنا که شما شخصیت را همانطور که برای یک انسان توصیف میکنید، برای هوش مصنوعی شرح میدهید.
اما در Tensor.Art، اولین تصمیم، سرنوشتسازترین تصمیم است. کتابخانه Anime Lab یکی از بزرگترین منابع در دسترس کاربران رایگان است، اما همین موضوع باعث ایجاد «پارادوکس انتخاب» میشود. کاربر باید بین صدها گزینه در معماریهای مختلف پیمایش کند، از جمله:
- SDXL: مدلهای پایه با رزولوشن بالا.
- Pony: مدلهایی که برای زیباییشناسی خاص و تخصصی انیمه بهینه شدهاند.
- Flux: معماری جدیدتر برای دستیابی به دقت و وفاداری بصری (Fidelity) بالاتر.
این مدلها طیفی از سبکها، از تصویرسازیهای نرم تا «سل-شیدینگ» (Cel-shading) تیز و مشخص را پوشش میدهند و هر کدام قراردادهای برچسبگذاری (Tagging) متفاوتی میطلبند. برای این تست، مدلی انتخاب شد که بر تصویرسازی انیمه با خطوط تعریفشده تمرکز داشت. یک هشدار حیاتی برای کاربران: تغییر مدل در میانه پروژه به معنای یادگیری مجدد تمام تنظیمات از نقطه صفر است.

آزمون اول: تطبیق با دستورات
اولین تسک، خلق یک صحنه پیچیده بود: شخصیت پشت یک غرفه جشنواره در شب، در حالی که فانوسی را به سمت مشتری میگیرد و تنها ساعد مشتری در کادر دیده میشود. این تست ۷ نیاز بصری و مکانی همزمان را به چالش میکشید.
پرامپت Tsubaki.3 بسیار مفصل بود: «زنی جوان در اواخر دهه ۲۰ سالگی با موهای سرمهای تیره کوتاه تا خط فک، چتری صاف، چشمهای طلایی با بازتاب نور، پوشیده در یک ژاکت قرمز کوتاه روی لباس سفید یقه بلند، آویز یشم کوچک با بند نازک. او پشت پیشخوان یک غرفه جشنواره در شب ایستاده است، دست چپش به صورت تخت روی سطح چوبی پیشخوان قرار دارد و دست راستش یک فانوس کاغذی کوچک و درخشان را به سمت مشتری میگیرد. تنها ساعد مشتری از لبه راست کادر وارد شده است. تزیینات قرمز کاغذی جشنواره در پسزمینه محو شدهاند. نور فانوس صورت او را از پایین گرم میکند و در لبههای کادر سایههای عمیقی وجود دارد. حالت چهره او کاری و کمی خسته است. سبک تصویرسازی انیمه، رزولوشن 2K.»
Tsubaki.3 در اولین تلاش، معماری صحنه را به طور کامل پیاده کرد. پیشخوان در جای درست بود و دست چپ او دقیقاً طبق دستور با انگشتان باز روی چوب قرار داشت. ژاکت قرمز روی لباس سفید یقه بلند به صورت تمیز اجرا شد و آویز یشم به عنوان یک شکل سبز در خط گردن کاملاً مشهود بود. این مدل ۶ مورد از ۶ ویژگی ردیابی را درست اجرا کرد. تنها نقص، حالت چهره بود؛ او بهجای «کاری-خسته»، «متین و محتاط» به نظر میرسید.
در مقابل، Tensor.Art نیازمند تطبیق با پرامپتهای برچسبگونه (Tag-style) برای مدل SDXL بود. با اینکه اتمسفر بسیار قوی بود — شامل فانوسهای رشتهای گرم، بنرهای قرمز و بازاری شبانه با انرژی واقعی جمعیت — اما منطق مکانی شکست خورد. دستهای شخصیت بهجای روی پیشخوان، در کنار بدنش بود. فانوس با یک اثر کریستالی درخشان و توجیهناپذیر در پایین کادر جایگزین شد. علاوه بر این، بهجای یک ساعد تک، چندین فیگور کامل در پسزمینه ظاهر شدند. این مدل تنها ۳ مورد از ۶ ویژگی کلیدی را درست اجرا کرد.

تست برگه حالات (Expression Sheet)
برای تست داراییهای ساختاریافته، شخصیت در ۵ حالت احساسی قرار گرفت: متانت خنثی، عصبانیت آشکار، غافلگیری محتاطانه، گرمی واقعی و تمرکز. این یک تست حیاتی برای هر هنرمندی است که به یک برگه مرجع (Reference Sheet) نیاز دارد.
PixAI از یک گردش کار مبتنی بر ویرایش (Edit-based) استفاده کرد؛ یعنی هر حالت احساسی را بر اساس یک تصویر پایه ساخت، نه اینکه ۵ تصویر جداگانه را از صفر تولید کند. این روش باعث شد بنیاد تصویر ثابت بماند: مدل موی کوتاه تا فک، چتری و آویز یشم در ۴ پنل از ۵ پنل کاملاً ثابت ماندند. حالات چهره واقعاً متمایز بودند و برگه نهایی را به یک دارایی مرجع کاربردی تبدیل کرد. اگرچه یک پنل نیاز به اصلاح جزئی در فرم صورت داشت، اما هر ۵ پنل نقاط شروع مناسبی بودند.
Tensor.Art از مدل Wan2.7-Image استفاده کرد که از حداکثر ۹ ورودی مرجع برای ثبات شخصیت پشتیبانی میکند. با تغذیه یک تصویر مرجع، ۴ پنل از ۵ پنل توانستند موهای تیره، چشمهای طلایی، ژاکت قرمز و آویز یشم را حفظ کنند. با این حال، در پنل پنجم، چهره کاملاً از کادر خارج شد. همچنین همان اثر کریستالی درخشان از تست اول دوباره ظاهر شد. بهدلیل بودجه محدود ۱۰۰ اعتباری روزانه، تکرار برای رفع این خطاها بسیار هزینهبر و دشوار است.


ویرایش متوالی در استودیو
آخرین تست شامل دو ویرایش متوالی روی صحنه اصلی بازار شب بود. این فرآیند بررسی میکرد که آیا هوش مصنوعی میتواند روی نتیجه قبلی بسازد یا هر بار تصویر را ریست میکند.
PixAI Studio مانند یک فضای کاری یکپارچه عمل میکند که توالی ویرایشها را سازماندهی میکند. در ویرایش اول، نورپردازی از اولویت فانوس به یک چراغ خیابان سردتر در بالای سر تغییر یافت. نتیجه بینقص بود: درخشش گرم روی صورت حذف شد، اما موهای سرمهای، ژاکت، موقعیت دستها و فیگور مشتری کاملاً ثابت ماندند.
در ویرایش دوم، حالت چهره به «غافلگیر» (در حد بازنگری، نه وحشتزده) تغییر کرد. جهت چشمها ثابت ماند، در حالی که دهان و ابروها کمی تغییر کردند. تحسینبرانگیزترین بخش این بود که این تغییر روی نتیجه ویرایش اول اعمال شد، نه روی تصویر پایه. تنها انحراف این بود که شکل آویز یشم کمی پرتر شد.

Tensor.Art فاقد یک فضای کاری یکپارچه است و کاربر مجبور است به صورت دستی بین ابزارهای Smart Edit و Inpainting (ترمیم تصویر) جابهجا شود. در حالی که تغییر نورپردازی از نظر جهتدهی درست بود و یک شستوشوی آبی سرد ایجاد کرد، اما یک «درز» (Seam) بصری در محل اتصال ناحیه ترمیمشده به کادر اصلی باقی گذاشت. المان درخشان روی پیشخوان نیز کمی از ترکیببندی جدا به نظر میرسید.

ویرایش حالت چهره نیازمند Inpainting دقیق ناحیه صورت بود. مدل در اینجا بیش از حد واکنش نشان داد (Overcorrected) و چهرهای با دهان باز از شدت شوک، دندانهای نمایان و چشمهای گشاد تولید کرد. شخصیت بهجای متفکر بودن، «وحشتزده» به نظر میرسید. در حالی که هویت و جهت چشمها حفظ شده بود، اما ظرافتهای احساسی از دست رفت. درز بصری در اینجا حتی مشهودتر بود، زیرا ناحیه صورت با موها و یقه ژاکت هممرز است.

تلاش عملی و دسترسی
هنگام انتخاب بین این دو پلتفرم، هزینه «پنهان»، همان تلاش دستی است که برای رسیدن به نتیجه نهایی لازم است.
- PixAI: ابزار Inpainting در سطح رایگان در دسترس است. اگرچه قابلیت «Reference Pro» نیازمند اشتراک پولی است، اما مدل Tsubaki.3 بخش بزرگی از ثبات را از طریق زبان طبیعی و فضای استودیو مدیریت میکند.
- Tensor.Art: دسترسی به Anime Lab و مدلهای جامعه رایگان است، اما بودجه اعتباری روزانه (۵۰-۱۰۰ اعتبار) محدودکننده اصلی است. هیچ سیستم جمعآوری اعتبار غیرفعالی مانند چک-این PixAI در اینجا وجود ندارد.
حکم نهایی درباره گردش کار
گردش کار مبتنی بر زبان طبیعی در PixAI به طور قابل توجهی شهودیتر است. این سیستم به کاربران اجازه میدهد صحنه را همانطور که برای یک انسان توصیف میکنند شرح دهند، بهجای اینکه تودههایی از کلمات کلیدی با وزنهای مختلف بسازند. این امر بار شناختی سازنده را کاهش میدهد.
قدرت Tensor.Art در کتابخانه عظیم آن نهفته است. اگر به یک سبک بصری بسیار خاص — از تصویرسازی نرم تا سل-شیدینگ — نیاز دارید، احتمالاً Anime Lab مدلی برای آن دارد. با این حال، ثبات در این پلتفرم بهجای توصیف ساده، از طریق تنظیمات مرجع و جابهجایی دستی بین ابزارها به دست میآید.
در نهایت، شکاف در ثبات شخصیت، عامل تعیینکننده است. Tsubaki.3 مسیری قابلاعتماد از یک ایده واحد به یک پروژه چندصحنهای فراهم میکند بدون اینکه نیاز به اصلاحات دستی مداوم باشد.
برای کاربر عادی، انتخاب ساده است: از Tensor.Art برای تکتصویرهای با استایل بالا استفاده کنید. اگر در حال ساخت شخصیتی هستید که قصد دارید در کل یک داستان از او استفاده کنید، PixAI را انتخاب کنید. این تغییر نشان میدهد که صنعت در حال حرکت از «مهندسی پرامپت» به سمت «مدیریت شخصیت» است. ارزش دیگر در یک تصویر واحد نیست، بلکه در تداوم دارایی دیجیتال در طول یک گردش کار است.
گام بعدی شما
- اگر روی یک رمان تصویری یا کمیک کار میکنید، مدل Tsubaki.3 را برای تست ثبات شخصیتهایتان امتحان کنید.
- در Tensor.Art بهجای تکیه بر پرامپت، از قابلیت ورودیهای مرجع (Reference Inputs) برای کاهش تغییرات چهره استفاده کنید.
- برای کاهش هزینههای استنتاج، ابتدا طرحبندی صحنه را با مدلهای ارزانتر انجام دهید و در مرحله نهایی از مدلهای باکیفیتتر استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو