تصور کنید تنها با نوشتن یک پاراگراف متن، یک انیمیشن سهبعدی کامل با دوربینهای متحرک و صداهای محیطی ساخته شود. در این سناریو، Claude Code دیگر فقط یک دستیار کدنویسی نیست، بلکه در نقش کارگردان، تمام ابزارهای تخصصی تولید فیلم را مدیریت میکند. او دیگر صرفاً یک نویسنده فیلمنامه نیست، بلکه کسی است که کل خط لوله (Pipeline) تولید را هدایت میکند.
به گزارش Maneshwar، توسعهدهنده این پروژه، مشکل اصلی مدلهای زبانی در انیمیشن، عدم درک «بیومکانیک» یا همان قوانین فیزیکی حرکت بدن است. او برای حل این چالش، یک پشته (Stack) ماژولار طراحی کرده که در آن هوش مصنوعی زاینده (Generative AI) — شبیه به یک مدیر پروژه که دستورات را توزیع میکند اما خودش پیچ و مهرهها را نمیبندد — از بیومکانیک انیمیشن (جایی که AI معمولاً شکست میخورد) فاصله گرفته و در عوض برای هماهنگی ابزارهای تخصصی حرکت، صدا و رندرینگ به کار میرود. این سیستم روی شخصیتی بر اساس مایلز مورالس تست شده و توانسته صحنههای پیچیدهای مثل تاب خوردن با تار، کشیدن یک برد توسعه (DEV board) به داخل کادر و اجرای «مونواک» به اندازه ۶.۵ متر روی یک بیلبورد را اجرا کند.
همانطور که در تحلیلهای قبلی ما دربارهی عاملهای هوش مصنوعی اشاره کردیم، قدرت واقعی این ابزارها در توانایی آنها برای استفاده از ابزارهای خارجی است، نه فقط تولید متن. این رویکرد در حالی مطرح میشود که صنعت ویدیوهای مولد با مشکل «دره وهم» (Uncanny Valley) دستوپنجه نرم میکند؛ جایی که مدلهای ویدیویی زاینده پیکسلها را خلق میکنند اما اغلب فاقد ثبات ساختاری هستند. این تفاوت بنیادین بین تولید مستقیم پیکسل و استفاده از کدهای قطعی برای رندرینگ، در تحلیل ما پیرامون مدلهای ویدیو و کدهای انیمیشن به تفصیل بررسی شده است. Maneshwar با تکیه بر آزمایشات قبلی در زمینه برنامهنویسی جفتی (Pair Programming) برای صحنههای سهبعدی، از اسناد استاتیک به سمت صحنههای دینامیک حرکت کرده است. او یک فیلم را به جای یک «تخیل خلاقانه»، به عنوان یک «محصول نرمافزاری» (Build Artifact) میبیند. هدف این است که از حالت «کلود به من در بلندر کمک میکند» به حالتی برسیم که «کلود کل تولید را کارگردانی میکند».
معماری یک کارگردان
فلسفه اصلی این سیستم، تفکیک شدید وظایف است: اگر کاری به حرکت انسانی نیاز دارد، سیستم آن را بازیابی (Fetch) میکند و اگر به ساختار نیاز دارد، مدل زبانی آن را مینویسد. طبق مستندات این پروژه، Claude در نوشتن کدهای bpy (پایتون برای بلندر)، لینک کردن مجدد بافتها (Textures) و ترتیببندی کلیپها عالی است اما در تخیل نحوه فرود یک انسان پس از پرش، کاملاً ناتوان است؛ زیرا او یک «منبع وحشتناک برای بیومکانیک» است. این حرکات باید از یک بازیگر واقعی در لباس Mocap تأمین شوند.
فرآیند با یک «مهارت کارگردانی» (Director Skill) شروع میشود که پرامپت کاربر را به یک لیست شات ساختاریافته در قالب YAML تبدیل میکند. این برنامه دادهمحور باعث میشود مدل مجبور نباشد کل فیلم را همزمان در حافظه نگه دارد و هر شات را به عنوان یک شغل مستقل در یک خط لوله CI/CD در نظر میگیرد. این فایل YAML شامل شناسههای خاص، مدتزمان، نام صحنهها، حرکات دوربین، کلیپهای حرکتی و پرامپتهای صوتی است. برای مثال، یک شات میتواند با یک دوربین تعقیبی (Tracking)، یک کلیپ حرکتی «پرش به پایین» با سرعت ۱.۲ و افکتهای صوتی (SFX) خاصی مانند «صدای خشخش لباس» و «برخورد شدید به بتن» تعریف شود.
لایه ۱: پل ارتباطی با Blender
برای تعامل با Blender، این پشته از یک سرور پروتکل زمینهٔ مدل (MCP) استفاده میکند. Maneshwar چهار گزینه اصلی را ارزیابی کرد:
- mcp-for-blender (با حدود ۳۰.۲ هزار ستاره): که پیشتر blender-mcp نام داشت. این ابزار برای اجرای کد، گرفتن اسکرینشات از Viewport و ادغام داخلی با سرویسهایی مثل Poly Haven, Sketchfab, Poly Pizza, Hyper3D Rodin, Hunyuan3D و Tripo استفاده میشود. نصب آن از طریق دستور
claude mcp add blender uvx mcp-for-blenderانجام میشود. - Official Blender MCP (توسط Blender Lab): بهترین گزینه برای درک صحنههای پیچیده، توضیح تنظیمات نودها (Node Setups) و پاکسازی است. این ابزار بیشتر برای «باستانشناسی» صحنه طراحی شده تا تولید فیلم و به بلندر نسخه ۵.۱ یا جدیدتر نیاز دارد.
- carlosh7/blender-mcp (۸ ستاره): سروری بسیار مفصل با ۲۴۸ ابزار در ۱۴ دستهبندی، ۳۷۱ کامیت و ۴۷۹ تست موفق تحت لایسنس MIT.
- claude-blender (۵ ستاره): دارای قابلیت نقاط بازرسی (Undo Checkpoints)، قاببندی خودکار دوربین و تولید محلی TripoSR/Shap-E.
او استدلال میکند که تعداد زیاد ابزار لزوماً یک ویژگی مثبت نیست. هر ابزار یک طرحواره (Schema) به پنجره متنی (Context Window) اضافه میکند و گزینههای زیاد، احتمال انتخاب ابزار اشتباه توسط مدل را افزایش میدهد. در عوض، یک ابزار واحد برای اجرای کد (execute_blender_code) برتر است زیرا مدل میتواند هر کد پایتون (bpy) لازم را مستقیماً بنویسد. برای جلوگیری از خطاهای فاجعهبار، سیستم از کامیتهای Git به عنوان نقاط بازرسی قبل از ویرایشهای ریسکی استفاده میکند، زیرا MCP رسمی هشدار میدهد که کدهای تولید شده توسط LLM بدون حفاظ اجرا میشوند و پیشنهاد میکند از یک ماشین مجازی (VM) یا سیستمی بدون دادههای حساس استفاده شود.
لایه ۲: سینماتوگرافی به مثابه مهارت
به جای اینکه از Claude بخواهند «یک شات جذاب بساز»، سیستم از «مهارتها» (Skills) استفاده میکند. اینها پوشههایی در مسیر .claude/skills/ هستند که شامل یک فایل توصیفی SKILL.md و اسکریپتهای خاص هستند. او این روش را «وارد کردن تنبلانه پرامپتها» (Lazy import of prompting) مینامد. این سیستم از blender-skills (حدود ۱۴۳ ستاره) الهام گرفته است که مجموعهای از ابزارها برای شاتهای محصول و Retargeting در Mixamo ارائه میدهد. این رویکرد در واقع پیادهسازی عملی مهندسی دانش در کلود است که در آن اسکریپتهای قطعی جایگزین پرامپتهای شکننده میشوند تا خروجیها قابل پیشبینیتر باشند.
این کار یک واژگان سینمایی ایجاد میکند که شامل موارد زیر است:
- حرکات دوربین:
establishing_wide(نمای باز)،push_in(زوم به جلو)،pull_out(عقب رفتن)،orbit(چرخش)،crane_up(بالا رفتن جرثقیل)،tracking(تعقیبی)،over_the_shoulder(از روی شانه) وhandheld_shake(لرزش دست). - پیشتنظیمات نورپردازی:
rainy_night(شب بارانی)،golden_hour(ساعت طلایی)،villain_red(قرمز شرورانه)،neon_street(خیابان نئونی) وsoft_closeup_key(نور کل نرم برای نمای نزدیک).
با فراخوانی این مهارتهای تستشده، کارگردان کیفیت بصری ثابت را تضمین میکند. پرامپتی مثل «با نمای باز شروع کن، او را تا لبه لبه تعقیب کن و به آرامی زوم کن» به سه فراخوانی مهارت با اعداد تبدیل میشود، نه یک تمرین نویسندگی خلاقانه. این کار مانع از آن میشود که مدل مجبور شود در ساعت ۲ صبح دوباره یاد بگیرد نورپردازی سهنقطهای چیست تا لباس شخصیت به یک لکه سیاه تبدیل نشود.
لایه ۳: بازیابی حرکات انسانی
برای جلوگیری از شکست «معنوی» انسانهای کیفریمشده توسط AI — که فاقد تغییرات وزنی و overshoot (عبور از نقطه هدف) هستند — این پشته دادههای واقعی ضبط حرکت (Mocap) را بازیابی میکند. سلسلهمراتب منابع عبارت است از:
- Mixamo: رایگان، با قابلیت ریگبندی خودکار شخصیتهای T-posed از روی پنج مارکر. Maneshwar برای تستهای اولیه ۷۸ کلیپ را به صورت دستی دانلود کرد.
- CMU Motion Capture Database: حدود ۲۵۰۰ کلیپ رایگان با یک آینه BVH در گیتهاب (حدود ۲۰۳ ستاره) که نیاز به یک Retargeter دارد.
- Rokoko: ارائه یک افزونه رایگان بلندر برای Retargeting و ابزار Rokoko Vision که به کاربر اجازه میدهد حرکات سفارشی را از طریق وبکم اجرا کند.
برای دقت فنی، این پشته از Auto-Rig Pro ساخته شرکت Artell (یک ابزار حرفهای ۵۰ دلاری که در بازیهایی مثل Manor Lords استفاده شده) برای مدیریت ریگبندی، Retargeting و ریگهای صورت استفاده میکند. برای جایگزین رایگان، Mixamo Rig (افزونه GPL) میتواند یک ریگ کنترل IK روی اسکلت Mixamo بسازد تا از فرو رفتن شخصیتها در زمین مانند روح، هنگام حرکت لگن، جلوگیری شود.
لایه ۴: حل مشکل نماهای نزدیک (Close-Up)
انیمیشن صورت توسط Rhubarb Lip Sync (حدود ۲.۶ هزار ستاره) مدیریت میشود؛ یک ابزار خط فرمان که صوت را به شکلهای دهان تبدیل میکند. این ابزار از ۹ شکل (A تا H به علاوه X برای حالت استراحت) استفاده میکند که همان مجموعهای است که استودیوهای کلاسیک کارتونی به کار میبردند. سیستم از یک اسکریپت پایتون برای نگاشت خروجی JSON ابزار Rhubarb به Shape Keyهای بلندر استفاده میکند و با درونیابی Bezier تضمین میکند که دهان به جای پرش، به نرمی حرکت کند.
برای حذف اثر «مجسمه مومی»، خط لوله موارد زیر را اضافه میکند:
- پلکزدنهای رویهای: به صورت تصادفی هر ۲ تا ۶ ثانیه یکبار.
- پرشهای چشمی (Eye Darts): لرزشهای بسیار کوچک به سمت اشیایی که شخصیت به آنها واکنش نشان میدهد.
این موضوع یک وابستگی حیاتی ایجاد میکند: ضبط صدا باید در پیشتولید انجام شود، زیرا همگامسازی لبها (Lip Sync) نیاز دارد که صوت قبل از ساخت انیمیشن وجود داشته باشد. اگر مدل به جای Shape Keyها از استخوانهای صورت استفاده کند (مانند ریگ صورت ۱۴۳ استخوانی در مدل مایلز)، همان حلقه به جای Shape Keyها، استخوانها را تغییر میدهد.
لایه ۵: تأمین داراییهای سهبعدی (Assets)
داراییها از Poly Haven (بافتها و HDRIهای CC0) و Sketchfab تأمین میشوند. برای اشیای خاص، سیستم از مدلهای تبدیل تصویر به سهبعد استفاده میکند:
- Hunyuan3D-2 (حدود ۱۵ هزار ستاره) و Hunyuan3D-2.1 (حدود ۴.۱ هزار ستاره): محصول تنسنت که نسخه دوم آن متریالهای PBR را اضافه کرده است. اینها میتوانند به صورت محلی روی GPU اجرا شوند، هرچند نویسنده اشاره میکند که کارت گرافیک ۴ گیگابایتی GTX 1650 او محدودیت دارد.
- TripoSR (حدود ۷ هزار ستاره): بازسازی سریع از یک تصویر واحد.
- گزینههای میزبانی شده: Hyper3D Rodin و Tripo که در
mcp-for-blenderادغام شدهاند.
با این حال، نویسنده هشدار میدهد که مشهای تولید شده اغلب «سوپ مثلثی» (Triangle Soup) هستند — خوشههای متراکمی از مثلثها که مانند «مقوای خیس» تغییر شکل میدهند. در نتیجه، داراییهای تولید شده برای اشیای پسزمینه (مانند یک صندوق پستی) استفاده میشوند، در حالی که داراییهای اصلی (Hero Assets) برای تضمین Edge Loopهای تمیز در اطراف آرنجها و زانوها جهت خم شدن درست، به صورت دستی ساخته یا تأمین میشوند.
لایه ۶: صدای برنامهریزیشده
صدا به عنوان لایههای مجزا (Stems) در نظر گرفته میشود تا ویرایش برنامهریزیشده از طریق FFmpeg امکانپذیر باشد. این پشته از موارد زیر استفاده میکند:
- ElevenLabs: برای دیالوگهای شخصیت (که ابتدا برای صورت تولید میشود) و SFX (تا ۳۰ ثانیه در هر تولید، شامل حالت حلقه بدون درز برای صدای باران یا همهمه شهر با کیفیت ۴۸ کیلوهرتز WAV).
- stable-audio-tools (حدود ۳.۹ هزار ستاره): کد باز Stability برای تولید موسیقی محلی.
این جداسازی اجازه میدهد «فشردهسازی سایدچین» (Sidechain Compression) اجرا شود؛ جایی که موسیقی به طور خودکار هنگام صحبت کردن شخصیت کاهش مییابد. این کار توسط فیلتر sidechaincompress در FFmpeg انجام میشود که از لایه دیالوگ به عنوان کلید برای پایین کشیدن لایه موسیقی استفاده میکند. این امر با استفاده از فیلتر asplit برای ایجاد یک کپی از دیالوگ برای کلید و فیلتر amix با normalize=0 برای جلوگیری از کاهش خودکار صدای کلی محقق میشود.
لایه ۷: رندرینگ بدون رابط کاربری (Headless) و مونتاژ
رندرینگ مانند یک Build نرمافزاری در نظر گرفته میشود و سیستم از سه قانون سختگیرانه پیروی میکند:
۱. رندر Headless: استفاده از blender -b تا رندرینگ یک دستور باشد، نه یک فرآیند دستی.
۲. رندر توالی فریم: خروجی PNG به جای MP4. اگر در فریم ۱۴۰۰ کرشی رخ دهد، تنها یک فریم از دست میرود نه کل فیلم.
۳. پیشنویس ۳۶۰p: استفاده از حالت --fast که Ray Tracing, Motion Blur و نمونههای اضافی را غیرفعال میکند تا زمان رندر هر فریم نصف شود.
در نهایت، FFmpeg (حدود ۶۴.۹ هزار ستاره) فریمها و لایههای صوتی را با استفاده از فلگ -pix_fmt yuv420p به یک فایل MP4 نهایی تبدیل میکند تا سازگاری با تمام پخشکنندههای ویدیو تضمین شود. پاس رنگ نهایی و تیتراژها همچنان در DaVinci Resolve برای نتایج حرفهای انجام میشود.
لایه ۸: حلقه بازبینی دوگانه
برای شناسایی باگهای حرکتی که تصاویر ثابت از دست میدهند — مانند یک «پرش» ۲۲ سانتیمتری در هنگام Crossfade، تک فریمهایی که شخصیت در محل برش (Cut) معلق است، یا استایشی که عریضتر از لبه لبه است — سیستم از دو بازبین استفاده میکند:
۱. چشمها: Claude یک ورقهی تماس (Contact Sheet) از فریمهای پیشنویس را بررسی میکند تا کادربندی، نور، مود و خوانایی را بسنجد.
۲. تأییدات (Asserts): اسکریپتهایی که تماس پا با زمین، محدوده حرکت و تداوم در برشها را اندازه میگیرند. اگر یک تأیید شکست بخورد، شات با صدای بلند رد میشود، پیش از آنکه هرگز توسط انسان دیده شود.
تحلیل: تغییر به سمت «CI برای فیلمها»
این معماری نشاندهنده یک تغییر بنیادین در خلق محتوای AI است. با حرکت از حالت «زاینده» (خواستن از AI برای تصور یک ویدیو) به حالت «هماهنگکننده» (خواستن از AI برای مدیریت یک خط لوله حرفهای)، نتیجه یک محصول قابل پیشبینی و قابل ویرایش است. «کارگردان» در اینجا صرفاً یک مدیر پیکربندی (Configuration Manager) برای مجموعهای از ابزارهای تخصصی و غیر-AI است.
ترتیب ساخت Maneshwar بر وابستگیها تأکید دارد: ابتدا پل ارتباطی و مهارتها، سپس کتابخانه حرکتی، به دنبال آن لایههای صوتی، صورت، تأییدات و در نهایت مهارت کارگردانی. این رویکرد ترکیبی، مشکل قابلیت اطمینان LLMها را حل میکند در حالی که انعطافپذیری خلاقانه آنها را حفظ میکند و فیلمسازی را به یک مسئله مهندسی نرمافزار تبدیل میکند.
گام بعدی شما
- اگر با بلندر کار میکنید، سرور mcp-for-blender را نصب کنید تا بتوانید با Claude کد بزنید.
- برای انیمیشنهای سریع، از کتابخانه Mixamo برای دریافت حرکات انسانی واقعی استفاده کنید.
- برای بهبود کیفیت صدا، فیلترهای FFmpeg را برای مدیریت لایههای صوتی یاد بگیرید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو