یک نمای ویدیو که با حرکت دوربین از هم نمیپاشد، برای یک تدوینگر حرفهای بسیار ارزشمندتر از یک کلیپ «زیبا» است. پر کردن این شکاف پرمخاطره میان زیبایی بصری و کاربرد عملی، هدف اصلی بایتدنس (ByteDance) در توسعه نسل بعدی مدل ویدیویی خود، یعنی Seedance 3 است.
تا ۲۲ سپتامبر ۲۰۲۶، بایتدنس هنوز بهطور رسمی Seedance 3 را معرفی نکرده است. در حال حاضر، پیشرفتهترین مدل موجود در دایرکتوری عمومی آنها Seedance 2.5 است؛ مدلی که همین حالا هم مرزهای طول کلیپهای بومی را جابهجا کرده است. برای درک مسیر این خانواده از مدلها، باید به تکامل سریع آنها نگاه کنیم؛ مسیری که از کلیپهای ساده ۱۰۸۰p به یک سامانه کارگردانی چندوجهی (Multimodal) تبدیل شده است.
تفاوت میان یک فیلم خانگی و یک تولید استودیویی را تصور کنید. ویدیوهای اولیه هوش مصنوعی شبیه فیلمهای خانگی بودند؛ تأثیرگذار اما تصادفی. بایتدنس اکنون تلاش میکند با تبدیل تولید ویدیو به یک جریان کاری ساختاریافته، به جای تکیه بر رویکرد «پرامپت بنویس و دعا کن»، یک استودیوی واقعی بسازد. این رویکرد در راستای استراتژی گستردهتر این شرکت برای بهینهسازی هزینههای تولید است، مشابه آنچه در عرضه ابزار Dramagic برای کاهش هزینههای تولید ویدیو شاهد بودیم.
همانطور که در تحلیلهای قبلی ما دربارهی مدلهای مولد ویدیو اشاره کردیم، چالش اصلی صنعت اکنون عبور از «تولید تصادفی» به «کنترل دقیق» است.
تکامل نقشه راه Seedance
بر اساس مستندات فنی، روند پیشرفت خانواده Seedance نشاندهنده یک الگوی روشن از گسترش «واحد خلق» است. این مدلها از یک کلیپ بصری منسجم به یک سامانه کارگردانی پیچیده و سپس به یک جریان کاری خلاقانه بلندتر و قابل ویرایشتر تکامل یافتهاند:
- Seedance 1.0: پایه را با تولید بومی متن-به-ویدیو و تصویر-به-ویدیو در کیفیت ۱۰۸۰p بنا کرد. تمرکز اصلی این نسخه بر استنتاج (Inference) سریع و انسجام بصری اولیه بود.
- Seedance 1.5 Pro: تولید بومی صدا را معرفی کرد و تمرکز را به سمت روایتهای صوتی-تصویری در سطح سینمایی تغییر داد.
- Seedance 2.0: به یک معماری یکپارچه صوت-ویدیو منتقل شد. این معماری به مدل اجازه داد تا متن، تصاویر، کلیپهای ویدیویی و ارجاعات صوتی را بهطور همزمان تفسیر کند و امکان ادامه دادن سکانسها و ویرایش آنها را فراهم آورد.
- Seedance 2.5: مدتزمان تولید تکمرحلهای را به ۳۰ ثانیه رساند (دو برابر نسخه قبلی) و ظرفیت ارجاعات را به ۵۰ دارایی افزایش داد. همچنین ویرایش در سطح برچسب زمانی (Timestamp) و انتقالهای نرمتر میان برشها (Cuts) را معرفی کرد.

قابلیتهای مورد انتظار از Seedance 3
به دلیل نبود مشخصات رسمی، تحلیلگران صنعت بر اساس خط پایه Seedance 2.5 پیشبینی میکنند که هدف نسل سوم، نه لزوماً اعداد خیرهکننده در تیتر اخبار مثل رزولوشن 4K، بلکه «قابلیت اطمینان» در جریان کاری خلاقانه است.
حالت صحنه پایدار (Persistent Scene State)
در Seedance 2.5، مدل میتواند کلیپهای ۳۰ ثانیهای تولید کند و آنها را در چندین دور گسترش دهد، اما حفظ انسجام در فرمهای بلند همچنان یک چالش است. جهش واقعی برای Seedance 3، ایجاد «حالت پایدار» است؛ یعنی توانایی هوش مصنوعی در به یاد داشتن اینکه یک شخصیت چه شیء خاصی در دست دارد، در کجا قرار دارد، لباسش چگونه تغییر کرده و یک اتفاق در نمای اول چگونه باید بر نمای بعدی در میان چندین برش تأثیر بگذارد. این قابلیت، حجم کارهای اصلاحی را که سازندگان در حال حاضر پس از تولید یک سکانس بصری زیبا اما از نظر داخلی متناقض انجام میدهند، بهشدت کاهش میدهد.
فیزیک پیچیده و تعاملات
طبق خلاصه فنی بایتدنس برای Seedance 2.5، فیزیک حرکات پیچیده و تعامل میان چندین سوژه هنوز از زمینههای قابل بهبود هستند. این موارد شامل نحوه «غیرطبیعی» برخورد دست انسان با اشیا، برخورد مایعات، رفتار پارچهها، مدیریت جمعیت یا حرکات سریع دوربین در کلیپهای ورزشی است. معیار عملی برای Seedance 3، «نرخ کاربرد» (Usability Rate) خواهد بود: اینکه آیا دستها، تجهیزات، تکانه (Momentum) و صدا در طول یک سکانس کامل منطقی میمانند یا فقط در چند فریم منتخب برای نمایش (Showcase) درست هستند. یک کلیپ ورزشی زمانی موفق است که این عناصر در تمام طول نما باورپذیر باشند.
ثبات هویت و صدا
کنترل ارجاعات، رابط جدید تولید است. در حالی که Seedance 2.5 تا ۳۰ تصویر، ۱۰ ویدیو و ۱۰ کلیپ صوتی را میپذیرد، Seedance 3 احتمالاً بر «وزندهی به هویت» و انتخاب بهتر ارجاعات تمرکز خواهد کرد. این امر تضمین میکند که لوگوی یک برند، سیستم رنگی یا چهره و صدای یک بازیگر خاص با تغییر زاویه دوربین «دچار تغییر یا رانش» (Drift) نشود. این یعنی یک شخصیت تکرار شونده بدون نیاز به بازسازی مجموعه ارجاعات برای هر کلیپ، ثابت میماند. برای صنعت تبلیغات، این به معنای آن است که یک بستهبندی محصول و یک سخنگو میتوانند بدون تغییر شکل، از تغییرات زاویه دوربین جان سالم به در ببرند.

ویرایش موضعی قطعی (Deterministic Localized Editing)
تولید تنها نیمی از نبرد است. تدوینگران نیاز دارند یک حالت چهره یا یک خط دیالوگ را تغییر دهند بدون اینکه کل سکانس دوباره تولید شود. انتظار میرود Seedance 3 به سمت تغییرات در سطح ناحیه (Region-level) حرکت کند که پیکسلها و حرکات خارج از ناحیه ویرایش را حفظ میکند. این قابلیت میتواند شامل بازبینیهای «فقط صوتی» یا «فقط حرکتی» و یک تاریخچه ویرایش گفتگو-محور برای اصلاح نتایج در چندین مرحله باشد. ارجاعات با نسخه پایدار، هویت تأیید شده شخصیت یا محصول را در طول این ویرایشها حفظ میکنند.
کنترل حرفهای صحنه
نسخههای آینده ممکن است اجازه دهند پانلهای استوریبورد، چیدمانهای اولیه سهبعدی (Rough 3D Layouts)، لیست نماها (Shot Lists) و نشانههای صوتی به عنوان یک دستور کارگردانی واحد عمل کنند. با تقویت رابطه بین پیشتجسم (Previsualization) و رندر نهایی، Seedance 3 میتواند به کارگردان اجازه دهد حس لنز خاص، جایگاه دقیق بازیگر (Actor Mark) یا تنظیمات نورپردازی را با نتایج تکرارپذیر درخواست کند. تیمهای تولید، این تکرارپذیری را بر یک کلیپ کوتاه زیبا اما تصادفی ترجیح میدهند.
انتظارات فنی دقیق
برای حفظ یک تحلیل دقیق، ما خطوط پایه تأییدشده را از پیشبینیها جدا میکنیم. هرگونه ادعای مربوط به رزولوشن 4K یا تولید بومی ۶۰ ثانیهای تا زمان انتشار توسط بایتدنس در وضعیت «تعییننشده» (TBD) باقی میماند.
- معماری: انتظار میرود از تولید مشترک صوت-ویدیو در نسخه ۲.۵ به یک سامانه تولید چندوجهی یکپارچه و توانمندتر تکامل یابد. (اطمینان: بالا)
- ورودیها: احتمالاً چهار حالت اصلی (متن، تصویر، ویدیو، صوت) حفظ میشوند اما استدلال مشترک (Joint Reasoning) عمیقتر میشود. (اطمینان: بالا)
- مدتزمان: انتظار میرود حداقل پایه ۳۰ ثانیهای حفظ شود؛ خروجیهای بلندتر در حال حاضر تأیید نشدهاند. (اطمینان: متوسط)
- ظرفیت ارجاع: انتظار میرود محدودیت ۵۰ دارایی (۳۰ تصویر، ۱۰ ویدیو، ۱۰ صوت) حفظ شود یا بهطور هوشمندتری مدیریت گردد. (اطمینان: متوسط)
- خروجی صوتی: انتظار زیادی برای بهبود دیالوگها، هویت صوتی و همگامسازی صدای فضایی (Spatial Sound) وجود دارد. (اطمینان: بالا)
- ابزارهای ویرایش: چرخش به سمت ویرایشهای موضعی، قابلاطمینانتر و گفتگو-محور در مقایسه با ابزارهای فعلی برچسب زمانی یا پرده سبز. (اطمینان: بالا)
- وضعیت رسمی: بهطور رسمی معرفی نشده است. (تأییدشده)
- شناسه مدل API: نامشخص (نسخه ۲.۵ از
seedance-2-5در CometAPI استفاده میکند). (تأییدشده) - قیمتگذاری و مناطق: نامشخص. (ناشناخته)
چشمانداز رقابتی
Seedance 2.5 در حال حاضر در طول کلیپ بومی (۳۰ ثانیه) و حداکثر تعداد ارجاعات، برتری قابل اندازهگیری نسبت به رقبای خود دارد. با این حال، رقابت بسیار شدید است:
- Vidu Q3: تولید انعطافپذیر ۱ تا ۱۶ ثانیهای را ارائه میدهد. این مدل خروجی بومی صوت-ویدیو دارد و از حالتهای ارجاع متن، تصویر و فریم اول/آخر پشتیبانی میکند و اولویت آن تکرار سریع است. طبق مستندات API رسمی، تا رزولوشن ۱۰۸۰p را پشتیبانی میکند.
- Kling 3.0: کلیپهای ۳ تا ۱۵ ثانیهای با خروجی بومی صوتی-بصری را پشتیبانی میکند. نقطه قوت آن در کنترل صریح استوریبورد و عناصر هویتی قابل استفاده مجدد است که از ارجاعات تصویری یا ویدیویی ساخته میشوند.
- Veo 3.1: از زیرساخت رسانهای گوگل برای رندرینگ سینمایی بهره میبرد. این مدل بر صوت بومی، گسترش ویدیو و تولید فریم-به-فریم تأکید دارد.
برای اینکه Seedance 3 یک جهش نسلی واقعی باشد، باید از تستهای ترجیح بصری فراتر رفته و «نرخ کاربرد» را افزایش دهد؛ یعنی درصد تولیدات اولین تلاش که واقعاً در یک تدوین حرفهای، بهویژه در صحنههای چند شخصیتی، قابل استفاده باشند. این نیاز به ابزارهای قدرتمند در بازارهای هدف بایتدنس، بهویژه در چین، احساس میشود؛ جایی که بیش از ۹۵٪ درامهای کوتاه اکنون با هوش مصنوعی تولید میشوند و تقاضا برای کیفیت استودیویی در سطح انبوه وجود دارد.
عملکرد در محکها: تأییدشده در برابر تأییدنشده
در حال حاضر هیچ نتیجه رسمی از بنچمارکها یا امتیاز Elo برای Seedance 3 وجود ندارد. هرگونه نموداری در این زمینه باید تأییدنشده تلقی شود. خط پایه مرتبط، Seedance 2.5 است که بایتدنس آن را از طریق قابلیتهای تولید تعریف میکند، نه از طریق یک جدول ردهبندی استاندارد.
خط پایه Seedance 2.5 شامل موارد زیر است:
- تا ۳۰ ثانیه در یک بار تولید.
- تا دو دور گسترش (Extension).
- حداکثر ۵۰ دارایی ارجاع (۳۰ تصویر، ۱۰ ویدیو، ۱۰ کلیپ صوتی).
- ویرایش در سطح برچسب زمانی و صدای همگامسازی شده.
- انتقالهای نرمتر و ثبات قویتر سوژه در میان برشها.
معیارهای حیاتی برای Seedance 3 در زمان عرضه:
برای ارزیابی درست Seedance 3، صنعت باید دادههای مربوط به ابعاد زیر را با استفاده از پرامپتهای افشا شده و چندین Seed تصادفی بررسی کند:
- ثبات هویت در فرم بلند: پایداری چهره، بدن، لباس، محصول، ابزار و صدا در میان برشهای مختلف.
- فیزیک حرکات پیچیده: برخورد انسان با اشیا، تکانه، تصادفات، پارچه، مایعات، جمعیت و ورزش.
- پیروی از دستورات: اقدامات کدگذاری شده زمانی، ترتیب نماها، حرکات دوربین، دیالوگها و محدودیتهای منفی (Negative Constraints).
- همگامسازی صوت و تصویر: گفتار، حرکت لبها، افکتها، صدای محیط، موسیقی و زمانبندی رویدادها.
- حفظ ویرایش: چه مقدار از محتوای تأیید شده هنگام اصلاح یک ناحیه، بازه زمانی یا صدا تغییر میکند.
- کارایی تولید: زمان رسیدن به نتیجه قابل استفاده، نرخ تکرار (Retry Rate)، تأخیر (Latency) و هزینه به ازای هر ثانیه پذیرفته شده.
تحلیل: از هنر به دارایی
این تغییر نشاندهنده یک روند گستردهتر در هوش مصنوعی زاینده است: حرکت از «هنر» به «دارایی» (Asset). برای یک سازنده معمولی، این یعنی تفاوت بین یک کلیپ ویروسی و یک محصول تجاری. اگر Seedance 3 بتواند کنترل قطعی روی شخصیتها و فیزیک ایجاد کند، از یک اسباببازی به یک ابزار تولید تبدیل میشود.
برای کسبوکارها، این موضوع «نرخ تکرار» را کاهش میدهد. در حال حاضر، ویدیوهای AI نیازمند دهها تلاش برای رسیدن به یک نمای پایدار هستند. مدلی که پایداری فضایی و ویرایش موضعی را بفهمد، هزینه هر ثانیه ویدیو را بهشدت پایین میآورد.
آیا باید منتظر Seedance 3 ماند؟
از آنجا که هیچ تاریخ عرضه، قیمت یا شناسه API تأیید شدهای وجود ندارد، تصمیم به انتظار به موانع خاص شما بستگی دارد.
منتظر بمانید اگر:
- پروژه شما به فیزیک پیچیده قابل اتکا یا تعاملات متراکم بین چندین سوژه وابسته است.
- به ویرایشهای بهشدت موضعی یا داراییهای شخصیتی پایدار و قابل استفاده مجدد نیاز دارید.
- ضربالاجل زمانی ثابتی ندارید و میتوانید زمان عرضه نامعلوم، منطقه دسترسی یا قیمت نامشخص را تحمل کنید.
- مهاجرت به مدل جدید گران باشد (مثلاً نیاز به بازسازی پرامپتها، بستهبندی ارجاعات یا تأییدیههای انطباق).
همین حالا از Seedance 2.5 استفاده کنید اگر:
- به یک پایه تولیدی فعال با قابلیت تولید ۳۰ ثانیهای و صدای بومی نیاز دارید.
- تکرار و یادگیری رفتار پرامپتها و ارجاعات برای شما مهمتر از کیفیت نظری حداکثری است.
- میخواهید یک معیار از پذیرش اولیه و تأخیر ایجاد کنید تا بعداً آن را با Seedance 3 مقایسه کنید.
گامهای بعدی و دسترسی
توسعهدهندگان در حال حاضر میتوانند جریان کاری Seedance 2.5 را از طریق CometAPI و با استفاده از الگوی تولید ویدیو بهصورت ناهمگام (Asynchronous) تست کنند. این روش اجازه میدهد مدلها را بدون نیاز به بازسازی احراز هویت برای هر ارائهدهنده، با هم مقایسه کنید.
مثال درخواست (cURL):curl --request POST 'https://api.cometapi.com/v1/videos' \--header 'Authorization: Bearer YOUR_COMETAPI_KEY' \--form-string 'model=seedance-2-5' \--form-string 'prompt=A cinematic tracking shot of a paper dragon flying above a lantern-lit river at dusk.' \--form-string 'seconds=5'
شناسه مدل seedance-2-5 نباید تا زمانی که CometAPI یک صفحه مدل واقعی و شناسه پشتیبانی شده منتشر کند، به seedance-3 تغییر یابد. رفتار Endpoint و پارامترهای درخواست باید پیش از استفاده در محیط تولید با مستندات فعلی API چک شوند.
مواردی که هنوز نمیدانیم
چندین زمینه حیاتی همچنان در وضعیت TBD هستند:
- آیا «Seedance 3» نام رسمی محصول خواهد بود یا خیر.
- تاریخ عرضه، توالی انتشار و مناطق در دسترس.
- حداکثر مدتزمان بومی، رزولوشن خروجی، نرخ فریم و محدودیتهای نسبت تصویر (Aspect-ratio).
- حداکثر تعداد ارجاعات و اینکه آیا ارجاعات میتوانند به داراییهای قابل استفاده مجدد تبدیل شوند یا خیر.
- جزئیات معماری، مقیاس پارامترها، افشای دادههای آموزشی و سختافزار استنتاج.
- امتیازات رسمی بنچمارک و پروتکلهای ارزیابی پشت آنها.
- شناسههای مدل API، قیمت، مناطق در دسترس، محدودیتهای نرخ (Rate Limits) و شرایط تجاری.
- مکانیزمهای منشأ (Provenance)، واترمارکینگ، حفاظت از هویت و کنترل کپیرایت.
سخن نهایی
Seedance 3 هنوز تأیید نشده است، اما مسیر خانواده Seedance بهطور فزایندهای روشن است. این سری از تولید بصری چند-نما به صوت همگام، کنترل ارجاع چندوجهی یکپارچه، روایتهای ۳۰ ثانیهای و ویرایش هدفمند پیش رفته است. گام بزرگ بعدی باید این جریان کاری را قابلاطمینانتر کند، نه اینکه صرفاً در دموهای منتخب، خیرهکنندهتر باشد. مهمترین دلیل برتری، عملکرد تکرارپذیر خواهد بود: شخصیتها و صداهای ثابت در سکانسهای بلند، تعاملات فیزیکی باورپذیر، پاسخ دقیق به دستورات کدگذاری شده زمانی و ویرایشهایی که محتوای تأیید شده را حفظ میکنند.




گفتگو