تصور کنید یک سازنده محتوا باشد که دیگر نیازی به ترکیب جداگانهٔ صدا و تصویر در نرمافزارهای تدوین ندارد. Black Forest Labs (BFL) با عرضه مدل Flux 3 در ۲۳ ژوئیه ۲۰۲۶، این رویا را به واقعیت نزدیک کرد؛ مدلی که میتواند ویدیوهایی تا ۲۰ ثانیه با صدای بومی و هماهنگ تولید کند.
بسیاری از ابزارهای فعلی، صدا را بهعنوان یک لایه ثانویه و پس از رندر بصری اضافه میکنند. BFL معتقد است واقعیت را نمیتوان با یک حس تنها ثبت کرد. در واقع این مدل چندوجهی (Multimodal) — شبیه به انسانی که همزمان میبیند و میشنود تا محیط را درک کند — تصویر را برای ساختار فضایی و صوت را برای درک پیوندهای مکانیکی اتفاقات به کار میگیرد. همانطور که در تحلیل قبلی ما دربارهی مدلهای مولد ویدیو اشاره کردیم، چالش اصلی همواره هماهنگی دقیق زمانبندی صوت با حرکت بوده است.
طبق گزارش وبسایت the-decoder.com، ویژگیهای کلیدی Flux 3 عبارتند از:
- تبدیل متن به ویدیو، تصویر به ویدیو و ویدیو به ویدیو.
- انتقالهای مبتنی بر فریم کلیدی و دیالوگهای چندزبانه.
- پیوندهای عاملمحور (Agentic) برای خلق سکانسهای بلند و چندشاتی.
- دقت بالا در بازنمایی حالات چهره و همزمانی صدا با رویداد.

در ارزیابیهای اولیه روی کلیپهای ۱۰ ثانیهای با کیفیت 720p، Flux 3 برتری چشمگیری داشت. بر اساس مستندات منتشر شده، این مدل در ۹۳٪ موارد بر Luma Ray 3.2، در ۷۷٪ بر Runway Gen-4.5 و در ۶۹٪ بر Grok Imagine Video ترجیح داده شد. البته در برابر مدلهای سطح اول مانند Kling v3 Pro (۶۰٪ برتری) و Gemini Omni Flash (برابری ۵۲٪)، فاصله کمتر است.

از نظر فنی، این مدل از معماری Self-Flow استفاده میکند که به یک مدل واحد میآموزد همزمان محتوا را تولید و درک کند. در این ساختار، یک ترنسفورمر (Transformer) — شبیه به یک مدیر پروژه که اطلاعات مختلف را جمع کرده و به یک زبان مشترک تبدیل میکند — از رمزگذارهای اختصاصی برای تصویر، صوت و اکشن استفاده میکند.
این قابلیت «اکشن» حتی کاربردهای رباتیکی دارد. BFL با همکاری Mimic Robotics مدل Flux-mimic را ساخت که در حال حاضر در شرکت Audi برای پیشبینی و اجرای کارهای فیزیکی در خط تولید تست میشود.
برای کاربران تجاری، این تغییر یعنی تبدیل ویدیو از یک جلوه بصری ساده به ابزاری کاربردی برای شبیهسازی. وقتی مدل فیزیک صدا و حرکت را با هم بفهمد، تبدیل به موتوری برای آموزشهای صنعتی و نمونهسازیهای دقیق میشود.
BFL عرضه را مرحلهبندی کرده است. نسخه ویدیو در دسترس است و نسخه تصویر طی هفتههای آینده عرضه میشود. همچنین قرار است هسته این مدل با نام Flux 3 Dev بهصورت وزنهای باز (Open Weights) — یعنی انتشار دستور پخت مدل بهجای فقط محصول نهایی — منتشر شود.
گام بعدی شما
- اگر در حوزه تولید محتوا فعال هستید، تفاوت هماهنگی لبخوانی (Lip-sync) در Flux 3 را با مدلهای قدیمی مقایسه کنید.
- منتظر انتشار Flux 3 Dev بمانید تا امکان اجرای محلی مدل روی سختافزار خودتان فراهم شود.
- بررسی کنید آیا آموزش چندوجهی واقعاً دقت رندر متون در تصاویر را (طبق ادعای شرکت) بهبود داده است یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو