تولید ویدیوهای هوش مصنوعی دیگر تنها یک تجربه بصری نیست؛ حالا صدا و حرکت فیزیکی در یک ساختار واحد با هم ادغام شدهاند. اگر تصور کنید یک مدل تنها با یک «مغز» واحد بتواند همزمان فیلم بسازد، موسیقی آن را بنویسد و دستور حرکت یک بازوی رباتیک را صادر کند، با قابلیتهای FLUX 3 روبرو هستید.
به نقل از Black Forest Labs (BFL)، این شرکت در ۲۳ ژوئیه ۲۰۲۶ پارادایم موجود را تغییر داد و مدل FLUX 3 را عرضه کرد. در حالی که صنعت مدتها به مدلهای تخصصی برای هر وجه (Modality) متکی بود، این مدل بنیاد چندوجهی یکپارچه از مکانیزم Flow Matching برای استفاده از یک مجموعه وزن واحد جهت هدایت تصاویر، ویدیوهای ۲۰ ثانیهای، صدای بومی و حرکات رباتیک استفاده میکند. این رویکرد نوآورانه را میتوان در بررسی تطبیقی FLUX 3 با سایر رقبای ویدیوساز مشاهده کرد که در آن برتری این مدل در یکپارچگی بومی صدا برجسته شده است. برخلاف سیستمهای فعلی که ویدیو و صدا را در خطوط لولهی مجزا پردازش میکنند و اغلب دچار «گسستگی» میشوند—به گونهای که صدا با تأثیر بصری هماهنگ نیست—BFL استدلال میکند که تصاویر، ویدیو و صدا صرفاً تصویرهای کاهشی (Lossy Projections) از یک واقعیت زیربنایی واحد هستند. با آموزش همزمان روی هر سه وجه، این مودالیتهها یکدیگر را محدود میکنند و باعث میشوند حرکت از قوانین جرم پیروی کند و صدا با رویدادهای فیزیکی مطابقت یابد.
مرکز فنی این سامانه، متدی به نام Self-Flow است که نخستین بار در مارس ۲۰۲۶ معرفی شد. طبق مستندات منتشر شده، Self-Flow یک هدف Flow Matching را با بازسازی ویژگیهای خود-نظارتی ترکیب میکند. اگرچه BFL یک پیادهسازی مرجع با مجوز Apache-2.0 در گیتهاب با استفاده از SiT-XL/2 ارائه داده است، اما باید توجه داشت که آن چکپوینت خاص، یک مدل پژوهشی روی ImageNet با رزولوشن ۲۵۶×۲۵۶ است؛ در حالی که نسخه کامل FLUX 3 با مقیاسبندی بسیار شدیدتر منابع محاسباتی و دادهها آموزش دیده است.
قابلیتها و عملکرد FLUX 3 به شرح زیر است:
- تولید ویدیو: تولید کلیپهایی تا ۲۰ ثانیه در یک بار نسل (Generation) همراه با صدای بومی و همزمان.
- حالتهای عملیاتی: پشتیبانی کامل از تبدیل متن به ویدیو (Text-to-Video)، تصویر به ویدیو (Image-to-Video)، ویدیو به ویدیو (Video-to-Video) و تبدیل فریمهای کلیدی به ویدیو برای ایجاد انتقالهای دقیق.
- ویژگیهای پیشرفته: دیالوگهای چندزبانه بومی، تایپوگرافی متحرک و زنجیرهسازی عاملمحور (Agentic Chaining) برای ساخت توالیهای چند-شاتی (Multi-shot).
- سیاست رباتیک: هستهی این مدل، قدرتبخش FLUX-mimic است؛ یک سیاست رباتیک که قادر است با تأخیر کمتر از ۸۰ میلیثانیه روی یک کارت گرافیک واحد RTX 5090 اجرا شود.
بر اساس گزارش تیم پژوهشی BFL، مدل FLUX 3 برتری واضحی در بازسازی حالات چهره انسان و تداعی رویدادهای صوتی نشان میدهد. در محکهای اولیه رزولوشن 720p برای تبدیل متن به ویدیو (کلیپهای ۱۰ ثانیهای همراه با صدا)، کاربران در ۹۳٪ موارد FLUX 3 را به Luma Ray 3.2 و در ۷۷٪ موارد به Runway Gen-4.5 ترجیح دادند.
شکاف عملکرد در برابر سایر مدلهای تراز اول کمتر است. FLUX 3 در ۶۹٪ موارد بر Grok Imagine Video و در ۶۰٪ موارد بر Kling v3 Pro پیروز شد. با این حال، در رقابت با Seedance 2.0 و Gemini Omni Flash، نرخ ترجیح روی ۵۲٪ قرار گرفت که BFL اشاره میکند این نتیجه بسیار نزدیک به یک «پرتاب سکه» (شانسی) است.
از دیدگاه فنی، این عرضه این فرض را میشکند که هوش چندوجهی نیازمند متخصصان مجزا است که با آداپتورها به هم وصل شده باشند. BFL با Treating پیشبینی ویدیو—که بیش از ۹۵٪ محاسبات آموزشی را میبلعد—به عنوان محرک اصلی، و در نظر گرفتن صدا به عنوان سهم توکنهای جزئی (کمتر از ۰.۵٪)، سیستمی ساخته است که در آن بخش بسیار کوچکی از دادهها، زمینهسازی (Grounding) عظیمی برای خروجیهای بصری ایجاد میکند.
این تغییر نشان میدهد که آیندهی «مدلهای جهان» (World Models) در آموزش مشترک (Joint Training) نهفته است، نه در ادغام مراحل نهایی (Late-stage Fusion). برای توسعهدهندگان، تأخیر ۸۰ میلیثانیهای سیاست رباتیک روی سختافزارهای مصرفکننده (RTX 5090) ثابت میکند که وزنهای عظیم چندوجهی را میتوان بدون از دست دادن انسجام فیزیکی به پیشبینهای عملیاتی در لحظه تقطیر کرد.
دسترسی به مدل در حال حاضر محدود و گیتشده است. پیشبینی ویدیو و حرکت در وضعیت دسترسی زودهنگام (Early Access) هستند و پس از آن قابلیتهای تصویر عرضه خواهند شد؛ انتشار وزنهای باز نیز برای مرحله نهایی عرضه برنامهریزی شده است.
گام بعدی شما
- بررسی دقیق مقاله فنی Self-Flow برای درک نحوه تقطیر (Distillation) از لایهی ۲۰ معلم (EMA teacher) به لایهی ۸ شاگرد.
- تحلیل پست فنی FLUX 3 x mimic برای پیادهسازی استراتژیهای کنترل رباتیک و درک مکانیزمهای انتقال دانش.
- رصد تاریخ انتشار وزنهای باز برای تست محلی مدل و بهینهسازی روی سختافزارهای شخصی.
این تنها آغاز ماجراست؛ اثر موجگونهی این یکپارچگی بر صنعت تولید محتوی و تعامل انسان و ربات را در گزارشهای بعدی بررسی خواهیم کرد.




گفتگو