پرش به محتوای اصلی
پرش به محتوای مقاله

مدل FLUX 3 ویدیو، صدا و حرکات رباتیک را در یک مجموعه وزن‌ها یکپارچه کرد

·۴ مرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
لوگوی بلک فارست لبز و عنوان FLUX 3: مدل چندوجهی برای تولید تصویر، ویدیو، صدا و کنترل ربات
لوگوی بلک فارست لبز و عنوان FLUX 3: مدل چندوجهی برای تولید تصویر، ویدیو، صدا و کنترل ربات
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

یکپارچه‌سازی واقعی ویدیو، صدا و اکشن رباتیک در یک مجموعه وزن واحد، به جای استفاده از مدل‌های جداگانه و لایه‌های سازگارساز (Adapters).

تولید ویدیوهای هوش مصنوعی دیگر تنها یک تجربه بصری نیست؛ حالا صدا و حرکت فیزیکی در یک ساختار واحد با هم ادغام شده‌اند. اگر تصور کنید یک مدل تنها با یک «مغز» واحد بتواند همزمان فیلم بسازد، موسیقی آن را بنویسد و دستور حرکت یک بازوی رباتیک را صادر کند، با قابلیت‌های FLUX 3 روبرو هستید.

به نقل از Black Forest Labs (BFL)، این شرکت در ۲۳ ژوئیه ۲۰۲۶ پارادایم موجود را تغییر داد و مدل FLUX 3 را عرضه کرد. در حالی که صنعت مدت‌ها به مدل‌های تخصصی برای هر وجه (Modality) متکی بود، این مدل بنیاد چندوجهی یکپارچه از مکانیزم Flow Matching برای استفاده از یک مجموعه وزن واحد جهت هدایت تصاویر، ویدیوهای ۲۰ ثانیه‌ای، صدای بومی و حرکات رباتیک استفاده می‌کند. این رویکرد نوآورانه را می‌توان در بررسی تطبیقی FLUX 3 با سایر رقبای ویدیو‌ساز مشاهده کرد که در آن برتری این مدل در یکپارچگی بومی صدا برجسته شده است. برخلاف سیستم‌های فعلی که ویدیو و صدا را در خطوط لوله‌ی مجزا پردازش می‌کنند و اغلب دچار «گسستگی» می‌شوند—به گونه‌ای که صدا با تأثیر بصری هماهنگ نیست—BFL استدلال می‌کند که تصاویر، ویدیو و صدا صرفاً تصویرهای کاهشی (Lossy Projections) از یک واقعیت زیربنایی واحد هستند. با آموزش همزمان روی هر سه وجه، این مودالیته‌ها یکدیگر را محدود می‌کنند و باعث می‌شوند حرکت از قوانین جرم پیروی کند و صدا با رویدادهای فیزیکی مطابقت یابد.

مرکز فنی این سامانه، متدی به نام Self-Flow است که نخستین بار در مارس ۲۰۲۶ معرفی شد. طبق مستندات منتشر شده، Self-Flow یک هدف Flow Matching را با بازسازی ویژگی‌های خود-نظارتی ترکیب می‌کند. اگرچه BFL یک پیاده‌سازی مرجع با مجوز Apache-2.0 در گیت‌هاب با استفاده از SiT-XL/2 ارائه داده است، اما باید توجه داشت که آن چک‌پوینت خاص، یک مدل پژوهشی روی ImageNet با رزولوشن ۲۵۶×۲۵۶ است؛ در حالی که نسخه کامل FLUX 3 با مقیاس‌بندی بسیار شدیدتر منابع محاسباتی و داده‌ها آموزش دیده است.

قابلیت‌ها و عملکرد FLUX 3 به شرح زیر است:

  • تولید ویدیو: تولید کلیپ‌هایی تا ۲۰ ثانیه در یک بار نسل (Generation) همراه با صدای بومی و هم‌زمان.
  • حالت‌های عملیاتی: پشتیبانی کامل از تبدیل متن به ویدیو (Text-to-Video)، تصویر به ویدیو (Image-to-Video)، ویدیو به ویدیو (Video-to-Video) و تبدیل فریم‌های کلیدی به ویدیو برای ایجاد انتقال‌های دقیق.
  • ویژگی‌های پیشرفته: دیالوگ‌های چندزبانه بومی، تایپوگرافی متحرک و زنجیره‌سازی عامل‌محور (Agentic Chaining) برای ساخت توالی‌های چند-شاتی (Multi-shot).
  • سیاست رباتیک: هسته‌ی این مدل، قدرت‌بخش FLUX-mimic است؛ یک سیاست رباتیک که قادر است با تأخیر کمتر از ۸۰ میلی‌ثانیه روی یک کارت گرافیک واحد RTX 5090 اجرا شود.

بر اساس گزارش تیم پژوهشی BFL، مدل FLUX 3 برتری واضحی در بازسازی حالات چهره انسان و تداعی رویدادهای صوتی نشان می‌دهد. در محک‌های اولیه رزولوشن 720p برای تبدیل متن به ویدیو (کلیپ‌های ۱۰ ثانیه‌ای همراه با صدا)، کاربران در ۹۳٪ موارد FLUX 3 را به Luma Ray 3.2 و در ۷۷٪ موارد به Runway Gen-4.5 ترجیح دادند.

شکاف عملکرد در برابر سایر مدل‌های تراز اول کمتر است. FLUX 3 در ۶۹٪ موارد بر Grok Imagine Video و در ۶۰٪ موارد بر Kling v3 Pro پیروز شد. با این حال، در رقابت با Seedance 2.0 و Gemini Omni Flash، نرخ ترجیح روی ۵۲٪ قرار گرفت که BFL اشاره می‌کند این نتیجه بسیار نزدیک به یک «پرتاب سکه» (شانسی) است.

از دیدگاه فنی، این عرضه این فرض را می‌شکند که هوش چندوجهی نیازمند متخصصان مجزا است که با آداپتورها به هم وصل شده باشند. BFL با Treating پیش‌بینی ویدیو—که بیش از ۹۵٪ محاسبات آموزشی را می‌بلعد—به عنوان محرک اصلی، و در نظر گرفتن صدا به عنوان سهم توکن‌های جزئی (کمتر از ۰.۵٪)، سیستمی ساخته است که در آن بخش بسیار کوچکی از داده‌ها، زمینه‌سازی (Grounding) عظیمی برای خروجی‌های بصری ایجاد می‌کند.

این تغییر نشان می‌دهد که آینده‌ی «مدل‌های جهان» (World Models) در آموزش مشترک (Joint Training) نهفته است، نه در ادغام مراحل نهایی (Late-stage Fusion). برای توسعه‌دهندگان، تأخیر ۸۰ میلی‌ثانیه‌ای سیاست رباتیک روی سخت‌افزارهای مصرف‌کننده (RTX 5090) ثابت می‌کند که وزن‌های عظیم چندوجهی را می‌توان بدون از دست دادن انسجام فیزیکی به پیش‌بین‌های عملیاتی در لحظه تقطیر کرد.

دسترسی به مدل در حال حاضر محدود و گیت‌شده است. پیش‌بینی ویدیو و حرکت در وضعیت دسترسی زودهنگام (Early Access) هستند و پس از آن قابلیت‌های تصویر عرضه خواهند شد؛ انتشار وزن‌های باز نیز برای مرحله نهایی عرضه برنامه‌ریزی شده است.

گام بعدی شما

  • بررسی دقیق مقاله فنی Self-Flow برای درک نحوه تقطیر (Distillation) از لایه‌ی ۲۰ معلم (EMA teacher) به لایه‌ی ۸ شاگرد.
  • تحلیل پست فنی FLUX 3 x mimic برای پیاده‌سازی استراتژی‌های کنترل رباتیک و درک مکانیزم‌های انتقال دانش.
  • رصد تاریخ انتشار وزن‌های باز برای تست محلی مدل و بهینه‌سازی روی سخت‌افزارهای شخصی.

این تنها آغاز ماجراست؛ اثر موج‌گونه‌ی این یکپارچگی بر صنعت تولید محتوی و تعامل انسان و ربات را در گزارش‌های بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این مدل با حذف مرز میان صدا، تصویر و حرکت، استاندارد جدیدی برای اعتباریت فیزیکی در مدل‌های مولد تعریف می‌کند. تخصص BFL در کاهش تأخیر استنتاج تا ۸۰ میلی‌ثانیه، مسیر تجاری‌سازی ربات‌های انسان‌نما را هموارتر می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های سخت‌افزاری و تحریم‌ها، دسترسی به نسخه‌های پیش‌نمایش دشوار است؛ اما انتشار آتی وزن‌های باز، فرصتی برای پژوهشکنی مدل‌های چندوجهی در دانشگاه‌های ایران خواهد بود.

·نگاه ما
تحریریه دات‌هوش

تمرکز BFL بر تخصیص نامتقارن محاسبات (۹۵٪ ویدیو در برابر ۰.۵٪ صدا) یک ставка مخاطره‌آمیز اما هوشمندانه است. این رویکرد ثابت می‌کند که برای رسیدن به انسجام چندوجهی، نیازی نیست همه مودالیت‌ها با حجم یکسان آموزش ببینند؛ بلکه یک مودالیتِ غنی (ویدیو) می‌تواند به عنوان لنگرگاه معنایی برای سایر داده‌ها عمل کند. این مدل احتمالاً پایان عصر آداپتورهای پیچیده را تسریع می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.