پرش به محتوای اصلی
پرش به محتوای مقاله

Linum زمان آموزش حرکات پیچیده ویدیو را از هفته‌ها به ۲۴ ساعت رساند

·۵ شهریور ۱۴۰۵۲۰ دقیقه مطالعه۱ بازدید
راهنما
پالایش داده برای پیش‌آموزش ویدیویی مولد | یادداشت‌های میدانی لینوم
پالایش داده برای پیش‌آموزش ویدیویی مولد | یادداشت‌های میدانی لینوم
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از RLVR برای امتیازدهی زیبایی‌شناختی به‌جای SFT و جایگزینی کامل فیلترهای CPU با خط لوله‌های GPU-Accelerated که زمان پردازش میلیاردها داده را از هفته‌ها به ۳۶ ساعت رساند.

اگر امروز برای آموزش یک مدل تولید ویدیو بودجه‌ای اختصاص می‌دهید، احتمالاً بخش بزرگی از توان محاسباتی شما صرف یادگیری «زباله‌های دیجیتال» می‌شود. آموزش یک مدل ویدیو زاینده روی داده‌های بی‌کیفیت، اتلاف خالص ظرفیت پردازشی است. شرکت Linum، استارتاپی که در حال ساخت ابزارهای متن-به-ویدیو برای انیمیشن است، دریافت که بزرگ‌ترین اهرم ارتقای کیفیت مدل، نه افزایش مقیاس (Scaling)، بلکه دقت خط لوله فیلتر کردن داده‌هاست. اگر داده‌های بی‌کیفیت، مانند تصاویر JPEG که به‌شدت فشرده شده‌اند، را وارد مرحله پیش‌آموزش کنید، مدل ظرفیت قابل‌توجهی از خود را صرف یادگیری تقلید از این آرتیفکت‌ها (Artifacts) می‌کند، به‌جای آنکه مفاهیم بصری مورد نظر را بیاموزد. این تلاش برای حذف آرتیفکت‌ها در واقع پاسخی به چالش‌های شناسایی محتوای مصنوعی است، چرا که تولید ویدیوهای بدون نقص بصری می‌تواند سیستم‌های سنتی تشخیص دیپ‌فیک را به چالش بکشد.

اکثر مدل‌های مدرن ویدیو بر پایه تطبیق جریان (Flow Matching) با ستون فقرات ترنسفورمر و هدف v-prediction استوار هستند. در حالی که ساختار داخلی این مدل‌ها از زمان Stable Diffusion 3 تغییر چندانی نکرده است — به‌جز گونه‌هایی مانند دیفیوژن خودبازگشت (Auto-regressive Diffusion) که توسط GPT-Image رایج شد — اما دستاوردهای فعلی در کیفیت خروجی از سه حوزه خاص حاصل شده است:

  • فیلتر کردن و بازتعادل داده‌ها: حذف داده‌های نویزی و نمونه‌برداری استراتژیک برای اطمینان از یادگیری مؤثر مدل.
  • برچسب‌گذاری داده‌ها (Annotation): جمع‌آوری کپشن‌های غنی‌تر، جعبه‌های محصورکننده (Bounding Boxes) و جزئیات فونت برای کمک به مدل در تفکیک مفاهیم بصری. مدل‌های زبانی بزرگ (LLMs) در ۱۲ ماه گذشته در کپشن‌نویسی تصاویر پیشرفت بی‌نظیری داشته‌اند، هرچند این پیشرفت برای ویدیوها کمتر بوده است.
  • تولید داده‌های مصنوعی: تنظیم دقیق (Finetuning) مجموعه‌ای از مدل‌های زاینده (اغلب با استفاده از LoRAهای شکننده و فیلترهای LLM) برای ایجاد داده‌های آموزشی برای سناریوهای کمیاب، مانند مدل‌های سبک Nano-Banana که بر اساس شرط‌دهی مرجع (Reference-conditioning) کار می‌کنند.

طبق گزارش فنی منتشر شده توسط Linum در ۲۷ اوت ۲۰۲۶، بحرانی‌ترین نقطه شکست برای بسیاری از توسعه‌دهندگان، تکیه بر فیلترهای «ارزان» است که هزینه را بر دقت ترجیح می‌دهند.

شکست رویکردهای سنتی (Software 1.0)

در سال ۲۰۲۴، Linum تلاش کرد تا ده‌ها میلیارد نمونه را با استفاده از بینایی ماشین (CV) سنتی روی خوشه‌های ارزان CPU فیلتر کند. این تلاشی بود برای اجتناب از هزینه‌های هنگفت خوشه‌های GPU یا پرداخت چندین میلیون دلار برای توکن‌های GPT-4.

تشخیص شات و برش صحنه
آن‌ها از ابزار PySceneDetect برای تشخیص مرزهای شات استفاده کردند. این ابزار یک پنجره لغزان از K-فریم را نگه می‌دارد؛ اگر فریم K+1 آمار تصویری به‌طور قابل‌توجهی متفاوتی نشان دهد، به عنوان یک «برش» (Cut) دسته‌بندی می‌شود. چون این ابزار از هیچ مدل یادگیری ماشینی استفاده نمی‌کند، سریع است اما در مواجهه با محو شدن‌ها (Dissolves)، فیدها (Fades) و برش‌های لرزشی (Jitter Cuts) دچار مشکل می‌شود.

تیم Linum تأکید می‌کند که مدل‌ها باید ابتدا «اسم‌ها» را یاد بگیرند و سپس «افعال» را تا سریع‌تر همگرا شوند. بنابراین، ویدیوهای خام باید پیش از فیلتر شدن، در مرزهای شات به کلیپ‌های کوچک تقسیم شوند. این کار مانع از آن می‌شود که مدل به‌طور تصادفی تصمیم بگیرد چه زمانی برش بخورد، زیرا برش یک تصمیم نویسندگی و تدوین است. در رسانه‌های مدرن، برش‌ها اغلب هر ۵ ثانیه رخ می‌دهند؛ یک مدل زاینده نباید این الگو را به‌طور تصادفی تقلید کند.

شناخت داده‌ها
قبل از فیلتر کردن، Linum توصیه می‌کند چندین روز را صرف بررسی نمونه‌های تصادفی کنید تا یک هستی‌شناسی (Ontology) از دسته‌های «خوب» و «بد» تدوین کنید. این کار مانع از آن می‌شود که «ذهن مهندسی» زمان زیادی را صرف تنظیم پیچ‌های اکتشافی (Heuristic Knobs) در جستجوی یک مرز تصمیم‌گیری کامل کند. درک توزیع داده‌ها برای بازتعادل (Rebalancing) نیز حیاتی است. برخی دسته‌ها در توزیع‌های طبیعی بیش از حد نمایش داده شده‌اند؛ این‌ها باید با نمونه‌برداری کمتر (Subsampling) کنترل شوند تا از تسلط آن‌ها بر آموزش و جلوگیری از یادگیری «دم بلند» (Long-tail) مربوط به افراد، مکان‌ها و اقدامات خاص جلوگیری شود.

مدیریت حرکات توصیف‌ناپذیر

برای مدیریت «اقدامات توصیف‌ناپذیر» — کلیپ‌هایی که یا بیش از حد ایستا هستند یا چنان هرج‌ومرجی دارند که یک LLM نمی‌تواند آن‌ها را شرح دهد — آن‌ها از بردارهای حرکتی H.264 استفاده کردند. استاندارد H.264 اندازه فایل را با ذخیره فریم‌های کلیدی و بردارهای حرکتی (با استفاده از تبدیل کسینوسی گسسته روی باقی‌مانده بین فریم‌ها) به‌جای ذخیره مقادیر RGB برای هر پیکسل، کاهش می‌دهد.

آن‌ها یک درخت تصمیم بر اساس دو معیار اکتشافی که توسط mv-extractor محاسبه می‌شد، اعمال کردند:

  • average_frame_energy: نرم L2 تمام بردارهای حرکتی که در طول ویدیو میانگین گرفته شده است. کلیپ‌های کمتر از ۰.۱ به عنوان ایستا (اسلایدشو/فریم‌های یخ‌زده) دور ریخته شدند؛ کلیپ‌های بیشتر از ۲۵ به دلیل هرج‌ومرج زیاد حذف شدند.
  • min(sub_clip_average_frame_energy): کلیپ به تکه‌های کوچک تقسیم شد و حداقل نرم L2 گرفته شد. اگر این مقدار کمتر از ۰.۰۳ بود، کلیپ به دلیل داشتن بخشی که هیچ اتفاقی در آن نمی‌افتاد (مثلاً یک فید)، حذف شد.

آن‌ها همچنین جریان نوری لوکاس-کاناد (Lucas-Kanade) را روی CPUها امتحان کردند، اما دریافتند که این روش بسیار شکننده است و برای ویدیوهای دنیای باز (Open-world) مناسب نیست.

مبارزه با سوگیری «سرِ سخنگو»

آن‌ها با استفاده از تشخیص‌دهنده‌های چهره Haar-cascade با سوگیری «سر سخنگو» (Talking Head) مبارزه کردند. این کار ضروری بود زیرا کلیپ‌های سر سخنگو در توزیع‌های طبیعی به‌شدت بیش از حد نمایش داده شده‌اند. اگر نمونه‌برداری مجدد صورت نگیرد، مدل دچار سوگیری می‌شود؛ همان‌طور که در ویدیوهای VEO-3 در اوایل ۲۰۲۵ دیده شد که سبک «مرد در خیابان» بر آن‌ها غالب بود.

با مقایسه حرکت چهره با حرکت پس‌زمینه، آن‌ها موارد زیر را محاسبه کردند:

  • average_face_frame_energy: نرم L2 بردارهای حرکتی در داخل جعبه‌های محصورکننده چهره.
  • average_background_frame_energy: نرم L2 بردارهای حرکتی در گوشه‌های فریم.

اگر انرژی چهره بیشتر یا برابر با انرژی پس‌زمینه بود و انرژی کلی فریم در حد متوسط بود، به عنوان یک نمای نزدیک (Close-up) خوب نگه داشته می‌شد. کلیپ‌های با انرژی کم/متوسط نمونه‌برداری مجدد شدند. ویژگی‌های Haar-like در اینجا مفید بودند زیرا اغلب در تشخیص چهره‌ها در زوایای تند شکست می‌خورند و این امر به جداسازی سرهای سخنگوی واقعی از افرادی که در حال انجام اقدامات واقعی هستند کمک کرد.

گلوگاه متون و گذار به Software 2.0

برای حذف محتوای متنی زیاد، آن‌ها یک EAST Detector متعلق به سال ۲۰۱۷ را مستقر کردند. این ابزار برای استخراج جعبه‌های محصورکننده متن استفاده شد؛ ویدیوها بر اساس درصد فریم‌های حاوی متن و درصد پوشش متن در هر فریم فیلتر شدند.

این مرحله به یک گلوگاه عظیم تبدیل شد و اجرای آن روی CPUها هفته‌ها زمان برد. چون فریم‌ها برای گنجیدن در محدودیت‌های CPU به‌شدت تغییر اندازه (Resize) می‌شدند، بسیاری از فونت‌های کوچک شناسایی نمی‌شدند. Linum اشاره کرد که برای یک مدل ۲ میلیارد پارامتری، یادگیری گرافیک‌های متحرک (Motion Graphics) اتلاف ظرفیت است، در حالی که مدل می‌تواند اقدامات واقعی را یاد بگیرد. خواندن صفحه آسان است؛ اما توصیف اینکه متن چه زمانی و چگونه تغییر می‌کند، بخش سخت کار برای LLMهاست.

در اوایل ۲۰۲۵، Linum اکتشافات دستی را رها کرد و به سراغ شبکه‌های عصبی جعبه‌سیاه رفت. آن‌ها فلسفه «نرم‌افزار ۲.۰» را پذیرفتند؛ گذاری که آندری کارپاتی در یک سخنرانی YC در تابستان ۲۰۲۵ درباره اتوپایلوت تسلا توصیف کرد.

آن‌ها PySceneDetect را با AutoShot و TransNetV2 جایگزین کردند و از کرنل‌های سفارشی CUDA برای شتاب‌دهی استنتاج استفاده کردند. اگرچه این‌ها هنوز برخی برش‌های لرزشی را از دست می‌دهند، اما بسیار دقیق‌تر از روش‌های اکتشافی هستند.

آن‌ها تشخیص‌دهنده قدیمی EAST را با PaddleOCR جایگزین کردند که روی TensorRT و هزاران کارت گرافیک Nvidia A10G و L4 اجرا می‌شد. این مهاجرت، زمان پردازش ده‌ها میلیارد نمونه را به تنها ۳۶ ساعت کاهش داد و هزینه آن کمتر از ۱۰,۰۰۰ دلار شد.

خط لوله برچسب‌گذاری تکرارشونده

اکنون فیلتر کردن بر پایه LLMهای تنظیم‌شده‌ای است که به عنوان طبقه‌بندی‌کننده‌های دسته‌ای عمل می‌کنند. Linum از Qwen-2-VL-2B برای برچسب‌گذاری تصاویر و ویدیوها استفاده کرد. آن‌ها از Unsloth برای تنظیم دقیق و vLLM برای سرویس‌دهی استفاده کردند، هرچند اشاره کردند که تطبیق سازگاری بیت-به-بیت بین این دو اغلب نیازمند تغییرات دستی در عملیات تکه‌تکه کردن (Patchification) تصویر/ویدیو است.

فرآیند برچسب‌گذاری آن‌ها از یک حلقه سخت‌گیرانه ۶ مرحله‌ای برای مبارزه با مسائل خود-سازگاری (جایی که برچسب‌گذاران انسانی به مرور زمان معیارها را تسهیل می‌کنند) پیروی می‌کند:
۱. تعریف دسته‌ها: ایجاد یک هستی‌شناسی خاص بر اساس مطالعات اولیه مجموعه داده.
۲. برچسب‌گذاری حدود ۲۰۰۰ نمونه: استخراج نمونه‌های تصادفی و بازبینی دسته‌ها.
۳. تفکیک آموزش/اعتبارسنجی: کنار گذاشتن یک مجموعه اعتبارسنجی برای اطمینان از تعمیم‌پذیری.
۴. تنظیم دقیق LLM: استفاده از LoRA یا تنظیم دقیق کامل (مدل Qwen-2-VL-2B کافی بود).
۵. ارزیابی مجموعه آموزش: شناسایی دسته‌هایی که مدل در آن‌ها مشکل دارد؛ این‌ها معمولاً نیاز به تعریف مجدد دارند.
۶. اصلاح و برچسب‌گذاری مجدد: ادغام یا حذف دسته‌ها تا زمانی که مرز تصمیم‌گیری پایدار شود.

آن‌ها به مطالعه‌ای در سال ۲۰۲۵ از دانشگاه CMU اشاره کردند که نشان داد حتی متخصصان فیلم‌برداری در ۲۴٪ مواقع با حقیقت زمینی (Ground Truth) مخالف بودند و تنها پس از تکرار آزمایش‌ها به توافق ۹۶٪ رسیدند. این چالش در برچسب‌گذاری دقیق، مشابه پیچیدگی‌های استخراج مرزهای دانش در مدل‌های زبانی است که در متدولوژی‌های جدید برای شناسایی تاریخ قطع دانش LLMها بررسی شده است.

نکات حرفه‌ای برچسب‌گذاری
برای مدیریت دشواری‌های برچسب‌گذاری تکرارشونده، Linum یک اپلیکیشن سفارشی React با Supabase برای ذخیره‌سازی و R2 برای نمونه‌ها ساخت. آن‌ها سه ویژگی کلیدی را توصیه می‌کنند:

  • کلیدهای میانبر (Hotkeys): برای سرعت و جلوگیری از فرسودگی کاربر ضروری است.
  • مجموعه داده‌های قابل فورک (Forkable): توانایی ایجاد یک مجموعه داده جدید از برچسب‌های قدیمی و بررسی دقیق نمونه‌های اشتباه طبقه‌بندی شده.
  • ابزارهای نگاشت برچسب: ابزارهایی برای تغییر سریع دسته‌بندی نمونه‌ها از A به B همزمان با تکامل هستی‌شناسی.

فیلتر زیبایی‌شناسی با RLVR

برای امتیازدهی زیبایی‌شناختی، Linum از تنظیم نظارت‌شده (SFT) فراتر رفت. SFT به عنوان «جراحی مدل با چاقوی قصابی» توصیف شد، در حالی که یادگیری تقویتی با پاداش‌های قابل تأیید (RLVR) مانند یک «تیغ جراحی» است.

به‌جای آموزش مدل برای شناسایی ویژگی‌های خاص «زشت» (مانند نوردهی بیش از حد یا آسمان‌های پیکسلی) — که به دلیل انفجار ترکیبی باعث ایجاد سیگنال داده‌های پراکنده می‌شد — آن‌ها نمونه‌ها را در مقیاس ۱ تا ۴ رتبه‌بندی کردند:

  • ۱ (تهوع‌آور): تار، پیکسلی، نوردهی بیش از حد یا اینفوگرافیک. جزئیات به‌سختی قابل مشاهده‌اند.
  • ۲ (زشت): کنتراست پایین، نورپردازی ضعیف یا واترمارک‌های بزرگ در مرکز تصویر.
  • ۳ (خوب): نورپردازی مناسب با کنتراست و سوژه‌های واضح.
  • ۴ (زیبا): محدوده دینامیکی بالا (HDR)، شفاف، رنگارنگ یا پرتره‌ها و نماهای اکشن استایل‌دار.

آن‌ها از بهینه‌سازی سیاست توالی گروهی (GSPO) — که نسخه‌ای تغییریافته از GRPO شرکت DeepSeek است — روی مدل Qwen-2.5-VL-3B استفاده کردند. معیار امتیازدهی، مدل را بر اساس تفاوت مطلق بین برچسب پیش‌بینی شده و برچسب واقعی جریمه می‌کرد.

آن‌ها تلاش کردند از ردپاهای استدلالی (Chain-of-Thought) برای توضیح تفاوت بین امتیاز «۲» و «۳» استفاده کنند، اما دریافتند که قضاوت زیبایی بیش از حد ذهنی است و استدلال کلامی حتی با استفاده از تکنیک‌های بدون ردپای انسانی DeepSeek-R1-Zero، امتیازی را بهبود نمی‌بخشد.

ساختار نهایی فیلترها

خط لوله سرتاسری Linum اکنون داده‌ها را از چندین مرحله عبور می‌دهد:

برای تصاویر (مجموعه اولیه: حدود ۱۵ میلیارد):

  • نسبت تصویر و اندازه: نگه داشتن تصاویری با ۵ نسبت هدف و اندازه +۲۵۶ پیکسل (حدود ۷.۲ میلیارد / ۴۸٪).
  • پس‌زمینه‌های تک‌رنگ: حذف تصاویر بی‌کیفیت محصولات (حدود ۵ میلیارد / ۳۳٪).
  • PaddleOCR روی TensorRT: حذف تصاویر پر از متن (حدود ۳.۳ میلیارد / ۲۲٪).
  • فیلترهای SFT: طبقه‌بندی‌کننده‌های دسته‌ای Qwen-2-VL-2B (حدود ۹۵۰ میلیون / ۶.۳٪).
  • حذف تکراری‌ها با P-Hash: استفاده از FAISS برای حذف تکراری‌ها با فاصله همینگ کمتر از ۵ (حدود ۶۴۹ میلیون / ۴.۳٪).
  • فیلترهای RLVR: امتیازدهنده‌های دقیق Qwen-2.5-VL-3B (حدود ۲۵۰ میلیون / ۱.۷٪).

برای ویدیوها (مجموعه اولیه: حدود ۱ میلیارد کلیپ / ۲۵۰ سال فیلم):

  • نسبت تصویر: حفظ فقط ۱۶:۹ (حدود ۸۰۰ میلیون / ۸۰٪).
  • تشخیص شات: TransNetV2 و AutoShot برای حذف کلیپ‌های کمتر از ۲ ثانیه یا بیشتر از ۱۰ ثانیه (حدود ۷۰۰ میلیون / ۷۰٪).
  • بردارهای حرکتی H.264: حذف کلیپ‌های با حرکت کم (حدود ۵۲۰ میلیون / ۵۲٪).
  • PaddleOCR روی TensorRT: حذف کلیپ‌های پر از متن (حدود ۳۷۵ میلیون / ۳۷.۵٪).
  • فیلترهای SFT: طبقه‌بندی‌کننده‌های دسته‌ای Qwen-2-VL-2B (حدود ۱۵۰ میلیون / ۱۵٪).
  • فیلترهای RLVR: امتیازدهنده‌های دقیق Qwen-2.5-VL-3B (حدود ۶۵ میلیون / ۶.۵٪).
  • جریان نوری WAFT: حذف کلیپ‌های با حرکت کم در دم بلند (حدود ۵۰ میلیون / ۵٪).

تحلیل: هزینه ارزان‌گرایی

این تغییر نشان‌دهنده یک تحول بنیادین در نحوه پیش‌آموزش است. صنعت از رویکرد «جمع‌آوری هر چه بیشتر» به سمت «فیلتر کردن با دقت حداکثری» حرکت می‌کند.

درس این است که بهینه‌سازی برای ارزان‌ترین فیلتر (CPU) اغلب هزینه کل آموزش را افزایش می‌دهد. Linum اشاره کرد که مدل آن‌ها هفته‌ها با حرکات ساده‌ای مانند نواختن گیتار در مجموعه داده ۲۰۲۴ مشکل داشت، اما همان اقدامات را در کمتر از ۲۴ ساعت با استفاده از مجموعه داده فیلتر شده با GPU در سال ۲۰۲۵ آموخت. این بهینه‌سازی در مراحل استنتاج و آموزش، یادآور رویکردهایی است که در مدل‌سازی اکتشافی برای کاهش گام‌های استنتاج در رباتیک به کار گرفته شده‌اند.

این نشان می‌دهد که کیفیت داده به عنوان یک ضریب برای بهره‌وری محاسباتی عمل می‌کند. فیلتر کردن با دقت بالا، «نویز» را کاهش می‌دهد و به مدل اجازه می‌دهد ظرفیت پارامتری خود را به جای آرتیفکت‌های فشرده‌سازی یا فریم‌های ایستا، به مفاهیم بصری واقعی اختصاص دهد.

چرا این موضوع مهم است؟

این تغییر رویکرد، استانداردهای پیش‌آموزش مدل‌های مولد را از «جمع‌آوری حداکثری» به «فیلترینگ فوق‌دقیق» تغییر می‌دهد. بر اساس تجربه Linum، این کار باعث می‌شود مدل‌ها مفاهیم بصری را در کسری از زمان قبلی یاد بگیرند.

تأثیر برای ایران

این متدولوژی برای توسعه‌دهندگان ایرانی که با محدودیت منابع GPU مواجه‌اند حیاتی است؛ زیرا نشان می‌دهد سرمایه‌گذاری روی فیلترینگ دقیق، از خرید سخت‌افزار بیشتر برای آموزش مدل‌های بی‌کیفیت به‌صرفه‌تر است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی Heuristics با مدل‌های عصبی در لایه فیلترینگ، نشان می‌دهد که «داده‌های پاک» حالا ارزشمندتر از «داده‌های انبوه» هستند. این رویکرد ثابت می‌کند که هزینه استنتاج در مرحله پیش‌پردازش، در واقع سرمایه‌گذاری برای کاهش هزینه‌های آموزش است. در واقع، دقت در فیلترینگ، ضریب تکثیر کارایی محاسبات (Compute Efficiency) را بالا می‌برد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.