پرش به محتوای اصلی
پرش به محتوای مقاله

مجموعه داده LAION-BVD: ۱۰ میلیون ساعت ویدیو برای پیش‌آموزش مدل‌های چندوجهی

·۵ شهریور ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
نمایی از مجموعه داده ویدیویی بزرگ LAION: نمونه‌هایی از محتوای متنوع ویدیویی در مقیاس گسترده
نمایی از مجموعه داده ویدیویی بزرگ LAION: نمونه‌هایی از محتوای متنوع ویدیویی در مقیاس گسترده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه نخستین مجموعه داده باز در این مقیاس که ثابت می‌کند شرح‌های مصنوعی (Synthetic Captioning) می‌توانند بدون افت کیفیت، جایگزین برچسب‌گذاری دستی در آموزش مدل‌های چندوجهی شوند.

تصور کنید تمام داده‌های آموزشی برای مدل‌های پیشرفته‌ی بصری تنها در اختیار چند شرکت معدود و غول‌های فناوری باشد. LAION-BVD (Big Video Dataset) با ارائه ۱۰ میلیون ساعت محتوای ویدیویی پردازش‌شده، این وضعیت را به چالش می‌کشد و تلاش می‌کند انحصار داده‌های چندوجهی را بشکند.

این منبع باز که در ۲۷ اوت ۲۰۲۶ منتشر شد، به دانشمندان مستقل اجازه می‌دهد بدون وابستگی به سیلوهای بسته شرکتی و زیرساخت‌های بسته، مدل‌های بنیادی (Foundation Model) را آموزش داده و ارزیابی کنند.

یادگیری چندوجهی (Multimodal Learning) — یعنی توانایی هوش مصنوعی در پردازش هم‌زمان ویدیو، صوت و متن — همواره به دلیل نبود مجموعه‌داده‌های باکیفیت و باز در مقیاس وسیع محدود بود. در حالی که جفت‌های تصویر-متن در وب فراوان هستند، جمع‌آوری و سازماندهی داده‌های ویدیویی از نظر محاسباتی بسیار گران است و این داده‌ها اغلب پشت دیوارهای پلتفرم‌های بزرگ محبوس شده‌اند. این چالش‌های زیرساختی باعث شده تا نوآوری‌هایی در جهت بهینه‌سازی زمان آموزش رخ دهد؛ برای مثال، پروژه Linum توانست زمان آموزش حرکات پیچیده ویدیو را از هفته‌ها به ۲۴ ساعت کاهش دهد.

پروژه LAION-BVD با ایجاد یک خط لوله‌ی شفاف برای پیش‌آموزش در مقیاس بزرگ، این شکاف را پر می‌کند. همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی دموکراتیزه کردن داده‌های آموزشی اشاره کردیم، دسترسی به منابع باز، سرعت نوآوری را در محیط‌های دانشگاهی به‌شدت افزایش می‌دهد. این پروژه حاصل یک تلاش مشترک و همکاری نهادهای متعددی چون مرکز هوش مصنوعی توبینگن، LAION، JSC FZJ، Wynd Labs، موسسه سیستم‌های هوشمند MPI و دانشگاه فنی مونیخ است.

طبق مستندات منتشرشده در projects.laion.ai، این مجموعه داده از طریق خط لوله‌ی فنی زیر ساخته شده است:

  • جمع‌آوری: استخراج ۱.۳ میلیارد URL ویدیویی مختص پلتفرم‌های مختلف از طریق CommonCrawl.
  • پردازش: دانلود و پردازش موفق ۸۰ میلیون ویدیو.
  • برچسب‌گذاری: استخراج ۵۵ میلیون کلیپ با استفاده از سیستم تشخیص صحنه حساس به محتوا (content-aware scene detection) و جفت کردن آن‌ها با شرح‌های متنی و صوتی که به‌صورت مصنوعی تولید شده‌اند.
  • استخراج تصویر: استخراج ۳۰۰ میلیون فریم از لحظات تغییر صحنه برای ایجاد یک منبع مجزا و متمایز از داده‌های تصویر-متن.

بر اساس نتایج تجربی، مدل‌های آموزش‌دیده با این داده‌ها بسیار رقابتی هستند. مدل‌های ViCLIP با استفاده از LAION-BVD توانستند در محک‌های استاندارد ویدیو-متن، نتایج مدل‌های پایه آموزش‌دیده با InternVid را تا ۲.۱٪ بهبود ببخشند یا با آن‌ها برابری کنند. پژوهشگران مشاهده کردند که با افزایش مقیاس آموزش از ۱۰ میلیون به ۵۰ میلیون کلیپ، عملکرد مدل‌ها به‌طور مداوم و خطی رشد می‌کند.

در وظایف صوت-زبان نیز، مدل‌های CLAP با بهره‌گیری از صداهای متنوع محیطی و واقعی (in-the-wild)، به عملکردی رسیدند که با سایر مجموعه‌داده‌های صوتی بزرگ و بدون نظارت رقابت می‌کند. این مدل‌ها هنگام افزایش هم‌زمان مقیاس مدل و مقیاس داده‌ها، روندهای مقیاس‌پذیری (scaling trends) مناسبی را نشان دادند.

علاوه بر این، مدل‌های CLIP مبتنی بر فریم، قدرت بازیابی (retrieval) بالایی از خود نشان دادند. تحلیل‌های پژوهشگران حاکی از آن است که توزیع بصری فریم‌های ویدیویی با مجموعه‌های متنی و تصویری معمول وب متفاوت است؛ این بدان معناست که این داده‌ها به‌جای تکرار داده‌های موجود، مکمل منابع پیش‌آموزش تصویری فعلی هستند. این تکامل در داده‌ها، مسیر را برای پیاده‌سازی معماری‌های پیشرفته‌تر هموار می‌کند، مشابه آنچه در معماری Intermediate Fusion برای ایجاد استدلال بومی در مدل‌های چندوجهی مشاهده می‌کنیم.

این انتشار، فرضیات رایج در این حوزه را تغییر می‌دهد و ثابت می‌کند که داده‌های مصنوعی (Synthetic Data) در مقیاس بزرگ می‌توانند جایگزین برچسب‌های دستی شوند، بدون اینکه رقابت‌پذیری مدل در محک‌های ارزیابی کاهش یابد. این موضوع سد ورود آزمایشگاه‌های دانشگاهی را برای انجام تحلیل‌های ایمنی و مطالعات بازتولیدپذیری روی مدل‌های بنیادی چندوجهی می‌شکند.

با این حال، نویسندگان هشدار می‌دهند که چون داده‌ها از وب جمع‌آوری شده‌اند، ممکن است حاوی سوگیری‌ها، کلیشه‌ها و بازنمایی‌های نابرابر در میان مناطق جغرافیایی، زبان‌ها و موضوعات مختلف باشند. مدل‌های آموزش‌دیده با این داده‌ها احتمالاً این سوگیری‌ها را به ارث می‌برند و پژوهشگران موظف‌اند این موارد را در کنار توانمندی‌های مدل ارزیابی و گزارش کنند.

با دموکراتیزه کردن دسترسی به ۱۰ میلیون ساعت محتوا، LAION-BVD دنیای هوش مصنوعی را به سمت ارزیابی‌های شفاف‌تر سوق می‌دهد تا مشخص شود مدل‌های ویدیویی بزرگ چگونه سوگیری‌های وب را جذب می‌کنند. لازم به ذکر است که این مجموعه داده صرفاً برای مقاصد پژوهشی منتشر شده و استفاده تجاری از آن ممنوع است.

گام بعدی شما

  • پژوهشگران می‌توانند اکنون به مجموعه‌داده و مقاله همراه آن در arXiv (کد ۲۶۰۸.۲۴۸۴۵) دسترسی پیدا کنند تا ادغام این جفت‌های چندوجهی را در خط لوله‌ی آموزش خود آغاز کنند.
  • بررسی کنید که چگونه جفت‌های چندوجهی این مجموعه می‌تواند در خط لوله‌ی آموزش مدل‌های اختصاصی شما ادغام شود.
  • تحلیل کنید که آیا داده‌های مصنوعیِ این مجموعه، نرخ توهم مدل شما را در توصیف ویدیوها کاهش می‌دهد یا خیر.

اما تأثیر این حجم از داده بر معماری‌های جدید ترنسفورمر حتی پیچیده‌تر است — به تحلیل ما درباره‌ی قوانین مقیاس‌پذیری در مدل‌های چندوجهی مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه با تکیه بر اعتبار نهادهای پژوهشی آلمان، انحصار داده‌های ویدیویی را از شرکت‌های Big Tech می‌گیرد. دسترسی باز به ۱۰ میلیون ساعت ویدیو، شفافیت در ارزیابی سوگیری‌های مدل‌های مولد را ممکن می‌سازد.

تأثیر برای ایران

این مجموعه داده برای پژوهشگران هوش مصنوعی در ایران که دسترسی محدودی به زیرساخت‌های جمع‌آوری داده در مقیاس وب دارند، یک فرصت طلایی برای آموزش مدل‌های بینایی-زبانی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی برچسب‌های انسانی با شرح‌های مصنوعی در مقیاس ۸۰ میلیون ویدیو، نقطه عطفی در اقتصاد داده است. این رویکرد نشان می‌دهد که گلوگاه پیشرفت مدل‌های ویدیویی دیگر «کمبود داده» نیست، بلکه «توانایی تولید شرح‌های دقیق مصنوعی» است. در واقع، مدل‌های زبانی بزرگ اکنون به جای انسان، نقش معلم را برای مدل‌های بصری ایفا می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.