تصور کنید تمام دادههای آموزشی برای مدلهای پیشرفتهی بصری تنها در اختیار چند شرکت معدود و غولهای فناوری باشد. LAION-BVD (Big Video Dataset) با ارائه ۱۰ میلیون ساعت محتوای ویدیویی پردازششده، این وضعیت را به چالش میکشد و تلاش میکند انحصار دادههای چندوجهی را بشکند.
این منبع باز که در ۲۷ اوت ۲۰۲۶ منتشر شد، به دانشمندان مستقل اجازه میدهد بدون وابستگی به سیلوهای بسته شرکتی و زیرساختهای بسته، مدلهای بنیادی (Foundation Model) را آموزش داده و ارزیابی کنند.
یادگیری چندوجهی (Multimodal Learning) — یعنی توانایی هوش مصنوعی در پردازش همزمان ویدیو، صوت و متن — همواره به دلیل نبود مجموعهدادههای باکیفیت و باز در مقیاس وسیع محدود بود. در حالی که جفتهای تصویر-متن در وب فراوان هستند، جمعآوری و سازماندهی دادههای ویدیویی از نظر محاسباتی بسیار گران است و این دادهها اغلب پشت دیوارهای پلتفرمهای بزرگ محبوس شدهاند. این چالشهای زیرساختی باعث شده تا نوآوریهایی در جهت بهینهسازی زمان آموزش رخ دهد؛ برای مثال، پروژه Linum توانست زمان آموزش حرکات پیچیده ویدیو را از هفتهها به ۲۴ ساعت کاهش دهد.
پروژه LAION-BVD با ایجاد یک خط لولهی شفاف برای پیشآموزش در مقیاس بزرگ، این شکاف را پر میکند. همانطور که در بحثهای گذشتهی ما دربارهی دموکراتیزه کردن دادههای آموزشی اشاره کردیم، دسترسی به منابع باز، سرعت نوآوری را در محیطهای دانشگاهی بهشدت افزایش میدهد. این پروژه حاصل یک تلاش مشترک و همکاری نهادهای متعددی چون مرکز هوش مصنوعی توبینگن، LAION، JSC FZJ، Wynd Labs، موسسه سیستمهای هوشمند MPI و دانشگاه فنی مونیخ است.
طبق مستندات منتشرشده در projects.laion.ai، این مجموعه داده از طریق خط لولهی فنی زیر ساخته شده است:
- جمعآوری: استخراج ۱.۳ میلیارد URL ویدیویی مختص پلتفرمهای مختلف از طریق CommonCrawl.
- پردازش: دانلود و پردازش موفق ۸۰ میلیون ویدیو.
- برچسبگذاری: استخراج ۵۵ میلیون کلیپ با استفاده از سیستم تشخیص صحنه حساس به محتوا (content-aware scene detection) و جفت کردن آنها با شرحهای متنی و صوتی که بهصورت مصنوعی تولید شدهاند.
- استخراج تصویر: استخراج ۳۰۰ میلیون فریم از لحظات تغییر صحنه برای ایجاد یک منبع مجزا و متمایز از دادههای تصویر-متن.
بر اساس نتایج تجربی، مدلهای آموزشدیده با این دادهها بسیار رقابتی هستند. مدلهای ViCLIP با استفاده از LAION-BVD توانستند در محکهای استاندارد ویدیو-متن، نتایج مدلهای پایه آموزشدیده با InternVid را تا ۲.۱٪ بهبود ببخشند یا با آنها برابری کنند. پژوهشگران مشاهده کردند که با افزایش مقیاس آموزش از ۱۰ میلیون به ۵۰ میلیون کلیپ، عملکرد مدلها بهطور مداوم و خطی رشد میکند.
در وظایف صوت-زبان نیز، مدلهای CLAP با بهرهگیری از صداهای متنوع محیطی و واقعی (in-the-wild)، به عملکردی رسیدند که با سایر مجموعهدادههای صوتی بزرگ و بدون نظارت رقابت میکند. این مدلها هنگام افزایش همزمان مقیاس مدل و مقیاس دادهها، روندهای مقیاسپذیری (scaling trends) مناسبی را نشان دادند.
علاوه بر این، مدلهای CLIP مبتنی بر فریم، قدرت بازیابی (retrieval) بالایی از خود نشان دادند. تحلیلهای پژوهشگران حاکی از آن است که توزیع بصری فریمهای ویدیویی با مجموعههای متنی و تصویری معمول وب متفاوت است؛ این بدان معناست که این دادهها بهجای تکرار دادههای موجود، مکمل منابع پیشآموزش تصویری فعلی هستند. این تکامل در دادهها، مسیر را برای پیادهسازی معماریهای پیشرفتهتر هموار میکند، مشابه آنچه در معماری Intermediate Fusion برای ایجاد استدلال بومی در مدلهای چندوجهی مشاهده میکنیم.
این انتشار، فرضیات رایج در این حوزه را تغییر میدهد و ثابت میکند که دادههای مصنوعی (Synthetic Data) در مقیاس بزرگ میتوانند جایگزین برچسبهای دستی شوند، بدون اینکه رقابتپذیری مدل در محکهای ارزیابی کاهش یابد. این موضوع سد ورود آزمایشگاههای دانشگاهی را برای انجام تحلیلهای ایمنی و مطالعات بازتولیدپذیری روی مدلهای بنیادی چندوجهی میشکند.
با این حال، نویسندگان هشدار میدهند که چون دادهها از وب جمعآوری شدهاند، ممکن است حاوی سوگیریها، کلیشهها و بازنماییهای نابرابر در میان مناطق جغرافیایی، زبانها و موضوعات مختلف باشند. مدلهای آموزشدیده با این دادهها احتمالاً این سوگیریها را به ارث میبرند و پژوهشگران موظفاند این موارد را در کنار توانمندیهای مدل ارزیابی و گزارش کنند.
با دموکراتیزه کردن دسترسی به ۱۰ میلیون ساعت محتوا، LAION-BVD دنیای هوش مصنوعی را به سمت ارزیابیهای شفافتر سوق میدهد تا مشخص شود مدلهای ویدیویی بزرگ چگونه سوگیریهای وب را جذب میکنند. لازم به ذکر است که این مجموعه داده صرفاً برای مقاصد پژوهشی منتشر شده و استفاده تجاری از آن ممنوع است.
گام بعدی شما
- پژوهشگران میتوانند اکنون به مجموعهداده و مقاله همراه آن در arXiv (کد ۲۶۰۸.۲۴۸۴۵) دسترسی پیدا کنند تا ادغام این جفتهای چندوجهی را در خط لولهی آموزش خود آغاز کنند.
- بررسی کنید که چگونه جفتهای چندوجهی این مجموعه میتواند در خط لولهی آموزش مدلهای اختصاصی شما ادغام شود.
- تحلیل کنید که آیا دادههای مصنوعیِ این مجموعه، نرخ توهم مدل شما را در توصیف ویدیوها کاهش میدهد یا خیر.
اما تأثیر این حجم از داده بر معماریهای جدید ترنسفورمر حتی پیچیدهتر است — به تحلیل ما دربارهی قوانین مقیاسپذیری در مدلهای چندوجهی مراجعه کنید.




گفتگو