پرش به محتوای اصلی
پرش به محتوای مقاله

claude-real-video هزینه توکن‌های ویدیو را با حذف فریم‌های تکراری کاهش داد

·۱۳ مرداد ۱۴۰۵۶ دقیقه مطالعه
راهنما
انتخاب فریم، کل بازی است: نکات مهندسی از آموزش مدل‌های زبانی بزرگ برای تماشای ویدیو
انتخاب فریم، کل بازی است: نکات مهندسی از آموزش مدل‌های زبانی بزرگ برای تماشای ویدیو
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم حذف تکرار سه‌کاناله (Global, Action, Settled) برای جایگزینی نمونه‌برداری یکنواخت در تحلیل ویدیو توسط LLMها.

اگر امروز قصد دارید یک ویدیو را به مدل‌های هوش مصنوعی بدهید، احتمالاً با هزینه‌ای سرسام‌آور برای توکن‌های بصری روبرو می‌شوید. هزینه بالای توکن‌های بصری باعث می‌شود که وارد کردن ویدیوهای خام به یک مدل زبانی بزرگ (LLM) برای اکثر کاربران غیرممکن یا بسیار گران باشد. طبق مستندات فنی منتشر شده در leoaido.com در ۳ آگوست ۲۰۲۶، ابزاری به نام claude-real-video ثابت کرد که رمز بهره‌وری در درک ویدیو، استخراج بیشتر داده نیست، بلکه انتخاب هوشمندانه‌تر است. هدف این پروژه این است که بودجه‌ای سخت‌گیرانه یعنی ۱۰۰ تا ۱۵۰ فریم برای هر ویدیو نگه دارد، بدون اینکه لحظات حیاتی — همان‌هایی که انسان‌ها معمولاً در خلاصه‌های متنی می‌نویسند — حذف شوند.

این رویکرد درست زمانی می‌رسد که صنعت با مشکل «نمونه‌برداری یکنواخت» (Uniform Sampling) دست‌وپنجه نرم می‌کند؛ یعنی عادت به برداشتن یک فریم در هر چند ثانیه یا هر ۱۰ ثانیه‌ی یک‌بار. همان‌طور که در تحلیل قبلی ما درباره‌ی تخصص کاربر در کیفیت خروجی مدل‌ها اشاره کردیم، ظرافت در انتخاب داده، جایی است که عملکرد واقعی هوش مصنوعی تعریف می‌شود. در ویدیوها، نمونه‌برداری یکنواخت اغلب مدل را در انبوهی از فریم‌های تکراریِ یک چهره غرق می‌کند و دقیقاً همان یک ثانیه‌ای را که یک پیام خطای حیاتی روی صفحه ظاهر می‌شود، از دست می‌دهد؛ این اتفاق می‌افتد چون نمونه‌بردار هیچ ایده‌ای ندارد که در صحنه واقعاً چه چیزی تغییر کرده است.

فلسفه انتخاب

یک ویدیو، مقاله ای درباره یک ویدیو نیست. به طور معمول، یک مقاله در واقع فشرده‌سازی انسانی از یک رویداد است؛ شخصی تماشا می‌کند، تصمیم می‌گیرد چه چیزی مهم است و بقیه را دور می‌ریزد. وقتی یک مدل زبانی بزرگ چنین مقاله‌ای را می‌خواند، سوگیری‌ها و انتخاب‌های آن نویسنده را به ارث می‌برد و نمی‌تواند محتوای حذف‌شده را بازیابی کند یا با انتخابی که هرگز ندیده است، مخالفت کند.

با ارائه فریم‌های منتخب، مرحله فشرده‌سازی به خودِ مدل منتقل می‌شود. حالا مدل می‌بیند یک دمو واقعاً چگونه بود، نه اینکه یک بررسی‌کننده چه گفته است. مدل می‌تواند بفهمد «راه‌اندازی سریع» در واقع ۱۱ برش (cut) طول کشیده یا یک پیام خطای گذرا را در یک ویدیو آموزشی ببیند که هیچ‌کس آن را در متن یادداشت نکرده است. به عبارتی، موقعیت مدل از خواندن شهادت یک شاهد، به «خودِ شاهد» تغییر می‌کند. این تغییر رویکرد در واقع بخشی از یک تحول گسترده‌تر است که در آن داده‌های بصری در برابر زیرنویس‌ها برتری می‌یابند تا درک AI از محتوا عمیق‌تر شود.

مکانیسم انتخاب

برای حل مشکل بودجه توکن‌ها، claude-real-video یک خط لوله سه‌مرحله‌ای را برای تصمیم‌گیری درباره فریم‌هایی که لایق ورود به پنجره زمینه (Context Window) — مثل میز کاری که جا برای چند ورق دارد، نه کل کتابخانه — هستند، اجرا می‌کند:

  • تشخیص پویای صحنه: در گام اول از امتیاز صحنه ffmpeg استفاده می‌شود. ابزار در هر تغییر صحنه یک فریم می‌گیرد، به علاوه یک «کف با تراکم پایین» برای اطمینان از اینکه نماهای طولانی بدون برش همچنان فریم تولید کنند. برای جلوگیری از شکست در آستانه‌های ثابت — که اغلب باعث گم شدن «کش آمدن و جمع شدن» در انیمیشن‌ها یا پان‌های آرام دوربین می‌شوند — این ابزار امتیاز صحنه هر فریم را در یک گذرِ مخصوص متاداتا محاسبه می‌کند. ابزار زمانی فریم را نگه می‌دارد که امتیاز آن از ضریبی از میانگین متحرک بیشتر شود. در فیلم‌های پرتحرک، سطح سخت‌گیری بالا می‌رود و در فیلم‌های آرام، این سطح پایین می‌آید.

  • حذف تکرار سه‌کاناله: برای جلوگیری از فریم‌های تکراری، سیستم سه بررسی مجزا انجام می‌دهد:

    1. کانال جهانی: فریم‌ها را به یک امضای RGB ۱۶×۱۶ کاهش اندازه می‌دهد. این کانال سلول‌هایی را می‌شمارد که در هر یک از کانال‌های رنگی بیش از ۲۵/۲۵۵ تغییر کرده‌اند و اگر کمتر از حدود ۸٪ تغییر کرده باشند، فریم را حذف می‌کند. استفاده از RGB به جای مقیاس خاکستری به این دلیل است که یک برش از قرمز به سبز با درخشندگی یکسان، برای یک مقایسه‌گر خاکستری یکسان به نظر می‌رسد. نکته حیاتی این است که این کانال مقایسه را با یک پنجره لغزان از ۴ فریم اخیر انجام می‌دهد تا از «برش‌های A-B-A» (جایی که یک نمای مصاحبه و یک نمای واکنش باعث می‌شود مدل یک نمای قدیمی را دوباره بپذیرد) جلوگیری کند.
    2. کانال اکشن: آستانه درصدی نسبت به سوژه‌های کوچک کور است. فردی که تنها ۰.۵٪ از یک نمای باز را اشغال کرده، نمی‌تواند ۸٪ پیکسل‌ها را تغییر دهد. بر اساس کشفی که از اجرای این ابزار روی ۲,۱۸۱ ویدیوی واقعی به دست آمد، این کانال از یک شبکه ۳۲×۳۲ استفاده می‌کند. اگر حتی تعداد کمی از سلول‌ها تغییر شدیدی (بیش از ۴۵/۲۵۵) داشته باشند، فریم بدون توجه به درصد کلی حفظ می‌شود.
    3. کانال تثبیت: این کانال روی یک امضای ۱۹۲×۱۹۲ عمل می‌کند تا تغییرات وضعیت بسیار ریز، مانند تعویض یک کپشن، به‌روزرسانی رابط کاربری (UI) یا ظاهر شدن یک خط مرکب روی تخته‌سفید را شکار کند. این کانال اجازه جابه‌جایی مثبت یا منفی ۱ پیکسل را می‌دهد تا لرزش فیلم، نویز سنسور و دانه‌های تصویر نادیده گرفته شوند. این بخش فقط زمانی اجرا می‌شود که صحنه در سایر موارد ایستا باشد. پیکسل‌های کاندید باید از یک گذر دوم سخت‌گیرانه برای حذف تغییرات نرم کنتراست (مثل دود در حال پخش شدن) عبور کنند. برای جلوگیری از اینکه تکان خوردن یک پرچم تمام بودجه را بخورد، هر تاییدیه باعث افزایش سطح سخت‌گیری با یک بازه خنک‌کننده (cooldown) در حال کاهش می‌شود.

ادغام بصری‌ها با صدا

این ابزار فقط توده‌ای از تصاویر را فراهم نمی‌کند، بلکه یک مانیفست ادغام‌شده ایجاد می‌کند. متون از زیرنویس‌های داخلی یا تبدیل گفتار به متن محلی توسط Whisper گرفته می‌شوند. سیستم باگ‌های خاص Whisper را مدیریت می‌کند؛ مثلاً توهم بخش‌هایی که بسیار فراتر از پایان ویدیو (در زمان‌های موسیقی) هستند، با محدود کردن همه چیز به مدت زمان رسانه به علاوه یک ثانیه تلورانس برای جبران خطاهای گرد کردن اعداد در مراحل قبلی، برطرف می‌شود.

سپرده کردن یک متن و توده‌ای از فریم‌ها به مدل برای الحاق «بر اساس برچسب زمانی» در ویدیوهای بلند اغلب منجر به عدم تطابق می‌شود. برای رفع این مشکل، الحاق پیش‌محاسبه می‌شود: هر بخش از متن، فریم‌هایی را که در بازه زمانی آن قرار دارند لیست می‌کند و سکوت‌های طولانی‌تر از ۱.۵ ثانیه به عنوان بازه‌های «فقط فریم» علامت‌گذاری می‌شوند. این رویکرد دقیقاً همان روشی است که ابزار crv برای حذف خطاهای زمانی مدل‌های زبانی در تحلیل ویدیو به کار می‌گیرد. خروجی شامل JPEGهای ساده، یک متن ترنسکریپت و یک فایل مانیفست است که باعث می‌شود داده‌ها بین مدل‌های مختلف قابل انتقال باشند.

ارائه از طریق MCP

برای کسانی که از پروتکل زمینه مدل (MCP) استفاده می‌کنند، این ابزار یک سرور را از طریق pip install "claude-real-video[mcp]" و دستور crv-mcp ارائه می‌دهد. این امکان را به کلاینت‌هایی مثل Claude Desktop، Claude Code یا Cursor می‌دهد تا دستور watch_video را روی یک URL یا فایل محلی اجرا کنند.

در اینجا دو تصمیم بودجه‌ای خاص حفظ شده است: فریم‌ها در ضلع بلندتر به ۷۶۸ پیکسل تغییر اندازه می‌یابند، زیرا فریم‌های با رزولوشن کامل بدون هیچ سود بصری، توکن‌های زمینه را می‌سوزانند. همچنین تحلیل‌ها برای هر منبع کش (Cache) می‌شوند تا از دانلود یا استخراج مجدد محتوا در هنگام پاسخ به سوالات بعدی جلوگیری شود.

پیاده‌سازی و محدودیت‌ها

متخصصان می‌توانند همین امروز از کد این پروژه با مجوز MIT در گیت‌هاب استفاده کنند. این خط لوله به پایتون ۳.۱۰ به بالا و ffmpeg نیاز دارد. یک دستور ساده — crv "URL" — پوشه فریم‌ها، متن زمان‌بندی شده و فایل MANIFEST.txt را تولید می‌کند.

هرچ衡量 این معماری گلوگاه اصلی بودجه توکن را حل می‌کند، اما محدودیت‌هایی دارد. این سیستم حرکت دوربین، ریتم تدوین یا لحن صدا را شکار نمی‌کند، زیرا این‌ها مسائل ادراکی جداگانه‌ای هستند. با این حال، برای کاربردهای روزمره که مدل باید واقعاً ویدیو را «ببیند» و بعد جواب دهد، ترکیب selection و fusion روی یک ماشین محلی، مقدار غافلگیرکننده‌ای از نیازها را پوشش می‌دهد.

کد در اینجا در دسترس است: github.com/HUANGCHIHHUNGLeo/claude-real-video (MIT).

گام بعدی شما

  • اگر از مدل‌های بینایی-زبانی برای تحلیل ویدیو استفاده می‌کنید، متد نمونه‌برداری یکنواخت را با این ابزار جایگزین کنید تا دقت در شناسایی وقایع کوتاه بالا رود.
  • برای کاهش هزینه‌های API، ابعاد فریم‌ها را روی ۷۶۸ پیکسل تنظیم کنید.
  • برای اتوماسیون تحلیل ویدیو، سرور MCP این ابزار را روی Cursor یا Claude Desktop نصب کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر تخصص در پردازش سیگنال، هزینه استنتاج ویدیو را به شدت کاهش می‌دهد. این تغییر به توسعه‌دهندگان اجازه می‌دهد اپلیکیشن‌هایی بسازند که ویدیوهای طولانی را بدون تخلیه بودجه توکن تحلیل کنند.

تأثیر برای ایران

به دلیل متن‌باز بودن و مجوز MIT، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به خرید لایسنس، این ابزار را روی سرورهای محلی خود برای تحلیل بهینه ویدیوها پیاده‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «نمونه‌برداری کور» با «انتخاب معنایی» نشان می‌دهد که گلوگاه فعلی مدل‌های چندوجهی، کمبود بینایی نیست، بلکه مدیریت توکن‌هاست. این ابزار در واقع یک لایه پیش‌پردازش هوشمند ایجاد می‌کند که نقش «فیلترer» انسانی را ایفا می‌کند تا مدل را با داده‌های تکراری خفه نکند. به نظر ما، آینده تحلیل ویدیو در AI نه در مدل‌های بزرگ‌تر، بلکه در لایه‌های استخراج داده‌ای است که می‌فهمند چه بخشی از پیکسل‌ها «معنادار» است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.