پرش به محتوای اصلی
پرش به محتوای مقاله

«جایگزینی نمونه‌برداری ثابت»؛ راهکار گوگل برای تحلیل بهینه ویدیوها

·۱۱ شهریور ۱۴۰۵۳ دقیقه مطالعه
تحلیل ویدیویی مبتنی بر عامل جدید گوگل جمینی، مصرف توکن را تا ۸۸ درصد کاهش می‌دهد
تحلیل ویدیویی مبتنی بر عامل جدید گوگل جمینی، مصرف توکن را تا ۸۸ درصد کاهش می‌دهد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر مدل پردازش ویدیو از نمونه‌برداری ثابت (یک فریم در ثانیه) به بازیابی گزینشی توسط عامل هوشمند که منجر به کاهش ۸۸ درصدی مصرف توکن شده است.

اگر برای تحلیل ویدیوهای طولانی از APIهای هوش مصنوعی استفاده می‌کنید، احتمالاً با هزینه‌های سرسام‌آور توکن‌ها دست‌وپنجه نرم کرده‌اید. حالا گوگل راهکاری ارائه داده که مصرف توکن‌ها را تا ۸۸ درصد کاهش می‌دهد.

این کاهش هزینه به دلیل تغییر بنیادین در نحوه پردازش است؛ مدل‌ها به‌جای اسکن هر ثانیه از ویدیو با نرخ ثابت، به‌صورت مستقل به دنبال بخش‌های مرتبط می‌گردند. این یعنی مدل دیگر تمام ویدیو را نمی‌بلعد، بلکه مثل یک کارآگاه فقط صحنه‌های کلیدی را بررسی می‌کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی استراتژی‌های گوگل در لایسنسینگ رسانه‌های باارزش اشاره کردیم، این به‌روزرسانی فنی در واقع بهینه‌سازیِ نحوه مصرف همان محتوا توسط هوش مصنوعی است. تا پیش از این، Gemini بر پردازش ایستا (Static Processing) متکی بود و ویدیوها را با نرخ پیش‌فرض یک فریم در ثانیه نمونه‌برداری می‌کرد. این محدودیت توسعه‌دهندگان را در وضعیتی سخت قرار می‌داد: یا باید هزینه‌های بالای توکن را می‌پذیرفتند یا ریسک از دست دادن جزئیات حیاتی را.

طبق گزارش ۲ سپتامبر ۲۰۲۶ از وب‌سایت the-decoder.com، این سامانه اکنون برای مدل‌های Gemini 3.7 Flash، 3.6 Flash و 3.5 Flash-Lite فعال شده است. در این ساختار، مدل از یک ابزار داخلی برای بازیابی گزینشی فریم‌ها، صدا یا متن‌ها از طریق یک حلقه «تفکر-عمل-مشاهده» استفاده می‌کند.

قابلیت‌های فنی

  • دقت بالا: سامانه قادر است تغییرات وضعیت یا برش‌های کوتاه‌تر از یک ثانیه را تشخیص دهد.
  • بهینگی: مدل با شناسایی نقاط مشکوک، تنها همان بازه‌های زمانی را با نرخ فریم بالاتر بازبینی می‌کند و نیازی به پردازش کل فایل نیست.
  • مقیاس‌پذیری: امکان مکان‌یابی صحنه‌های خاص در ضبط‌های چندساعته بدون مصرف میلیون‌ها توکن (Token) — که شبیه برش‌های کوچک یک کیک متنی هستند که مدل می‌خورد — فراهم شده است.

تحلیل ویدیویی مبتنی بر عامل جدید گوگل جمینی، مصرف توکن را تا ۸۸ درصد کاهش می‌دهد

بر اساس نتایج به‌دست‌آمده در محک‌های 1H-VideoQA و LVBench، این رویکرد عامل‌محور (Agentic) صحت پاسخ‌ها را افزایش و هزینه‌ها را به‌شدت کاهش داده است. در ارزیابی‌های داخلی گوگل، Gemini 3.7 Flash در مقایسه با رقبای خود، به بالاترین دقت با کمترین هزینه به‌ازای هر پرس‌وجو دست یافت.

تحلیل ویدیویی مبتنی بر عامل جدید Gemini گوگل، مصرف توکن را تا ۸۸ درصد کاهش می‌دهد

این تغییر نشان‌دهنده گذار از پردازش «غیرفعال» چندوجهی به استدلال «فعال» است. گوگل با تبدیل فایل ویدیو به یک پایگاه‌داده برای پرس‌وجو (به‌جای جریانی برای جذب)، گلوگاه اقتصادی هوش مصنوعی در ویدیوهای طولانی را حل کرده است. برای کاربران تجاری، این یعنی تحلیل خودکار ویدیوهای آموزشی طولانی یا تدوین هوشمند اکنون در مقیاس بزرگ توجیه‌پذیر است؛ چون دیگر هزینه‌ی «فضاهای خالی» در یک ضبط ۹۰ دقیقه‌ای را نمی‌پردازید.

توسعه‌دهندگان می‌توانند همین امروز از طریق Gemini API در Google AI Studio و پلتفرم Gemini Enterprise Agent Platform با تغییر حالت پردازش به "agentic" از این قابلیت استفاده کنند. هیچ هزینه اضافه‌ای به‌جز نرخ استاندارد توکن‌ها دریافت نمی‌شود.

گوگل قصد دارد در ماه‌های آینده این قابلیت را با اپلیکیشن Gemini و ویژگی "Ask YouTube" ادغام کند تا کاربران بتوانند پاسخ‌هایی مستقیماً متصل به اتفاقات بصری روی صفحه دریافت کنند، نه فقط بر اساس متن صوتی.

گام بعدی شما

  • اگر از مدل‌های Flash استفاده می‌کنید، حالت پردازش را به agentic تغییر دهید تا کاهش هزینه را در صورت‌حساب ماهانه خود ببینید.
  • برای تحلیل ویدیوهای بالای ۳۰ دقیقه، دقت مدل را در شناسایی لحظات کوتاه (زیر یک ثانیه) تست کنید.
  • بررسی کنید که آیا حذف فریم‌های غیرضروری، تأثیری بر صحت پاسخ‌های مدل در پروژه‌های شما دارد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار مهندسی گوگل در زیرساخت‌های ابری، موانع مالی تحلیل ویدیوهای طولانی را از بین می‌برد. اکنون اتوماسیون محتوای ویدیویی از یک آزمایش گران‌قیمت به یک ابزار عملیاتی برای کسب‌وکارها تبدیل می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API گوگل، توسعه‌دهندگان ایرانی برای استفاده از این قابلیت باید از زیرساخت‌های واسط یا پروکسی‌های معتبر استفاده کنند تا بتوانند هزینه‌های استنتاج خود را کاهش دهند.

·نگاه ما
تحریریه دات‌هوش

تبدیل ویدیو از یک جریان داده‌ای به یک پایگاه‌داده قابل پرس‌وجو، پارادایم پردازش چندوجهی را تغییر می‌دهد. این رویکرد نشان می‌دهد که آینده‌ی مدل‌های بزرگ نه در افزایش پنجره متنی، بلکه در توسعه‌ی ابزارهای بازیابی هوشمند نهفته است تا هزینه‌ی استنتاج در مقیاس تجاری قابل مدیریت شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.