اگر برای تحلیل ویدیوهای طولانی از APIهای هوش مصنوعی استفاده میکنید، احتمالاً با هزینههای سرسامآور توکنها دستوپنجه نرم کردهاید. حالا گوگل راهکاری ارائه داده که مصرف توکنها را تا ۸۸ درصد کاهش میدهد.
این کاهش هزینه به دلیل تغییر بنیادین در نحوه پردازش است؛ مدلها بهجای اسکن هر ثانیه از ویدیو با نرخ ثابت، بهصورت مستقل به دنبال بخشهای مرتبط میگردند. این یعنی مدل دیگر تمام ویدیو را نمیبلعد، بلکه مثل یک کارآگاه فقط صحنههای کلیدی را بررسی میکند.
همانطور که در تحلیل قبلی ما دربارهی استراتژیهای گوگل در لایسنسینگ رسانههای باارزش اشاره کردیم، این بهروزرسانی فنی در واقع بهینهسازیِ نحوه مصرف همان محتوا توسط هوش مصنوعی است. تا پیش از این، Gemini بر پردازش ایستا (Static Processing) متکی بود و ویدیوها را با نرخ پیشفرض یک فریم در ثانیه نمونهبرداری میکرد. این محدودیت توسعهدهندگان را در وضعیتی سخت قرار میداد: یا باید هزینههای بالای توکن را میپذیرفتند یا ریسک از دست دادن جزئیات حیاتی را.
طبق گزارش ۲ سپتامبر ۲۰۲۶ از وبسایت the-decoder.com، این سامانه اکنون برای مدلهای Gemini 3.7 Flash، 3.6 Flash و 3.5 Flash-Lite فعال شده است. در این ساختار، مدل از یک ابزار داخلی برای بازیابی گزینشی فریمها، صدا یا متنها از طریق یک حلقه «تفکر-عمل-مشاهده» استفاده میکند.
قابلیتهای فنی
- دقت بالا: سامانه قادر است تغییرات وضعیت یا برشهای کوتاهتر از یک ثانیه را تشخیص دهد.
- بهینگی: مدل با شناسایی نقاط مشکوک، تنها همان بازههای زمانی را با نرخ فریم بالاتر بازبینی میکند و نیازی به پردازش کل فایل نیست.
- مقیاسپذیری: امکان مکانیابی صحنههای خاص در ضبطهای چندساعته بدون مصرف میلیونها توکن (Token) — که شبیه برشهای کوچک یک کیک متنی هستند که مدل میخورد — فراهم شده است.

بر اساس نتایج بهدستآمده در محکهای 1H-VideoQA و LVBench، این رویکرد عاملمحور (Agentic) صحت پاسخها را افزایش و هزینهها را بهشدت کاهش داده است. در ارزیابیهای داخلی گوگل، Gemini 3.7 Flash در مقایسه با رقبای خود، به بالاترین دقت با کمترین هزینه بهازای هر پرسوجو دست یافت.

این تغییر نشاندهنده گذار از پردازش «غیرفعال» چندوجهی به استدلال «فعال» است. گوگل با تبدیل فایل ویدیو به یک پایگاهداده برای پرسوجو (بهجای جریانی برای جذب)، گلوگاه اقتصادی هوش مصنوعی در ویدیوهای طولانی را حل کرده است. برای کاربران تجاری، این یعنی تحلیل خودکار ویدیوهای آموزشی طولانی یا تدوین هوشمند اکنون در مقیاس بزرگ توجیهپذیر است؛ چون دیگر هزینهی «فضاهای خالی» در یک ضبط ۹۰ دقیقهای را نمیپردازید.
توسعهدهندگان میتوانند همین امروز از طریق Gemini API در Google AI Studio و پلتفرم Gemini Enterprise Agent Platform با تغییر حالت پردازش به "agentic" از این قابلیت استفاده کنند. هیچ هزینه اضافهای بهجز نرخ استاندارد توکنها دریافت نمیشود.
گوگل قصد دارد در ماههای آینده این قابلیت را با اپلیکیشن Gemini و ویژگی "Ask YouTube" ادغام کند تا کاربران بتوانند پاسخهایی مستقیماً متصل به اتفاقات بصری روی صفحه دریافت کنند، نه فقط بر اساس متن صوتی.
گام بعدی شما
- اگر از مدلهای Flash استفاده میکنید، حالت پردازش را به agentic تغییر دهید تا کاهش هزینه را در صورتحساب ماهانه خود ببینید.
- برای تحلیل ویدیوهای بالای ۳۰ دقیقه، دقت مدل را در شناسایی لحظات کوتاه (زیر یک ثانیه) تست کنید.
- بررسی کنید که آیا حذف فریمهای غیرضروری، تأثیری بر صحت پاسخهای مدل در پروژههای شما دارد یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو