پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Qwen3.8-Omni-Flash مصرف توکن‌های ویدیو را ۴۵.۷٪ کاهش داد

·۲۷ شهریور ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
مدل چندوجهی کوئن ۳.۸-اُمنی-فلش: درک صوتی-تصویری عامل‌محور و استفاده از ابزار با کانتکست یک میلیونی
مدل چندوجهی کوئن ۳.۸-اُمنی-فلش: درک صوتی-تصویری عامل‌محور و استفاده از ابزار با کانتکست یک میلیونی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم ادراک عامل‌محور که به‌جای پردازش تمام فریم‌های ویدیو، ابتدا برنامه‌ریزی کرده و سپس بخش‌های هدفمند را تحلیل می‌کند؛ این تغییر باعث کاهش ۴۵.۷ درصدی مصرف توکن‌ها شده است.

اگر امروز برای تحلیل آرشیوهای حجیم ویدیو هزینه می‌کنید، صورت‌حساب شما به‌زودی تا ۹۳٪ ارزان‌تر می‌شود. علی‌بابا در ۱۸ سپتامبر ۲۰۲۶ مدل Qwen3.8-Omni-Flash را معرفی کرد؛ نخستین مدل چندوجهی (Multimodal) — شبیه به انسانی که هم‌زمان می‌بیند، می‌شنود و می‌نویسد — که به‌طور اختصاصی برای قابلیت‌های عامل‌محور (Agentic) طراحی شده است. این مدل ورودی‌های متنی، تصویری، صوتی و ویدیویی را می‌پذیرد و خروجی متنی تولید می‌کند. طبق اعلام تیم توسعه، گردش کار این مدل ساده است: درک محتوا، برنامه‌ریزی برای وظیفه، اجرای آن با استفاده از ابزارها و در نهایت ارائه نتیجه.

این عرضه در حالی رخ می‌دهد که صنعت از مدل‌های چندوجهی غیرفعال به سمت عامل‌هایی حرکت می‌کند که می‌توانند برنامه‌ریزی کنند و عمل کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی محدودیت‌های تعامل عامل‌ها اشاره کردیم، بسیاری از سیستم‌ها در مرحله‌ی تایید نهایی ابزارها دچار خطا می‌شدند (مشکلی که ما آن را «باگ رضایت» یا Consent Bug نامیدیم)، اما Qwen قصد دارد شکاف کارایی در پردازش رسانه‌های طولانی را پر کند.

معماری و سازوکار ادراک

مدل Qwen3.8-Omni-Flash بر پایه معماری Qwen3.8-Flash-Next بنا شده است. این مدل پایه در اوت ۲۰۲۶ با وزن‌های باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر شده تا هر کسی بتواند آن را اجرا کند — عرضه شده بود، اما نسخه Omni-Flash در زمان عرضه، وزن‌های باز نداشت و فعلاً امکان میزبانی شخصی (Self-hosting) برای آن وجود ندارد و فقط از طریق API در دسترس است.

تصور کنید مدلی را که یک ویدیوی دو ساعته را از ابتدا تا انتها تماشا نمی‌کند، بلکه مثل یک انسان آن را «مرور» می‌کند تا دقیقاً همان سه دقیقه‌ای را پیدا کند که پاسخ سؤال شما در آن است. این هسته اصلی گردش کار ادراک عامل‌محور در Qwen است: مدل ابتدا سؤال کاربر را می‌خواند، تصمیم می‌گیرد چه بخش‌هایی را ببیند یا بشنود و سپس در چندین مرحله از کلیات به جزئیات (Coarse-to-fine) می‌رسد تا توکن‌ها و محاسبات (Compute) — که در واقع کرایه آشپزخانه صنعتی برای پختن جواب است — فقط صرف بخش‌های حیاتی شود.

مشخصات فنی و عملکرد

به گزارش Marktechpost، این مدل در چندین محک (Benchmark) کلیدی نتایج درخشانی داشته است:

  • پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه به میز کاری که جا برای چند ورق دارد — یک میلیون توکن است. در QwenCloud به‌طور دقیق ۹۹۱ هزار توکن برای ورودی و ۱۳۱ هزار توکن برای خروجی ذکر شده است.
  • استدلال: حالت پیش‌فرض «تفکر» با تنظیم reasoning_effort روی xhigh فعال است. اگر این مقدار روی none قرار گیرد، قابلیت تفکر غیرفعال می‌شود. این مدل تا ۲۶۲ هزار توکن را برای زنجیره تفکر (Chain-of-Thought) — مثل وقتی شاگرد ریاضی پای تخته بلند بلند فکر می‌کند تا به جواب برسد — پشتیبانی می‌کند.
  • کارایی: در آزمون OmniVideoBench، دقت مدل از ۶۳.۴ به ۶۷.۸ درصد رسید، در حالی که مصرف توکن از ۱۴۵,۷۳۶ به ۷۹,۱۱۷ کاهش یافت؛ یعنی افت ۴۵.۷ درصدی در مصرف منابع.
  • بنچمارک‌ها: این مدل در ۲۹ ارزیابی مختلف، به‌طور متوسط بیش از ۲۵٪ بهبود نسبت به Qwen3.5-Omni-Plus نشان داده است. جزئیات این پیشرفت‌ها شامل جهش ۳۶.۵ امتیازی در WildClawBench-MM، رشد ۲۲.۳ امتیازی در AgenticVBench و رسیدن به امتیاز ۶۹.۶ در UniClawBench است. همچنین در LongAudioSpan شاهد ۸.۳ امتیاز و در OmniVideoBench شاهد ۹.۶ امتیاز رشد بودیم. در بخش OmniCap-IF، معیارهای CSR و ISR به‌ترتیب ۸.۵ و ۱۴.۱ امتیاز بهبود یافتند.
  • جایگاه رقابتی: تیم تحقیق اعلام کرده است که عملکرد صوتی-تصویری مدل به Gemini 3.8 Flash نزدیک است، اما عملکرد کلی صوتی از آن پیشی گرفته است. در یک پست در شبکه X اشاره شده که میانگین امتیازات عامل‌محور در WildClawBench-MM و UniClawBench حدود ۱۹.۵ امتیاز افزایش یافته است.

استقرار و هزینه‌ها

این مدل از طریق QwenCloud، Alibaba Cloud Model Studio و Qwen Studio در دسترس است و از پروتکل‌های OpenAI و DashScope پشتیبانی می‌کند و با APIهای Chat Completions و Responses سازگار است. قابلیت‌هایی مثل فراخوانی تابع (Function Calling)، جست‌وجوی وب، خروجی‌های ساختاریافته (Structured Outputs)، کشینگ متنی (Context Caching) و فراخوانی‌های دسته‌ای (Batch Calls) در آن تعبیه شده است. برای توسعه‌دهندگانی که به تولید گفتار (Speech Generation) نیاز دارند، مستندات Model Studio آن‌ها را به Qwen3.5-Omni ارجاع می‌دهد.

قیمت‌گذاری این مدل بسیار تهاجمی است: هر یک میلیون توکن ورودی ۰.۱۵ دلار و خروجی ۰.۴۷ دلار هزینه دارد. همچنین هر یک میلیون توکن در حالت Implicit Cache Hit مبلغ ۰.۰۱۶ دلار هزینه دارد. بر اساس گزارش‌ها، هزینه‌ها نسبت به Qwen3.5-Omni-Plus به‌شدت کاهش یافته است: هزینه ورودی‌های صوتی بیش از ۹۸٪ و ورودی‌های صوتی-تصویری بیش از ۹۳٪ در هر ساعت ارزان‌تر شده است (در پست X اشاره شده که هزینه ورودی ویدیو حدود ۸۹٪ کاهش یافته است).

محدودیت‌ها و دسترسی

توسعه‌دهندگان می‌توانند در شش منطقه شامل پکن، سنگاپور، هنگ‌کنگ، توکیو، فرانکفورت و ویرجینیا به این مدل دسترسی داشته باشند. محدودیت‌های ورودی عبارتند از:

  • ویدیو: فایل‌های تا ۲ ساعت و ۲ گیگابایت از طریق URL، با نتایج پایدار در نرخ نمونه‌برداری تا ۱۵ فریم بر ثانیه.
  • صوت: فایل‌های تا ۳ ساعت با پشتیبانی از ۱۱۳ زبان و گویش. همچنین از صدای استریو دوکاناله و صدای فضایی چهارکاناله FOA از طریق دستور use_multichannel پشتیبانی می‌کند. این پیشرفت در پردازش صوت در حالی رخ می‌دهد که رقبا نیز در حال بهینه‌سازی دقت تبدیل گفتار به متن هستند؛ برای مثال مدل Muse Voice متا اخیراً توانست نرخ خطای تبدیل گفتار به متن را به ۳.۱٪ برساند.

اکوسیستم عامل‌محور

علی‌بابا برای حمایت از توسعه‌دهندگان، چارچوب Qwen-MM-Plugins را تحت لایسنس Apache-2.0 منتشر کرد. این ابزار به عامل‌ها اجازه می‌دهد از طریق «مهارت‌ها» (Skills) و سرورهای اختیاری MCP از قابلیت‌های چندوجهی بهره ببرند. نصب‌کننده راهنمای این سیستم از ابزارهایی مثل Claude Code، CodeBuddy، Codex، Qoder، OpenClaw، Qwen Code و Gemini CLI پشتیبانی می‌کند.

پلاگین‌های کلیدی عبارتند از:

  • omni-memory: ساخت یک حافظه صوتی-تصویری از ویدیوهای طولانی.
  • omni-video2note: تبدیل ویدیوهای آموزشی به فایل‌های PDF مصور.
  • omni-chatcut: پوشش مواردی چون تبدیل موسیقی به موزیک‌ویدیو (Music-to-MV)، تفسیر فیلم و ترجمه ویدیو با حفظ صدای گوینده.

یک پلاگین اصلی به مدل اجازه می‌دهد تصاویر محلی و فریم‌های ویدیو را به‌طور بومی (Native) بخواند. با این حال، یک شکاف فعلی وجود دارد: اکثر رابط‌ها هنوز نمی‌توانند صوت را به‌طور بومی به مدل اصلی ارسال کنند، بنابراین صوت در حال حاضر از طریق API مسیریابی می‌شود.

برای کاربران تجاری، این تغییر یعنی هزینه تحلیل آرشیوهای عظیم ویدیو به‌شدت سقوط کرده است. با گذار از پردازش خطی به ادراک عامل‌محور، ویدیو از یک داده «سنگین» به یک پایگاه‌داده قابل جست‌وجو تبدیل شده است.

گام بعدی شما

  • اگر از APIهای گران‌قیمت برای تحلیل ویدیو استفاده می‌کنید، مدل Qwen3.8-Omni-Flash را در QwenCloud تست کنید تا کاهش هزینه را بسنجید.
  • پلاگین‌های Qwen-MM را برای تبدیل ویدیوهای آموزشی به مستندات متنی در گردش‌کارهای خود به کار بگیرید.
  • برای کاهش مصرف توکن، تنظیمات reasoning_effort را متناسب با پیچیدگی سؤال خود تغییر دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش چشمگیر هزینه استنتاج، تحلیل ویدیوهای طولانی را از یک عملیات گران‌قیمت به یک ابزار روزمره تبدیل می‌کند. اعتبار این ادعا با نتایج OmniVideoBench و قیمت‌گذاری تهاجمی علی‌بابا تقویت شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به سرویس‌های ابری علی‌بابا، توسعه‌دهندگان ایرانی باید از واسطه‌های API یا سرورهای خارج از کشور استفاده کنند. با این حال، کاهش شدید هزینه استنتاج، تحلیل ویدیوهای حجیم را برای استارتاپ‌های داخلی اقتصادی‌تر می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز علی‌بابا بر «ادراک گزینشی» به‌جای پردازش خطی، پارادایم تحلیل ویدیو را تغییر می‌دهد. این رویکرد نشان می‌دهد که آینده مدل‌های چندوجهی نه در بزرگ‌تر کردن پنجره متنی، بلکه در هوشمندتر کردن نحوه پیمایش داده‌های حجیم است تا هزینه استنتاج به سطح تجاری قابل‌قبول برسد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.