اگر امروز برای تحلیل آرشیوهای حجیم ویدیو هزینه میکنید، صورتحساب شما بهزودی تا ۹۳٪ ارزانتر میشود. علیبابا در ۱۸ سپتامبر ۲۰۲۶ مدل Qwen3.8-Omni-Flash را معرفی کرد؛ نخستین مدل چندوجهی (Multimodal) — شبیه به انسانی که همزمان میبیند، میشنود و مینویسد — که بهطور اختصاصی برای قابلیتهای عاملمحور (Agentic) طراحی شده است. این مدل ورودیهای متنی، تصویری، صوتی و ویدیویی را میپذیرد و خروجی متنی تولید میکند. طبق اعلام تیم توسعه، گردش کار این مدل ساده است: درک محتوا، برنامهریزی برای وظیفه، اجرای آن با استفاده از ابزارها و در نهایت ارائه نتیجه.
این عرضه در حالی رخ میدهد که صنعت از مدلهای چندوجهی غیرفعال به سمت عاملهایی حرکت میکند که میتوانند برنامهریزی کنند و عمل کنند. همانطور که در تحلیل قبلی ما دربارهی محدودیتهای تعامل عاملها اشاره کردیم، بسیاری از سیستمها در مرحلهی تایید نهایی ابزارها دچار خطا میشدند (مشکلی که ما آن را «باگ رضایت» یا Consent Bug نامیدیم)، اما Qwen قصد دارد شکاف کارایی در پردازش رسانههای طولانی را پر کند.
معماری و سازوکار ادراک
مدل Qwen3.8-Omni-Flash بر پایه معماری Qwen3.8-Flash-Next بنا شده است. این مدل پایه در اوت ۲۰۲۶ با وزنهای باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر شده تا هر کسی بتواند آن را اجرا کند — عرضه شده بود، اما نسخه Omni-Flash در زمان عرضه، وزنهای باز نداشت و فعلاً امکان میزبانی شخصی (Self-hosting) برای آن وجود ندارد و فقط از طریق API در دسترس است.
تصور کنید مدلی را که یک ویدیوی دو ساعته را از ابتدا تا انتها تماشا نمیکند، بلکه مثل یک انسان آن را «مرور» میکند تا دقیقاً همان سه دقیقهای را پیدا کند که پاسخ سؤال شما در آن است. این هسته اصلی گردش کار ادراک عاملمحور در Qwen است: مدل ابتدا سؤال کاربر را میخواند، تصمیم میگیرد چه بخشهایی را ببیند یا بشنود و سپس در چندین مرحله از کلیات به جزئیات (Coarse-to-fine) میرسد تا توکنها و محاسبات (Compute) — که در واقع کرایه آشپزخانه صنعتی برای پختن جواب است — فقط صرف بخشهای حیاتی شود.
مشخصات فنی و عملکرد
به گزارش Marktechpost، این مدل در چندین محک (Benchmark) کلیدی نتایج درخشانی داشته است:
- پنجره متنی (Context Window) — میزان متنی که مدل همزمان در ذهن نگه میدارد، شبیه به میز کاری که جا برای چند ورق دارد — یک میلیون توکن است. در QwenCloud بهطور دقیق ۹۹۱ هزار توکن برای ورودی و ۱۳۱ هزار توکن برای خروجی ذکر شده است.
- استدلال: حالت پیشفرض «تفکر» با تنظیم
reasoning_effortرویxhighفعال است. اگر این مقدار رویnoneقرار گیرد، قابلیت تفکر غیرفعال میشود. این مدل تا ۲۶۲ هزار توکن را برای زنجیره تفکر (Chain-of-Thought) — مثل وقتی شاگرد ریاضی پای تخته بلند بلند فکر میکند تا به جواب برسد — پشتیبانی میکند. - کارایی: در آزمون OmniVideoBench، دقت مدل از ۶۳.۴ به ۶۷.۸ درصد رسید، در حالی که مصرف توکن از ۱۴۵,۷۳۶ به ۷۹,۱۱۷ کاهش یافت؛ یعنی افت ۴۵.۷ درصدی در مصرف منابع.
- بنچمارکها: این مدل در ۲۹ ارزیابی مختلف، بهطور متوسط بیش از ۲۵٪ بهبود نسبت به Qwen3.5-Omni-Plus نشان داده است. جزئیات این پیشرفتها شامل جهش ۳۶.۵ امتیازی در WildClawBench-MM، رشد ۲۲.۳ امتیازی در AgenticVBench و رسیدن به امتیاز ۶۹.۶ در UniClawBench است. همچنین در LongAudioSpan شاهد ۸.۳ امتیاز و در OmniVideoBench شاهد ۹.۶ امتیاز رشد بودیم. در بخش OmniCap-IF، معیارهای CSR و ISR بهترتیب ۸.۵ و ۱۴.۱ امتیاز بهبود یافتند.
- جایگاه رقابتی: تیم تحقیق اعلام کرده است که عملکرد صوتی-تصویری مدل به Gemini 3.8 Flash نزدیک است، اما عملکرد کلی صوتی از آن پیشی گرفته است. در یک پست در شبکه X اشاره شده که میانگین امتیازات عاملمحور در WildClawBench-MM و UniClawBench حدود ۱۹.۵ امتیاز افزایش یافته است.
استقرار و هزینهها
این مدل از طریق QwenCloud، Alibaba Cloud Model Studio و Qwen Studio در دسترس است و از پروتکلهای OpenAI و DashScope پشتیبانی میکند و با APIهای Chat Completions و Responses سازگار است. قابلیتهایی مثل فراخوانی تابع (Function Calling)، جستوجوی وب، خروجیهای ساختاریافته (Structured Outputs)، کشینگ متنی (Context Caching) و فراخوانیهای دستهای (Batch Calls) در آن تعبیه شده است. برای توسعهدهندگانی که به تولید گفتار (Speech Generation) نیاز دارند، مستندات Model Studio آنها را به Qwen3.5-Omni ارجاع میدهد.
قیمتگذاری این مدل بسیار تهاجمی است: هر یک میلیون توکن ورودی ۰.۱۵ دلار و خروجی ۰.۴۷ دلار هزینه دارد. همچنین هر یک میلیون توکن در حالت Implicit Cache Hit مبلغ ۰.۰۱۶ دلار هزینه دارد. بر اساس گزارشها، هزینهها نسبت به Qwen3.5-Omni-Plus بهشدت کاهش یافته است: هزینه ورودیهای صوتی بیش از ۹۸٪ و ورودیهای صوتی-تصویری بیش از ۹۳٪ در هر ساعت ارزانتر شده است (در پست X اشاره شده که هزینه ورودی ویدیو حدود ۸۹٪ کاهش یافته است).
محدودیتها و دسترسی
توسعهدهندگان میتوانند در شش منطقه شامل پکن، سنگاپور، هنگکنگ، توکیو، فرانکفورت و ویرجینیا به این مدل دسترسی داشته باشند. محدودیتهای ورودی عبارتند از:
- ویدیو: فایلهای تا ۲ ساعت و ۲ گیگابایت از طریق URL، با نتایج پایدار در نرخ نمونهبرداری تا ۱۵ فریم بر ثانیه.
- صوت: فایلهای تا ۳ ساعت با پشتیبانی از ۱۱۳ زبان و گویش. همچنین از صدای استریو دوکاناله و صدای فضایی چهارکاناله FOA از طریق دستور
use_multichannelپشتیبانی میکند. این پیشرفت در پردازش صوت در حالی رخ میدهد که رقبا نیز در حال بهینهسازی دقت تبدیل گفتار به متن هستند؛ برای مثال مدل Muse Voice متا اخیراً توانست نرخ خطای تبدیل گفتار به متن را به ۳.۱٪ برساند.
اکوسیستم عاملمحور
علیبابا برای حمایت از توسعهدهندگان، چارچوب Qwen-MM-Plugins را تحت لایسنس Apache-2.0 منتشر کرد. این ابزار به عاملها اجازه میدهد از طریق «مهارتها» (Skills) و سرورهای اختیاری MCP از قابلیتهای چندوجهی بهره ببرند. نصبکننده راهنمای این سیستم از ابزارهایی مثل Claude Code، CodeBuddy، Codex، Qoder، OpenClaw، Qwen Code و Gemini CLI پشتیبانی میکند.
پلاگینهای کلیدی عبارتند از:
- omni-memory: ساخت یک حافظه صوتی-تصویری از ویدیوهای طولانی.
- omni-video2note: تبدیل ویدیوهای آموزشی به فایلهای PDF مصور.
- omni-chatcut: پوشش مواردی چون تبدیل موسیقی به موزیکویدیو (Music-to-MV)، تفسیر فیلم و ترجمه ویدیو با حفظ صدای گوینده.
یک پلاگین اصلی به مدل اجازه میدهد تصاویر محلی و فریمهای ویدیو را بهطور بومی (Native) بخواند. با این حال، یک شکاف فعلی وجود دارد: اکثر رابطها هنوز نمیتوانند صوت را بهطور بومی به مدل اصلی ارسال کنند، بنابراین صوت در حال حاضر از طریق API مسیریابی میشود.
برای کاربران تجاری، این تغییر یعنی هزینه تحلیل آرشیوهای عظیم ویدیو بهشدت سقوط کرده است. با گذار از پردازش خطی به ادراک عاملمحور، ویدیو از یک داده «سنگین» به یک پایگاهداده قابل جستوجو تبدیل شده است.
گام بعدی شما
- اگر از APIهای گرانقیمت برای تحلیل ویدیو استفاده میکنید، مدل Qwen3.8-Omni-Flash را در QwenCloud تست کنید تا کاهش هزینه را بسنجید.
- پلاگینهای Qwen-MM را برای تبدیل ویدیوهای آموزشی به مستندات متنی در گردشکارهای خود به کار بگیرید.
- برای کاهش مصرف توکن، تنظیمات
reasoning_effortرا متناسب با پیچیدگی سؤال خود تغییر دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو