آیا یک مدل واحد میتواند سقف فعلی هوش مصنوعی با وزنهای باز را جابهجا کند؟ علیبابا با معرفی مدل Qwen3.8-Max-Preview در ۱۹ ژوئیه ۲۰۲۶، شرطبندی بزرگی روی مقیاس خیرهکننده ۲.۴ تریلیون پارامتر کرده است. با ادعای اینکه این سیستم در بنچمارکهای داخلی تنها پس از Fable 5 قرار دارد، تیم Qwen سیگنالی واضح برای تسلط بر چشمانداز مدلهای سطح بالا (high-end) ارسال کرده است.
این خبر در جریان کنفرانس جهانی هوش مصنوعی (WAIC) در شانگهای منتشر شد و بهطور مستقیم با Moonshot AI برخورد کرد. تنها دو روز پیش از این، Moonshot مدل Kimi K3 را با ۲.۸ تریلیون پارامتر به صورت وزنهای باز معرفی کرده بود. این رقابت تنگاتنگ در واقع بازتابی از تغییر استراتژی رقابتی چین در برابر مدلهای آمریکایی است که در آن تمرکز بر «قدرت خالص» و مقیاس مدلها افزایش یافته است. این چرخه سریع انتشار نشان میدهد که یک نبرد استراتژیک برای تسلط بر بخش هوش مصنوعی چین در جریان است، جایی که «مقیاس مدل» در حال تبدیل شدن به اصلیترین اهرم بازاریابی است.
علیبابا با تکیه بر مسیر عرضه مدلهای قبلی، اکنون به سمت معماریهای عظیم ترکیب خبرهها (Mixture-of-Experts یا MoE) حرکت کرده است تا میان قدرت خام و کارایی استنتاج (Inference) تعادل ایجاد کند. با این حال، به نظر میرسد زمانبندی این پیشنمایش کاملاً حسابشده بوده است تا تکانهای که انتشار وزنهای Kimi K3 ایجاد کرده بود را کند یا خنثی کند.
همانطور که در تحلیلهای پیشین ما دربارهی رقابت مدلهای بازمتن در شرق آسیا اشاره کردیم، جنگ مقیاس اکنون جایگزین بهینهسازیهای خرد شده است.
دسترسی و بستر اجرا
نسخه پیشنمایش در حال حاضر واقعی و قابل خرید است. دسترسی به این مدل از طریق اشتراک Token Plan علیبابا مدیریت میشود. برای کاهش موانع پیش روی آزمایشکنندگان اولیه، این پیشنمایش در حال حاضر با ۱۰٪ قیمت استاندارد عرضه شده است.
شوای بای (Shuai Bai)، توسعهدهنده این پروژه، در جریان عرضه شفافیتهای فنی بیشتری ارائه داد. او Qwen3.8 را به عنوان نخستین مدل چندوجهی (Multimodal) این تیم توصیف کرد که از مرز ۱ تریلیون پارامتر عبور میکند. این معماری به مدل اجازه میدهد ورودیهای متنوعی شامل متن، تصاویر، ویدیوها و اسناد پیچیده را بهطور همزمان پردازش کند.
علیبابا ادعا میکند که این تکرار (Iteration) جدید باید بهطور مشخص در زمینههای کدنویسی، توسعه فولاستک، تحلیل دادهها و گردشهای کاری عمومی اداری، عملکرد بهتری نسبت به Qwen3.7-Max داشته باشد.
مشخصات فنی تاییدشده
به گزارش Marktechpost، چندین جزئیات کلیدی در مورد این پیشنمایش مورد تایید است:
- دسترسی: پیشنمایش فعال است و از طریق Alibaba Token Plan، Qoder و QoderWork قابل خرید است.
- قیمتگذاری: دسترسی فعلاً با ۱۰٪ قیمت استاندارد ارائه میشود تا پذیرش اولیه مدل تشویق شود.
- معماری: این یک مدل چندوجهی Sparse MoE است. این نخستین سیستم چندوجهی Qwen است که از آستانه ۱ تریلیون پارامتر عبور کرده است.
- قابلیتها: مدل بهطور بومی متن، تصویر، ویدیو و اسناد را پردازش میکند و هدف آن ارتقای تواناییها نسبت به Qwen3.7-Max در بخش کدنویسی و تحلیل داده است.
- یکپارچگی: مدل سازگاری کامل با پروتکلهای OpenAI و Anthropic را حفظ کرده است. این بدان معنای است که عاملهای کدنویسی (Coding Agents) موجود میتوانند بدون نیاز به بازسازی چارچوبهای خود، مستقیماً به Qwen3.8 متصل شوند.
شکاف میان ادعاست و واقعیت
با وجود اعداد جسورانه، بخش بزرگی از این معرفی تاییدنشده باقی مانده است. علیبابا مقیاس ۲.۴ تریلیون پارامتر را ادعا میکند، اما هیچ کارت مدل (Model Card) یا مشخصات رسمی برای پشتیبانی از این عدد ارائه نداده است. بنابراین، تعداد پارامترها فعلاً یک «ادعای» علیبابا است، نه یک رقم تاییدشده فنی.
علاوه بر این، ادعای اینکه مدل «تنها پس از Fable 5 قرار دارد» کاملاً بر محور ارزیابیهای داخلی استوار است. تا تاریخ ۱۹ ژوئیه ۲۰۲۶ هیچ جدول بنچمارکی منتشر نشده است. تا زمان انتشار چنین جدولی، هر عدد مربوط به قابلیتهای Qwen3.8 در واقع همان اعداد Qwen3.7-Max است که به عنوان جایگذار استفاده شده است.
حیاتیترین نکته این است که وعدهی «انتشار بهزودی وزنهای باز»، فاقد تاریخ دقیق، توافقنامه مجوز یا مخزن در Hugging Face است. کاربران بالقوه باید توجه کنند که دو پرچمدار قبلی سری Max علیبابا به صورت مدلهای بسته عرضه شدند، که این موضوع تردیدها را درباره انتشار واقعی وزنها در آینده افزایش میدهد.
واقعیت سختافزاری ۲.۴ تریلیون پارامتر
از دیدگاه فنی، عدد ۲.۴ تریلیون پارامتر بدون دانستن «پارامترهای فعال» (Active Parameters) در هر توکن، گمراهکننده است. پارامترهای کل، میزان اشغال حافظه (Memory Footprint) را تعیین میکنند، اما پارامترهای فعال هزینه سرویسدهی را مشخص میکنند. این تمایز در مدلهای قبلی مشهود است؛ برای مثال Qwen3-235B-A22B در مجموع ۲۳۵ میلیارد پارامتر دارد اما برای هر توکن تنها ۲۲ میلیارد پارامتر را فعال میکند. به همین ترتیب، Qwen3-30B-A3B تقریباً ۳ میلیارد پارامتر را فعال میکند.
اگر مدل کامل ۲.۴ تریلیون پارامتری به صورت یک فایل وزن متراکم (Dense) با دقت FP8 عرضه شود، تنها برای وزنها به ۴.۸ ترابایت VRAM نیاز دارد. این یعنی نیاز به حدود ۳۵ کارت Nvidia H200 (با حافظه ۱۴۱ گیگابایت هر کدام) پیش از محاسبه KV Cache و سربارهای زمان اجرا. نشریه Startup Fortune برآورد میکند که حتی با دقت ۴-بیت، وزنها به تنهایی به ۱.۲ ترابایت حافظه نیاز دارند.
بارگذاری چنین مدلی مستلزم ۲۰ تا ۳۰ درصد حافظه اضافی برای مدیریت KV Cache و زمان اجرا است. چون تعداد پارامترهای فعال اعلام نشده، هزینه واقعی سرویسدهی این مدل Sparse MoE را نمیتوان محاسبه کرد.
برای کاربردی شدن، علیبابا باید یا یک نسخهی بهشدت کوانتیده (Quantized)، یا یک برادر کوچکتر حاصل از distillation، یا یک مدل MoE بسیار پراکنده عرضه کند. جامعه توسعهدهندگان بهطور خاص منتظر یک نسخه میانرده MoE (بین ۳۵ تا ۱۲۲ میلیارد پارامتر) هستند تا تعادلی میان سرعت و توانایی در سختافزارهای غیر مرکز-داده (Home Rigs) ایجاد شود.
واکنش بازار و جامعه
احساسات توسعهدهندگان در X، ردیت و Hacker News محتاطانه مثبت اما ریشه در پراگماتیسم دارد. بررسی نمونهای از ۱۳۰ پست، ترکیبی از ۵۸٪ مثبت، ۲۹٪ شکاک و ۱۳٪ خنثی را نشان داد.
در r/LocalLLaMA، کاربران روی ریاضیات سرویسدهی تمرکز کردند. آنها اشاره کردند که یک گره H200 نمیتواند مدل ۲.۴ تریلیون پارامتری را بدون کوانتش شدید میزبانی کند. با این حال، کاربران ارزش مدلهای محلی Qwen را برای دادههای خصوصی تایید کردند و اشاره کردند که نسخههای Dense 27B و MoE 35B در حال حاضر اکثر نیازهای آنها را پوشش میدهد.
در X، حسابهای بزرگی مانند kimmonismus خط «وزنهای باز بهزودی» را بازتاب دادند و این اتفاق را پیروزی چین توصیف کردند، در حالی که آزمایشگاههای پیشرو آمریکا مدلهای خود را بسته نگه داشتهاند. برخی کاربران عنوان «دومین مدل بعد از Fable 5» را محرک اصلی برای اشتراکگذاری اجتماعی این خبر دانستند.
کاربران Hacker News رقابت آزمایشگاههای چینی را یک نکته مثبت دیدند زیرا باعث کالامدار شدن (Commoditization) قابلیتهای سطح پیشرو میشود. با این حال، برخی منتقدان Qwen را «پرنسس بنچمارک» نامیدند و پیشنهاد کردند که رتبههای داخلی لزوماً به کاربرد واقعی در دنیای واقعی ترجمه نمیشوند. برخی دیگر عبارت «دومین مدل بعد از Fable 5» را به معنای پذیرش ضمنی این نکته تفسیر کردند که Anthropic همچنان برتری واقعی را در دست دارد.
در حالی که علیبابا مرزهای مقیاس را جابهجا میکند، Moonshot AI با مشکلی متضاد روبروست. گزارشهای dev.to حاکی از آن است که Moonshot به دلیل فشار شدید بر ظرفیت محاسباتی پس از عرضه K3، ثبتنامهای جدید شخصی برای Kimi را متوقف کرده است.
این یک تضاد آشکار است: علیبابا از زیرساخت عظیم خود برای ارائه پیشنمایشهای تخفیفخورده استفاده میکند، در حالی که رقبای کوچکتر برای تامین سختافزار لازم جهت سرویسدهی به دستاوردهای خود در تکاپو هستند.
برای متخصصان فنی، ارزش واقعی Qwen3.8 با تعداد کل پارامترها تعیین نمیشود، بلکه بستگی به این دارد که آیا علیبابا یک نسخه میانرده MoE منتشر میکند یا خیر. چشمها به انتشار رسمی کارت مدل و وزنها در Hugging Face است، زیرا این اسناد — و نه چتِ پیشنمایش — تعیین میکنند که آیا Qwen3.8 یک جهش واقعی در مرزهای فناوری است یا صرفاً یک مانور بازاریابی.
گام بعدی شما
اگر توسعهدهنده هستید، سازگاری مدل با پروتکلهای OpenAI را برای تست در پروژههای فعلی بررسی کنید.
منتظر انتشار کارت مدل (Model Card) در Hugging Face باشید تا اعداد واقعی پارامترهای فعال مشخص شود.
برای مقایسه هزینه استنتاج این مدل با نسخههای قبلی، تحلیل ما درباره تفاوتهای Sparse MoE و Dense را دنبال کنید. اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو