اگر امروز به دنبال قدرتمندترین مدلهای متنباز برای استقرار در مقیاس صنعتی هستید، باید نگاهتان را از سیلیکونولی به شرق بدانی؛ چرا که سقف توانمندیهای مدلهای باز اکنون در چین تعریف میشود. طبق تحلیل فنی منتشر شده توسط Hugging Face در ۱۴ اوت ۲۰۲۶، آزمایشگاههای چینی با جهشی سریع، مراحل میانی رشد را رد کرده و مستقیماً به سراغ انتشار مدلهای بزرگترین و کارآمدترین مدلهای باز رفتهاند. این تغییر رویکرد بهطور مؤثری مرکز ثقل هوش مصنوعی با وزنهای باز را به شرق منتقل کرده است.
این تحول در حالی رخ میدهد که اکوسیستم متنباز به دو اقتصاد مجزا تقسیم شده است: یکی متمرکز بر بنچمارکهای مقیاس مرزی (Frontier-scale) و دیگری متمرکز بر نیازهای عملیاتی استقرار محلی. در حالی که پیش از این صنعت برای تعریف چشمانداز وزنهای باز به غولهای آمریکایی مانند Meta و Google چشم دوخته بود، دادههای سال ۲۰۲۶ نشاندهنده گذاری است که در آن اکنون تامینکنندگان سختافزار و آزمایشگاههای بینالمللی سرعت پیشرفت را دیکته میکنند. این تغییر استراتژیک در حالی رخ میدهد که سیاستهای جدید متا در مواجهه با مدلهای عظیم چینی نشاندهنده تغییر رویکرد غولهای آمریکایی به سمت مدلهای بسته است.
همانطور که در تحلیل قبلی ما دربارهی استراتژیهای انتشار ۲۶ مدل باز توسط Microsoft برای استارتاپها اشاره کردیم، روند فعلی نشان میدهد که استراتژی «باز بودن» دیگر صرفاً برای دسترسی همگانی نیست، بلکه ابزاری برای جایگاهیابی استراتژیک در اکوسیستم و افزایش فروش سختافزار است.
رشد و توزیع اکوسیستم
به گزارش Hugging Face، بین ژانویه تا اوت ۲۰۲۶، رشد این پلتفرم شتاب گرفته است. مخازن مدلهای عمومی از ۲.۴۳ میلیون به ۲.۹۶ میلیون مورد افزایش یافت. مجموعهدادهها از ۷۱۱ هزار مورد به ۱ میلیون و محیطهای Spaces از ۱ میلیون به ۱.۴۴ میلیون مورد رسیدند.
با این حال، توزیع توجه کاربران بهشدت نامتوازن است. حدود ۸۵.۶٪ از تمام مدلها کمتر از ۲۰۰ بار در طول عمر خود دانلود شدهاند. بخش بسیار کوچکی از اکوسیستم — تنها ۱.۵٪ از مخازن — مسئول ۹۹.۲٪ از کل دانلودها هستند.
شکاف در مقیاس مرزی
در سال ۲۰۲۶، فاصله بین سقف مدلهای باز آمریکایی و چینی به نقطه بحرانی رسید. آزمایشگاههای چینی سقف ماهانه خود را بین ۷۵۴ میلیارد تا ۲.۷۸ تریلیون پارامتر (Parameters) نگه داشتند. در مقابل، سقف مدلهای آمریکایی در پنج ماه نخست از هفت ماه اول سال، زیر ۱۳۰ میلیارد پارامتر باقی ماند.

تنها چند مدل آمریکایی توانستند این سقف را بشکنند؛ از جمله Inkling محصول Thinking Machines با ۹۵۲ میلیارد پارامتر، Nemotron 3 Ultra از NVIDIA با ۵۶۱ میلیارد، Nemotron 3 Super با ۱۲۴ میلیارد و Trinity-Large از Arcee AI با ۳۹۹ میلیارد پارامتر. اکثر مدلهای بزرگ دیگر منتشر شده در آمریکا، مدلهای اصلی نبودند، بلکه بهینهسازیهایی از وزنهای چینی بودند که برای اجرا روی سختافزارهای آمریکایی طراحی شده بودند.

آزمایشگاههای چینی دو استراتژی متمایز در سبد محصولات خود دنبال میکنند:
- تمرکز بر مرز (Frontier-Only): آزمایشگاههایی مثل Moonshot، MiniMax، Xiaomi و Z.ai تقریباً هیچ مدلی زیر ۷۰ میلیارد پارامتر منتشر نمیکنند. آنها اعتبار خود را بر پایه تسلط بر بنچمارکها و تقاضای API بنا میکنند. شرکتهای شیائومی و میتوان (Meituan) هر دو در سال جاری از مرز تریلیون پارامتر عبور کردند، در حالی که دوازده ماه پیش هیچکدام نامهای شناختهشدهای در حوزه وزنهای باز نبودند.
- پوشش کامل (Full Spectrum): Tencent و Alibaba Qwen تمام طیفها، از مدلهای زیر ۱ میلیارد تا تریلیون-پارامتر را پوشش میدهند. این یک تلاش برای تبدیل شدن به خانوادهای است که توسعهدهندگان برای تمام موارد استفاده، بر اساس آن استانداردسازی کنند.
این تفاوت استراتژیک منطقی است. یک سبد محصول «فقط مرزی» برای کسب جایگاه در بنچمارکها و جذب تقاضای API است. یک سبد «طیف کامل» هدفش تبدیل شدن به استاندارد کل جامعه توسعهدهندگان است. توانایی ارسال تنها مدلهای بزرگ اکنون به این دلیل ممکن شده است که لایه کوانتش جامعه، مدلهای بزرگ را ظرف چند روز قابل اجرا میکند و نیاز آزمایشگاهها به انتشار نسخههای کوچکتر و «در دسترس» در ابتدا را از بین برده است.
سختافزارسازان؛ ناشران جدید مدلها
در حالی که آزمایشگاههای مدل در حال تغییر مسیر بودند، شرکتهای سختافزاری جای خالی آنها را پر کردند. AMD و NVIDIA فعالترین ناشران مدلهای باز در سال ۲۰۲۶ بودند و هر کدام بیش از ۲۰۰ مخزن جدید ایجاد کردند. LiquidAI نیز با حدود ۱۰۰ انتشار در رتبه سوم قرار گرفت.

این یک چرخش راهبردی است: مدلهای باز اکنون به عنوان ابزار اصلی برای فروش تراشهها استفاده میشوند. تامینکنندگان با ارائه مدلی که برای سختافزار خاص آنها بهینه شده، اثبات فوری عملکرد (Proof of Performance) ارائه میدهند. در نتیجه، جنبش متنباز از آزمایشگاههای پژوهشی خالص به شرکتهای زیرساختی و سختافزاری منتقل شده است.
مشارکت ایالات متحده همچنان قابل توجه است، به ویژه اگر مدلهای کوچکتر و مدلهای Embedding از گوگل، مایکروسافت، IBM Granite و مدلهای قدیمیتر بینایی و گفتار OpenAI را که سالانه صدها میلیون دانلود ایجاد میکنند، در نظر بگیریم. با این حال، مرکز ثقل تغییر کرده است؛ گوگل و متا اکنون در تعداد انتشار مدلهای جدید بسیار پایینتر از انویدیا قرار دارند، که بخشی از آن به دلیل حرکت متا به سمت مدلهای پرچمدار بسته است.
علاوه بر این، یک رقابت معکوس در حال ظهور است. در حالی که شرکتهای آمریکایی مانند AMD تبدیلهایی را ارائه میدهند تا مدلهای تریلیون-پارامتری چینی روی سختافزار آمریکایی اجرا شوند، مدلهای باز چینی بهطور فزایندهای بهطور خاص برای تراشههای داخلی چین بهینه میشوند.
تضاد میان توجه و پذیرش
Hugging Face متوجه گسست شدیدی بین آنچه جامعه «پسند» میکند و آنچه «استفاده» میکند شده است. در بررسی ۲۵ مخزن برتر از نظر دانلود در برابر لایکهای accumulated در سال جاری، تنها یک مخزن در هر دو لیست حضور داشت.

لایکها معیاری برای هیجان هستند و معمولاً مدلهای مرزی را بلافاصله پس از انتشار دنبال میکنند. اما دانلودها نشاندهنده زیرساختها هستند. هیچ مدلی که در سال ۲۰۲۶ منتشر شده، به لیست ۲۵ مدل برتر دانلودها راه نیافت، در حالی که ۱۳ مورد از آنها متعلق به سال ۲۰۲۲ بودند. برای مثال، مدل all-MiniLM-L6-v2 در هفت ماه ۱.۵۵ میلیارد بار دانلود شد در حالی که تنها ۵,۱۵۶ لایک داشت، اما مدل Kimi-K3 به ازای هر لایکی که دریافت کرد، تقریباً ۶۰ بار دانلود شد.

این شکاف در دادههای چینی مشهود است. استراتژی «فقط مرزی» Moonshot منجر به ۳۷ میلیون دانلود شد. در مقابل، رویکرد «طیف گسترده» Qwen به ۲,۰۴۵ میلیون دانلود (در مخازنی با تعداد پارامتر اعلام شده) رسید که تقریباً ۵۵ برابر حجم بیشتر است. با احتساب تمام مخازن، Qwen به ۲,۰۶۱ میلیون دانلود رسید.
پذیرش مدلها عمدتاً در چند ماه اول انتشار تعیین میشود. اکثر مدلها پس از انتشار دچار کاهش شدید ترافیک میشوند و سپس یک دنباله طولانی از فعالیتهای پایدار را تجربه میکنند. این توضیح میدهد چرا حجم فعلی توسط زیرساختهای تثبیت شده هدایت میشود و نه توسط جدیدترین انتشارها.
ظهور اکوسیستم Qwen
مدل Qwen عملاً به مدل پایه جامعه تبدیل شده است. این مدل اکنون ۱۵۱,۴۴۸ مشتق در Hub دارد که ۲.۶ برابر کل ردپای Meta و ۴.۷ برابر تعداد مخازن Llama است. گوگل با ۸۲,۵۰۶ مشتق در رتبه بعدی قرار دارد.

سه عامل این سلطه را رقم زد:
۱. تداوم: یک ریتم منظم در انتشار، که به جای تکیه بر مدلهای پرچمدار گاهبهگاه، خانواده مدلها را بهطور مداوم بهروزرسانی میکند.
۲. پوشش: مدلهایی برای هر اندازه و هر مورد استفاده، از Qwen 3.8 Max با ۲.۴ تریلیون پارامتر تا نسخههای کوچکتر ۲۷ میلیاردی.
۳. باز بودن: استفاده از لایسنس Apache 2.0 که اصطکاک را برای تغییرات و استفاده تجاری حذف میکند.
این جایگاه توسط جامعه ساخته شده است. از ۲۸,۵۳۱ تبدیل GGUF مدلهای Qwen در Hub، خودِ Qwen تنها ۵۴ مورد را منتشر کرده است. مشتقات Qwen در هفت ماه اول سال ۲۰۲۶ با نرخ ۱۸۰ تا ۲۱۰ مخزن جدید در روز افزایش یافتهاند.
لایه عملیاتی و استنتاج محلی
با وجود هیاهوی مدلهای تریلیونی، مدلهای کوچک (زیر ۱ میلیارد پارامتر) همچنان ۸۳٪ از کل دانلودهای تمام دوران را تشکیل میدهند. مدلهای بالای ۱۰۰ میلیارد پارامتر تنها ۱٪ سهم دارند. حتی با محدود کردن دادهها به سال ۲۰۲۶، تنها ۳٪ از حجم دانلودها به مدلهای بالای ۷۰ میلیارد پارامتر اختصاص دارد.

با این حال، سقف استنتاج (Inference) محلی توسط llama.cpp بالا رفته است. ادغام تیم ggml در Hugging Face در فوریه ۲۰۲۶، منابع لازم برای اجرای مدلهای عظیم روی سختافزارهای مصرفکننده را فراهم کرد. این امر اجازه میدهد یک مدل Mixture-of-Experts تریلیون-پارامتری بین چند ماشین مصرفکننده توزیع شود.
جزئیات استنتاج محلی:
- قابلیتهای جدید: در اسنپشات جولای، بیلدهای GGUF از DeepSeek-V4-Flash (حدود ۲۸۴ میلیارد پارامتر) و Kimi-K3 (حدود ۲.۸ تریلیون پارامتر) گنجانده شدهاند.
- روندهای ترافیکی: Qwen با ۳۹.۶ میلیون دانلود ماهانه در GGUF پیشتازی میکند که تقریباً دو برابر Gemma (۲۰.۸ میلیون) و بیش از پنج برابر Llama (۷.۵ میلیون) است. مخازن GGUF مشتق شده از Llama کمی بیشتر از Qwen هستند، اما تنها یکپنجم ترافیک را دریافت میکنند.
- نرخ رشد: در حالی که مخازن مدل ۲۱.۵٪ رشد کردند، لایه زیرساختی بسیار سریعتر رشد کرد. مخازنی که کتابخانه gguf را اعلام کردند ۴۶۴٪، lerobot ۱۹۴٪ و mlx اپل ۱۴۸٪ رشد داشتند، در حالی که این رقم برای transformers و peft تنها ۱۶٪ و برای diffusers حدود ۲۱٪ بود.
آزمایشگاهها در حال حاضر نسخههای رسمی GGUF بسیار کمی منتشر میکنند. اکثر کاربران محلی به مشارکتکنندگان جامعه مانند Unsloth متکی هستند. ارائه تبدیلهای رسمی و مستندسازی انتخابهای کوانتش میتواند شکاف بین وزنهای تست شده توسط سازندگان و وزنهای پذیرفته شده توسط جامعه را کاهش دهد.
لایسنس به عنوان استراتژی رشد
ارزش دیگر از طریق هزینههای لایسنس انباشته نمیشود. از ۱۷۸ مدل منتشر شده چینی بالای ۲۰ میلیارد پارامتر، ۵۹٪ لایسنس Apache 2.0 و ۲۲٪ لایسنس MIT دارند. دقیقاً صفر درصد آنها محدودیتهای غیرتجاری دارند. DeepSeek و Z.ai مدلهایی بین ۷۰۰ میلیارد تا ۱.۶۵ تریلیون پارامتر را تحت لایسنس ساده MIT عرضه میکنند.

در مقابل، ۴۱٪ از مدلهای مشابه آمریکایی از شرایط سفارشی استفاده کردند و ۳۰٪ هیچ لایسنسی را اعلام نکردند. این نشان میدهد آزمایشگاههای چینی از وزنهای باز برای راندن کاربران به سمت کسبوکار API، پذیرش ابری و افزایش ارزش شرکت (مانند Z.ai و Kimi) استفاده میکنند، نه برای درآمد مستقیم از لایسنس.
عاملها به عنوان کاربر اصلی
تا جولای ۲۰۲۶، پدیده جدیدی ظهور کرد: عاملهای هوش مصنوعی (AI Agents) به کاربران غالب Hub تبدیل شدند. با استفاده از توکن agent/<name>، Hugging Face اکنون میتواند ترافیک عاملها را ردیابی کند. Claude Code در جولای با ۴۴.۴٪ پیشتازی کرد، هرچند در آوریل ۶۷.۸٪ سهم داشت و در می به ۶.۴٪ سقوط کرد. در همین حال، Codex بهطور مستمر از ۱۰.۴٪ به ۲۰.۸٪ صعود کرد.
این بازار بسیار نوسانی است. در جولای، نزدیک به ۲۵٪ از ترافیک تگ شده به عنوان عامل از Harnessهای بدون نام بود؛ در حالی که در می این رقم ۵۹.۸٪ بود. بین آوریل و جولای، بیش از دوازده شناسه کلاینت جدید ظاهر شدند.
زیرساخت و امنیت عاملها:
- خوانایی ماشینی: Hugging Face در مارس Markdown ماشینی برای مقالات و در آوریل نقاط انتهایی
agents.mdرا برای Gradio Spaces معرفی کرد تا عاملها بتوانند API یک Space را بخوانند و مستقیماً آن را فراخوانی کنند. - ابزارها: جولای شاهد معرفی ابزار
hf_fsروی سرور MCP بود که مخازن و مستندات را در حدود ۱۰۰۰ توکن در دسترس قرار میدهد و دارای Sandboxهای قابل اتصال برای اجرای امن است. - پروتکل: پروتکل MCP (Model Context Protocol) به Agentic AI Foundation در بنیاد لینوکس منتقل شده است.
- حادثه امنیتی: در جولای، یک عامل خودمختار اولین نفوذ مستند و مستمر به Hugging Face را انجام داد. در حالی که مدلهای بسته مرزی به دلیل حفاظهای ایمنی (Safety Guardrails) از تحلیل کد حمله خودداری کردند، این تحلیل با موفقیت توسط یک مدل باز و کوانتیده به نام GLM-5.2 انجام شد. این توانمندی در تحلیلهای پیچیده امنیتی، همسو با این واقعیت است که مدلهای وزنباز در بازه زمانی کوتاهی به سطح توانمندیهای سایبری مدلهای پیشرو رسیدهاند.
برای متخصصان فنی، این بدان معنای است که «بهترین» مدل دیگر صرفاً مدلی با بالاترین بنچمارک نیست، بلکه مدلی است که قدرتمندترین اکوسیستم کوانتش و بازترین لایسنس را برای مشتقات پاییندستی دارد.
منتظر ادغام مستمر Agentic AI Foundation بنیاد لینوکس و نحوه استانداردسازی پروتکل برای تعامل عاملها با هابهای مدل باشید.
گام بعدی شما
- اگر توسعهدهنده هستید، بررسی کنید که آیا مدلهای خانواده Qwen به دلیل اکوسیستم گستردهتر GGUF، جایگزین بهتری برای Llama در محیطهای محلی هستند یا خیر.
- برای کاهش هزینههای استنتاج در مقیاس بالا، لایسنسهای MIT مدلهای چینی را برای استقرار درونسازمانی بررسی کنید.
- اگر از عاملهای هوش مصنوعی استفاده میکنید، پروتکل MCP را برای اتصال امنتر عاملها به مخازن مدل دنبال کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو