اگر به دنبال این هستید که بدانید مدلهای هوش مصنوعی در دنیای واقعی کجا پیشرفت میکنند، باید به جای تبلیغات شرکتها، به دادههای ثبتشده در لیدربوردهای رسمی نگاه کنید. طبق دادههای استخراجشده در ۴ اکتبر ۲۰۲۶، سازمانهای چینی با تصاحب ۵۵٪ از ورودیهای رسمی Hugging Face، سیگنالی واضح از تلاش گسترده برای اعتبارسنجی عمومی مدلهای خود ارسال کردهاند. این دادهها شکاف عمیقی را میان آنچه صنعت در حال ساختن آن است و آنچه در واقعیت مورد آزمایش قرار میگیرد، آشکار میکند.
برای سالها، جامعه هوش مصنوعی با مشکل پراکندگی محکها (Benchmark) دستوپنجه نرم میکرد؛ جایی که هر مجموعه داده در صفحهای مجزا قرار داشت. این نبودِ انسجام باعث میشد تقریباً غیرممکن باشد که بفهمیم کدام حوزهها در اولویت قرار دارند یا سازندگان مدلها تلاشهای خود را بر روی چه بخشهایی متمرکز کردهاند. همانطور که در تحلیل قبلی ما دربارهی چالشهای امنیتی این پلتفرم و واکنش به هک Hugging Face اشاره کردیم، ابزارهای جدید شفافیت اکنون تمرکز را از امنیت به معیارهای عملکرد و میزان مشارکت جابهجا کردهاند.
سامانه محکهای رسمی
به نقل از مستندات Hugging Face، این پلتفرم اکنون مجموعهای از دادهها را به عنوان «محکهای رسمی» علامتگذاری میکند. هر یک از این محکها دارای لیدربوردی است که بهطور خودکار از فایلهای .eval_results منتشرشده در مخازن مدلها پر میشود.
در حال حاضر ۴۸ محک رسمی وجود دارد که مجموعههای برجستهای مانند GPQA Diamond، MMLU-Pro، SWE-bench، Terminal-Bench، AIME 2026 و Open ASR Leaderboard را شامل میشود. ابزار جدید «نقشه و مشارکت محکهای رسمی» (Official Benchmarks: Map and Participation) با خواندن API عمومی پلتفرم در مرورگر، تمام این صفحات پراکنده را در یک نمای زنده تجمیع کرده است.
چشمانداز محکها و شکاف مشارکت
توزیع این ۴۸ محک نشاندهنده یک چرخش راهبردی به سمت قابلیتهای خودگردان است:
- عاملها و وظایف ترمینال: ۱۷ محک (بزرگترین دسته) که استفاده از ابزار (Tool Use)، وظایف طولانیمدت، وبگردی و گردشهای کاری چندمرحلهای را میسنجند.
- علوم و دانش: ۶ محک.
- اسناد و نویسهخوانی نوری (OCR): ۵ محک.
- برنامهنویسی، بینایی/ویدیو، حقوق و مالی: هر کدام ۴ محک.
- ریاضیات: ۳ محک.
- گفتار و بازیابی (Retrieval): هر کدام ۲ محک.
- رباتیک: ۱ محک.
بیش از یکسوم مجموعه رسمی، عاملهای هوش مصنوعی (AI Agents) را میسنجند که با فضای گفتگوهای صنعتی سال گذشته همراستا است. با این حال، حجم واقعی ثبت نتایج داستان دیگری را میگوید. از حدود ۱,۰۲۰ ورودی کل، حوزه علوم و دانش با ۳۴۸ مورد پیشتاز است، در حالی که عاملها و وظایف ترمینال با ۱۹۷ مورد در رتبه دوم قرار دارند.
سایر آمارها شامل برنامهنویسی (۱۵۸)، اسناد و OCR (۸۹)، گفتار (۷۲)، ریاضیات (۶۲)، بینایی و ویدیو (۴۷)، حقوق و مالی (۳۹)، بازیابی (۴) و رباتیک (۴) است. بر اساس بررسی منابع متعدد، این تفاوت احتمالاً به این دلیل است که اجرای محکهایی مانند GPQA و MMLU-Pro بسیار ارزانتر از محکهای عاملمحور است که به محیطهای ایزوله (Sandbox)، هارنسهای پیچیده و زمان اجرای طولانی نیاز دارند.
تسلط سازمانی و تمرکز دادهها
مشارکتها بهشدت متمرکز است و تنها ۵ لیدربورد ۴۶٪ از کل ورودیها را به خود اختصاص دادهاند: MMLU-Pro (۱۴۱ مورد)، GPQA (۱۱۱ مورد)، HLE (۸۹ مورد)، SWE-bench Verified (۶۷ مورد) و Open ASR (۶۲ مورد).
میانه تعداد ورودیها در هر محک تنها ۱۲ مورد است و ۱۴ لیدربورد ۵ ورودی یا کمتر دارند. این یعنی رتبه اول در یک لیدربورد خلوت، بهمراتب کمارزشتر از رتبه اول در یک لیدربورد شلوغ است.
از نظر فعالیت سازمانی، حدود ۴۱۰ مدل از ۹۵ سازمان حضور دارند. فعالترین ناشران عبارتاند از:
- Qwen: ۱۳۶ ورودی
- Z.ai (zai-org): ۸۴ ورودی
- DeepSeek: ۶۵ ورودی
- Moonshot AI: ۶۵ ورودی
- NVIDIA: ۶۳ ورودی
- Ornith: ۴۸ ورودی
- OpenAI: ۴۷ ورودی
- MiniMax: ۳۶ ورودی
سازمانهای مستقر در آمریکا ۲۳٪ از ورودیها، کره جنوبی ۴٪ و فرانسه ۲٪ را در اختیار دارند. حدود ۱۳٪ از سازمانها هیچ مقر عمومی مشخصی ندارند.
تحلیل محدودیتها
این تغییر نشان میدهد در حالی که غرب ممکن است در پژوهشهای بنیادی پیشرو باشد، آزمایشگاههای چینی بهطور تهاجمی در حال بهینهسازی و مستندسازی مدلهای خود در طیف وسیعی از معیارهای رسمی هستند.
این ابزار (Space) بینشهای عمیقتری را فراهم میکند؛ از جمله یک نقشه حرارتی (Heatmap) از اینکه چه کسی در هر حوزه پیشتاز است، درصد شکاف بین رتبه اول و دوم در هر لیدربورد، و مقایسهای بین تعداد لیدربوردهایی که یک سازمان در آنها شرکت کرده در مقابل لیدربوردهایی که در آنها رتبه اول را کسب کرده است.
با این حال، کاربران باید محتاط باشند. این لیدربوردهای بر اساس اعدادی رتبهبندی میکنند که توسط خودِ نویسندگان گزارش شده است، نه اینکه مدلها را در یک محیط کنترلشده اجرا کنند. تفاوت در نمونهبرداری، رایگیری اکثریت (Majority Voting)، فرمت پرامپتها و «بودجه تفکر» (Thinking Budgets) باعث میشود این نتایج همیشه بهطور مستقیم قابل مقایسه نباشند. علاوه بر این، یک سازمان بر اساس فضای نام (Namespace) مخزن مدل تعریف میشود؛ بنابراین یک مدل Fine-tune شده که تحت یک فضای نام متفاوت منتشر شده باشد، به حساب آن فضای نام جدید میافتد، نه سازنده مدل پایه.
برای مشاهده وضعیت زنده این لیدربوردهای و نقشه حرارتی رهبری، میتوانید Space رسمی را در Hugging Face بررسی کنید.
گام بعدی شما
- برای ارزیابی مدلهای بازمتن، به جای تکیه بر یک عدد، توزیع ورودیهای لیدربورد را بررسی کنید تا اعتبار رتبه را بسنجید.
- در صورت توسعه مدلهای عاملمحور، از محیطهای ایزوله برای ثبت نتایج در SWE-bench استفاده کنید تا در لیدربوردهای رسمی دیده شوید.
- نقشه حرارتی (Heatmap) لیدربوردهای Hugging Face را برای شناسایی حوزههایی که هنوز مدل برتری ندارند (مانند رباتیک) بررسی کنید.
اما داستان سختافزاری این رقابت حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell و تأثیر آن بر استنتاج مدلهای چینی مراجعه کنید.




گفتگو