پرش به محتوای اصلی
پرش به محتوای مقاله

۵۵٪ از ورودی‌های محک‌های رسمی Hugging Face متعلق به سازمان‌های چینی است

·۱۲ مهر ۱۴۰۵۴ دقیقه مطالعه
نقشه ۴۸ معیار رسمی Hugging Face: نمای کلی بنچمارک‌های هوش مصنوعی در یک نگاه.
نقشه ۴۸ معیار رسمی Hugging Face: نمای کلی بنچمارک‌های هوش مصنوعی در یک نگاه.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای شکاف میان «جهت‌گیری صنعت» (عامل‌محور) و «رفتار واقعی توسعه‌دهندگان» (تمرکز بر محک‌های ارزان دانش) از طریق تجسم داده‌های رسمی Hugging Face.

اگر به دنبال این هستید که بدانید مدل‌های هوش مصنوعی در دنیای واقعی کجا پیشرفت می‌کنند، باید به جای تبلیغات شرکت‌ها، به داده‌های ثبت‌شده در لیدربوردهای رسمی نگاه کنید. طبق داده‌های استخراج‌شده در ۴ اکتبر ۲۰۲۶، سازمان‌های چینی با تصاحب ۵۵٪ از ورودی‌های رسمی Hugging Face، سیگنالی واضح از تلاش گسترده برای اعتبارسنجی عمومی مدل‌های خود ارسال کرده‌اند. این داده‌ها شکاف عمیقی را میان آنچه صنعت در حال ساختن آن است و آنچه در واقعیت مورد آزمایش قرار می‌گیرد، آشکار می‌کند.

برای سال‌ها، جامعه هوش مصنوعی با مشکل پراکندگی محک‌ها (Benchmark) دست‌وپنجه نرم می‌کرد؛ جایی که هر مجموعه داده در صفحه‌ای مجزا قرار داشت. این نبودِ انسجام باعث می‌شد تقریباً غیرممکن باشد که بفهمیم کدام حوزه‌ها در اولویت قرار دارند یا سازندگان مدل‌ها تلاش‌های خود را بر روی چه بخش‌هایی متمرکز کرده‌اند. همان‌طور که در تحلیل قبلی ما درباره‌ی چالش‌های امنیتی این پلتفرم و واکنش به هک Hugging Face اشاره کردیم، ابزارهای جدید شفافیت اکنون تمرکز را از امنیت به معیارهای عملکرد و میزان مشارکت جابه‌جا کرده‌اند.

سامانه محک‌های رسمی

به نقل از مستندات Hugging Face، این پلتفرم اکنون مجموعه‌ای از داده‌ها را به عنوان «محک‌های رسمی» علامت‌گذاری می‌کند. هر یک از این محک‌ها دارای لیدربوردی است که به‌طور خودکار از فایل‌های .eval_results منتشرشده در مخازن مدل‌ها پر می‌شود.

در حال حاضر ۴۸ محک رسمی وجود دارد که مجموعه‌های برجسته‌ای مانند GPQA Diamond، MMLU-Pro، SWE-bench، Terminal-Bench، AIME 2026 و Open ASR Leaderboard را شامل می‌شود. ابزار جدید «نقشه و مشارکت محک‌های رسمی» (Official Benchmarks: Map and Participation) با خواندن API عمومی پلتفرم در مرورگر، تمام این صفحات پراکنده را در یک نمای زنده تجمیع کرده است.

چشم‌انداز محک‌ها و شکاف مشارکت

توزیع این ۴۸ محک نشان‌دهنده یک چرخش راهبردی به سمت قابلیت‌های خودگردان است:

  • عامل‌ها و وظایف ترمینال: ۱۷ محک (بزرگ‌ترین دسته) که استفاده از ابزار (Tool Use)، وظایف طولانی‌مدت، وب‌گردی و گردش‌های کاری چندمرحله‌ای را می‌سنجند.
  • علوم و دانش: ۶ محک.
  • اسناد و نویسه‌خوانی نوری (OCR): ۵ محک.
  • برنامه‌نویسی، بینایی/ویدیو، حقوق و مالی: هر کدام ۴ محک.
  • ریاضیات: ۳ محک.
  • گفتار و بازیابی (Retrieval): هر کدام ۲ محک.
  • رباتیک: ۱ محک.

بیش از یک‌سوم مجموعه رسمی، عامل‌های هوش مصنوعی (AI Agents) را می‌سنجند که با فضای گفتگوهای صنعتی سال گذشته هم‌راستا است. با این حال، حجم واقعی ثبت نتایج داستان دیگری را می‌گوید. از حدود ۱,۰۲۰ ورودی کل، حوزه علوم و دانش با ۳۴۸ مورد پیشتاز است، در حالی که عامل‌ها و وظایف ترمینال با ۱۹۷ مورد در رتبه دوم قرار دارند.

سایر آمارها شامل برنامه‌نویسی (۱۵۸)، اسناد و OCR (۸۹)، گفتار (۷۲)، ریاضیات (۶۲)، بینایی و ویدیو (۴۷)، حقوق و مالی (۳۹)، بازیابی (۴) و رباتیک (۴) است. بر اساس بررسی منابع متعدد، این تفاوت احتمالاً به این دلیل است که اجرای محک‌هایی مانند GPQA و MMLU-Pro بسیار ارزان‌تر از محک‌های عامل‌محور است که به محیط‌های ایزوله (Sandbox)، هارنس‌های پیچیده و زمان اجرای طولانی نیاز دارند.

تسلط سازمانی و تمرکز داده‌ها

مشارکت‌ها به‌شدت متمرکز است و تنها ۵ لیدربورد ۴۶٪ از کل ورودی‌ها را به خود اختصاص داده‌اند: MMLU-Pro (۱۴۱ مورد)، GPQA (۱۱۱ مورد)، HLE (۸۹ مورد)، SWE-bench Verified (۶۷ مورد) و Open ASR (۶۲ مورد).

میانه تعداد ورودی‌ها در هر محک تنها ۱۲ مورد است و ۱۴ لیدربورد ۵ ورودی یا کمتر دارند. این یعنی رتبه اول در یک لیدربورد خلوت، به‌مراتب کم‌ارزش‌تر از رتبه اول در یک لیدربورد شلوغ است.

از نظر فعالیت سازمانی، حدود ۴۱۰ مدل از ۹۵ سازمان حضور دارند. فعال‌ترین ناشران عبارت‌اند از:

  • Qwen: ۱۳۶ ورودی
  • Z.ai (zai-org): ۸۴ ورودی
  • DeepSeek: ۶۵ ورودی
  • Moonshot AI: ۶۵ ورودی
  • NVIDIA: ۶۳ ورودی
  • Ornith: ۴۸ ورودی
  • OpenAI: ۴۷ ورودی
  • MiniMax: ۳۶ ورودی

سازمان‌های مستقر در آمریکا ۲۳٪ از ورودی‌ها، کره جنوبی ۴٪ و فرانسه ۲٪ را در اختیار دارند. حدود ۱۳٪ از سازمان‌ها هیچ مقر عمومی مشخصی ندارند.

تحلیل محدودیت‌ها

این تغییر نشان می‌دهد در حالی که غرب ممکن است در پژوهش‌های بنیادی پیشرو باشد، آزمایشگاه‌های چینی به‌طور تهاجمی در حال بهینه‌سازی و مستندسازی مدل‌های خود در طیف وسیعی از معیارهای رسمی هستند.

این ابزار (Space) بینش‌های عمیق‌تری را فراهم می‌کند؛ از جمله یک نقشه حرارتی (Heatmap) از اینکه چه کسی در هر حوزه پیشتاز است، درصد شکاف بین رتبه اول و دوم در هر لیدربورد، و مقایسه‌ای بین تعداد لیدربوردهایی که یک سازمان در آن‌ها شرکت کرده در مقابل لیدربوردهایی که در آن‌ها رتبه اول را کسب کرده است.

با این حال، کاربران باید محتاط باشند. این لیدربوردهای بر اساس اعدادی رتبه‌بندی می‌کنند که توسط خودِ نویسندگان گزارش شده است، نه اینکه مدل‌ها را در یک محیط کنترل‌شده اجرا کنند. تفاوت در نمونه‌برداری، رای‌گیری اکثریت (Majority Voting)، فرمت پرامپت‌ها و «بودجه تفکر» (Thinking Budgets) باعث می‌شود این نتایج همیشه به‌طور مستقیم قابل مقایسه نباشند. علاوه بر این، یک سازمان بر اساس فضای نام (Namespace) مخزن مدل تعریف می‌شود؛ بنابراین یک مدل Fine-tune شده که تحت یک فضای نام متفاوت منتشر شده باشد، به حساب آن فضای نام جدید می‌افتد، نه سازنده مدل پایه.

برای مشاهده وضعیت زنده این لیدربوردهای و نقشه حرارتی رهبری، می‌توانید Space رسمی را در Hugging Face بررسی کنید.

گام بعدی شما

  • برای ارزیابی مدل‌های بازمتن، به جای تکیه بر یک عدد، توزیع ورودی‌های لیدربورد را بررسی کنید تا اعتبار رتبه را بسنجید.
  • در صورت توسعه مدل‌های عامل‌محور، از محیط‌های ایزوله برای ثبت نتایج در SWE-bench استفاده کنید تا در لیدربوردهای رسمی دیده شوید.
  • نقشه حرارتی (Heatmap) لیدربوردهای Hugging Face را برای شناسایی حوزه‌هایی که هنوز مدل برتری ندارند (مانند رباتیک) بررسی کنید.

اما داستان سخت‌افزاری این رقابت حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell و تأثیر آن بر استنتاج مدل‌های چینی مراجعه کنید.

چرا این موضوع مهم است؟

این داده‌ها با تکیه بر اعتبار Hugging Face نشان می‌دهند که مرکز ثقل اعتبارسنجی مدل‌ها در حال جابه‌جایی به سمت شرق است. این موضوع باعث می‌شود استانداردهای ارزیابی مدل‌های آینده تحت تأثیر متدولوژی‌های آزمایشگاه‌های چینی قرار بگیرد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی، این نقشه منبعی حیاتی برای شناسایی مدل‌های بازمتنِ بهینه در حوزه‌های خاص (مانند OCR یا حقوق) است تا به‌جای آموزش مدل‌های گران‌قیمت، از مدل‌های پیشرو چینی که در این محک‌ها برنده بوده‌اند استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تضاد میان تعداد محک‌های عامل‌محور و حجم پایین ثبت نتایج در آن‌ها، نشان‌دهنده یک «شکاف اجرایی» در صنعت است؛ همه درباره عامل‌ها حرف می‌زنند، اما هزینه استنتاج و پیچیدگی محیط‌های تست باعث شده اکثر مدل‌ها همچنان در محک‌های ارزان‌قیمت دانش (مانند MMLU) متمرکز بمانند. تسلط عددی چین در این لیدربوردهای رسمی، بیشتر از آنکه نشان‌دهنده برتری مطلق فنی باشد، نشان‌دهنده استراتژی تهاجمی آن‌ها در «بازاریابی داده‌محور» و تلاش برای کسب اعتبار در اکوسیستم بازمتن است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.