پرش به محتوای اصلی
پرش به محتوای مقاله

۵ تصمیم کلیدی که آمارهای رشد مقالات هوش مصنوعی را تخریب می‌کنند

·۱۷ مرداد ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
راهنما
نمودار تعداد مقالات هوش مصنوعی منتشرشده سالانه و پرس‌وجوی شمارش آن‌ها
نمودار تعداد مقالات هوش مصنوعی منتشرشده سالانه و پرس‌وجوی شمارش آن‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک پروتکل عملیاتی برای حذف سوگیری‌های آماری در APIهای باز؛ به‌ویژه تفکیک اثر «سالمای-اسلایسینگ» و مدیریت نسخه‌های تکراری در arXiv.

یک کوئری ساده در arXiv می‌تواند تعداد مقالات هوش مصنوعی شما را بسته به تعریفی که دارید، تا سه برابر تغییر دهد. اکثر پژوهشگران به ارقامی تکیه می‌کنند که از مقالات دیگر استخراج شده است، اما این ارقام به‌ندرت بازتولیدپذیر هستند زیرا روش شمارش خاص نویسنده پنهان مانده است. اگر می‌خواهید در تحلیل ترندها برتری رقابتی داشته باشید، باید کنترل تعریف آمارهای خود را در دست بگیرید.

محاسبه رشد پژوهش‌های هوش مصنوعی در لحظه‌ای دشوار رخ می‌دهد. ما شاهد انفجار پیش‌چاپ‌ها (Preprints) هستیم، اما حجم مقالات همیشه با پیشرفت واقعی علمی هم‌ترازی ندارد. طبق گزارش‌های تخصصی، بسیاری از ارقام فعلی به‌دلیل «سالمای-اسلایسینگ» (Salami-slicing) یا همان خرد کردن یک یافته علمی به چندین مقاله کوچک برای تقویت معیارهای استخدام و بودجه، بیش از حد باد کرده‌اند.

مکانیزم شمارش در arXiv

arXiv جایی است که اکثر پژوهش‌های یادگیری ماشین برای اولین بار در آن ظاهر می‌شوند. API این سرویس رایگان است و نیازی به احراز هویت ندارد. برای شمارش مقالات ارسال شده در سال ۲۰۲۵، باید از کوئری‌ای استفاده کنید که دسته‌بندی cs.LG (یادگیری ماشین) را هدف قرار داده و پارامتر max_results=0 را تنظیم کرده باشد تا فقط متادیتا استخراج شود.

با این حال، طبق مستندات فنی arXiv، دو تله‌ی خطرناک در کوئری‌ها وجود دارد:

  • شمارش مضاعف: یک مقاله معمولی در حوزه‌ی مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — اغلب به‌طور هم‌زمان در دسته‌های cs.CL (محاسبات و زبان)، cs.LG و cs.AI ثبت شده است. جمع زدن این دسته‌ها بدون حذف موارد تکراری (Deduplication)، آمار کلی را به‌شدت متورم می‌کند.
  • تغییر تاریخ: تاریخ ارسال (submittedDate) مربوط به نسخه‌ی اول است. مقاله‌ای که در سال ۲۰۲۶ بازبینی شده است، همچنان در سال ارسال اولیه یعنی ۲۰۲۵ شمارش می‌شود.

برای یک شمارش جامع و کامل از هوش مصنوعی، دسته‌بندی‌های زیر ضروری هستند: cs.LG (یادگیری ماشین)، cs.CL (پردازش زبان طبیعی و LLMها)، cs.AI (هوش مصنوعی)، cs.CV (بینایی ماشین)، cs.NE (محاسبات عصبی و تکاملی) و stat.ML (آمار یادگیری ماشین).

پایگاه‌های داده باز جایگزین

برای داشتن یک سابقه رسمی‌تر فراتر از پیش‌چاپ‌ها، تا اوت ۲۰۲۶، سه API باز داده‌های حیاتی را ارائه می‌دهند:

  • OpenAlex: این کامل‌ترین شاخص باز است. این سرویس طبقه‌بندی‌های موضوعی و متادیتای تامین‌کنندگان بودجه را ارائه می‌دهد. شما می‌توانید با استفاده از یک فیلتر ساده برای publication_year:2025 و جست‌وجوی عبارت 'large language model'، تعداد مقالات را استخراج کنید.
  • Crossref: این سرویس تمام شناسه‌های DOI ثبت شده را پوشش می‌دهد. Crossref استاندارد طلایی برای سوابق ناشران، مجلات و کنفرانس‌ها است، هرچند ورودی‌های بدون DOI را نادیده می‌گیرد.
  • Semantic Scholar Graph API: این API یک رابط جست‌وجوی باکیفیت ارائه می‌دهد، اما برای جلوگیری از محدودیت نرخ درخواست (Rate Limit)، توصیه می‌شود از یک API Key استفاده کنید.

پنج تصمیم که داده‌های شما را تخریب می‌کند

بر اساس گزارش dev.to، صحت آمارهای شما تنها به پنج تصمیم خاص بستگی دارد. اول، باید تصمیم بگیرید که پیش‌چاپ‌ها، انتشارات رسمی یا هر دو را بشمارید. شمارش هر دو منجر به تکرار گسترده (massive) داده‌ها می‌شود، زیرا اکثر مقالات در هر دو قالب وجود دارند.

دوم، انتخاب بین «دسته‌بندی اصلی» (Primary Category) یا «هر دسته‌بندی» در arXiv است. این انتخاب به‌تنهایی می‌تواند نتیجه‌ی شمارش را بیش از ۵۰٪ جابه‌جا کند. سوم، تعیین این مسئله است که آیا از جست‌وجوی کلمات کلیدی استفاده می‌کنید یا طبقه‌بندهای موضوعی مبتنی بر یادگیری ماشین. کلمات کلیدی به «مد» و ترندهای سال حساس هستند؛ اما طبقه‌بندها پایدارترند هرچند شفافیت کمتری دارند.

چهارم، تمایز بین تاریخ ارسال و تاریخ انتشار است که گاهی می‌تواند بیش از یک سال فاصله داشته باشد. در نهایت، مدیریت صحیح نسخه‌هاست. مقاله‌ای که شش نسخه دارد، همچنان یک مقاله است؛ اما اسکرپرهای ساده اغلب هر نسخه را یک مورد جداگانه می‌شمارند و به‌طور مصنوعی آمارهای سال‌های اخیر را افزایش می‌دهند.

تحلیل رشد و مقیاس

اعداد مطلق نسبت به نرخ‌های رشد کاربرد کمتری دارند. هنگام محاسبه‌ی نرخ رشد سالانه مرکب (CAGR)، توجه داشته باشید که خطاهای کوچک در نرخ رشد منجر به خطاهای عظیمی در تخمین زمان دوبرابر شدن (Doubling-time) می‌شود. برای مثال، نرخ رشد ۰.۳۵ به معنای دوبرابر شدن در ۲.۳ سال است، در حالی که نرخ ۰.۵۰ این زمان را به ۱.۷ سال کاهش می‌دهد.

علاوه بر این، شما باید همیشه تعداد مقالات هوش مصنوعی را به‌عنوان سهمی از کل پیش‌چاپ‌ها محاسبه کنید. اگر مقالات AI حدود ۴۰٪ رشد کنند اما کل پیش‌چاپ‌های علمی ۳۰٪ رشد کرده باشند، رشد نسبی واقعی این حوزه تنها حدود ۸٪ است.

این تغییر دیدگاه نشان می‌دهد که حجم، برابر با پیشرفت نیست. اثرگذارترین کارهای امروز — مانند کارت‌های مدل (Model Cards)، کارت‌های سیستم (System Cards) و وزن‌های خام مدل‌ها — اغلب هرگز به‌صورت یک مقاله ایندکس‌شده ظاهر نمی‌شوند. این امر شکافی رو به رشد بین آمارهای آکادمیک و پیشرفت‌های واقعی جهان صنعت ایجاد کرده است. در واقع، در دنیای مدیریت محتوای هوش مصنوعی، تمرکز از تولید انبوه داده به سمت پرهیز استراتژیک و اولویت‌بندی آنچه باید حذف شود تغییر یافته است تا کیفیت جایگزین کمیت شود.

برای اعتبارسنجی نتایج، اعداد خود را با Stanford HAI AI Index تطبیق دهید که متدولوژی خود را برای شمارش سالانه مقالات مستند کرده است. همواره کوئری دقیق و تاریخ اجرای آن را ثبت کنید تا استناد شما بازتولیدپذیر باشد.

گام بعدی شما

  • برای تحلیل ترندها، به‌جای تعداد مطلق، نسبت مقالات AI به کل پیش‌چاپ‌های علمی را محاسبه کنید.
  • در کوئری‌های arXiv، حتماً عملیات حذف تکراری‌ها (Deduplication) را بر اساس شناسه مقاله اجرا کنید.
  • برای بررسی اعتبار یک ادعای رشد، متدولوژی استخراج داده را با استانداردهای Stanford HAI مقایسه کنید.

اما این شکاف بین مقالات و واقعیت، در حوزه سخت‌افزاری شدیدتر است — به تحلیل ما درباره‌ی تراشه‌های نسل جدید Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی با تکیه بر استانداردهای Stanford HAI، شفافیت آماری را جایگزین تخمین‌های تقریبی می‌کند. تخصص در استخراج داده‌های صحیح، تنها راه تفکیک «hype» یا جنجال تبلیغاتی از رشد واقعی علمی است.

تأثیر برای ایران

این متدولوژی برای پژوهشگران و دانشجویان ایرانی که نیاز به تحلیل ترندهای جهانی برای انتخاب موضوع پایان‌نامه دارند، ابزاری رایگان و دقیق است و نیازی به دسترسی‌های خاص یا VPNهای تجاری ندارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز بیش از حد بر شمارش مقالات، «تله‌ی کمیت» در دنیای AI است. در حالی که آکادمی با تعداد مقالات پیشرفت را می‌سنجد، ارزش واقعی امروز در وزن‌های باز و کارت‌های سیستم نهفته است که اساساً در پایگاه‌های داده کتابشناختی جای ندارند. این یعنی هرچه پیشرفت AI سریع‌تر شود، آمارهای مقالاتی گمراه‌کننده‌تر می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.