یک کوئری ساده در arXiv میتواند تعداد مقالات هوش مصنوعی شما را بسته به تعریفی که دارید، تا سه برابر تغییر دهد. اکثر پژوهشگران به ارقامی تکیه میکنند که از مقالات دیگر استخراج شده است، اما این ارقام بهندرت بازتولیدپذیر هستند زیرا روش شمارش خاص نویسنده پنهان مانده است. اگر میخواهید در تحلیل ترندها برتری رقابتی داشته باشید، باید کنترل تعریف آمارهای خود را در دست بگیرید.
محاسبه رشد پژوهشهای هوش مصنوعی در لحظهای دشوار رخ میدهد. ما شاهد انفجار پیشچاپها (Preprints) هستیم، اما حجم مقالات همیشه با پیشرفت واقعی علمی همترازی ندارد. طبق گزارشهای تخصصی، بسیاری از ارقام فعلی بهدلیل «سالمای-اسلایسینگ» (Salami-slicing) یا همان خرد کردن یک یافته علمی به چندین مقاله کوچک برای تقویت معیارهای استخدام و بودجه، بیش از حد باد کردهاند.
مکانیزم شمارش در arXiv
arXiv جایی است که اکثر پژوهشهای یادگیری ماشین برای اولین بار در آن ظاهر میشوند. API این سرویس رایگان است و نیازی به احراز هویت ندارد. برای شمارش مقالات ارسال شده در سال ۲۰۲۵، باید از کوئریای استفاده کنید که دستهبندی cs.LG (یادگیری ماشین) را هدف قرار داده و پارامتر max_results=0 را تنظیم کرده باشد تا فقط متادیتا استخراج شود.
با این حال، طبق مستندات فنی arXiv، دو تلهی خطرناک در کوئریها وجود دارد:
- شمارش مضاعف: یک مقاله معمولی در حوزهی مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — اغلب بهطور همزمان در دستههای
cs.CL(محاسبات و زبان)،cs.LGوcs.AIثبت شده است. جمع زدن این دستهها بدون حذف موارد تکراری (Deduplication)، آمار کلی را بهشدت متورم میکند. - تغییر تاریخ: تاریخ ارسال (
submittedDate) مربوط به نسخهی اول است. مقالهای که در سال ۲۰۲۶ بازبینی شده است، همچنان در سال ارسال اولیه یعنی ۲۰۲۵ شمارش میشود.
برای یک شمارش جامع و کامل از هوش مصنوعی، دستهبندیهای زیر ضروری هستند: cs.LG (یادگیری ماشین)، cs.CL (پردازش زبان طبیعی و LLMها)، cs.AI (هوش مصنوعی)، cs.CV (بینایی ماشین)، cs.NE (محاسبات عصبی و تکاملی) و stat.ML (آمار یادگیری ماشین).
پایگاههای داده باز جایگزین
برای داشتن یک سابقه رسمیتر فراتر از پیشچاپها، تا اوت ۲۰۲۶، سه API باز دادههای حیاتی را ارائه میدهند:
- OpenAlex: این کاملترین شاخص باز است. این سرویس طبقهبندیهای موضوعی و متادیتای تامینکنندگان بودجه را ارائه میدهد. شما میتوانید با استفاده از یک فیلتر ساده برای
publication_year:2025و جستوجوی عبارت 'large language model'، تعداد مقالات را استخراج کنید. - Crossref: این سرویس تمام شناسههای DOI ثبت شده را پوشش میدهد. Crossref استاندارد طلایی برای سوابق ناشران، مجلات و کنفرانسها است، هرچند ورودیهای بدون DOI را نادیده میگیرد.
- Semantic Scholar Graph API: این API یک رابط جستوجوی باکیفیت ارائه میدهد، اما برای جلوگیری از محدودیت نرخ درخواست (Rate Limit)، توصیه میشود از یک API Key استفاده کنید.
پنج تصمیم که دادههای شما را تخریب میکند
بر اساس گزارش dev.to، صحت آمارهای شما تنها به پنج تصمیم خاص بستگی دارد. اول، باید تصمیم بگیرید که پیشچاپها، انتشارات رسمی یا هر دو را بشمارید. شمارش هر دو منجر به تکرار گسترده (massive) دادهها میشود، زیرا اکثر مقالات در هر دو قالب وجود دارند.
دوم، انتخاب بین «دستهبندی اصلی» (Primary Category) یا «هر دستهبندی» در arXiv است. این انتخاب بهتنهایی میتواند نتیجهی شمارش را بیش از ۵۰٪ جابهجا کند. سوم، تعیین این مسئله است که آیا از جستوجوی کلمات کلیدی استفاده میکنید یا طبقهبندهای موضوعی مبتنی بر یادگیری ماشین. کلمات کلیدی به «مد» و ترندهای سال حساس هستند؛ اما طبقهبندها پایدارترند هرچند شفافیت کمتری دارند.
چهارم، تمایز بین تاریخ ارسال و تاریخ انتشار است که گاهی میتواند بیش از یک سال فاصله داشته باشد. در نهایت، مدیریت صحیح نسخههاست. مقالهای که شش نسخه دارد، همچنان یک مقاله است؛ اما اسکرپرهای ساده اغلب هر نسخه را یک مورد جداگانه میشمارند و بهطور مصنوعی آمارهای سالهای اخیر را افزایش میدهند.
تحلیل رشد و مقیاس
اعداد مطلق نسبت به نرخهای رشد کاربرد کمتری دارند. هنگام محاسبهی نرخ رشد سالانه مرکب (CAGR)، توجه داشته باشید که خطاهای کوچک در نرخ رشد منجر به خطاهای عظیمی در تخمین زمان دوبرابر شدن (Doubling-time) میشود. برای مثال، نرخ رشد ۰.۳۵ به معنای دوبرابر شدن در ۲.۳ سال است، در حالی که نرخ ۰.۵۰ این زمان را به ۱.۷ سال کاهش میدهد.
علاوه بر این، شما باید همیشه تعداد مقالات هوش مصنوعی را بهعنوان سهمی از کل پیشچاپها محاسبه کنید. اگر مقالات AI حدود ۴۰٪ رشد کنند اما کل پیشچاپهای علمی ۳۰٪ رشد کرده باشند، رشد نسبی واقعی این حوزه تنها حدود ۸٪ است.
این تغییر دیدگاه نشان میدهد که حجم، برابر با پیشرفت نیست. اثرگذارترین کارهای امروز — مانند کارتهای مدل (Model Cards)، کارتهای سیستم (System Cards) و وزنهای خام مدلها — اغلب هرگز بهصورت یک مقاله ایندکسشده ظاهر نمیشوند. این امر شکافی رو به رشد بین آمارهای آکادمیک و پیشرفتهای واقعی جهان صنعت ایجاد کرده است. در واقع، در دنیای مدیریت محتوای هوش مصنوعی، تمرکز از تولید انبوه داده به سمت پرهیز استراتژیک و اولویتبندی آنچه باید حذف شود تغییر یافته است تا کیفیت جایگزین کمیت شود.
برای اعتبارسنجی نتایج، اعداد خود را با Stanford HAI AI Index تطبیق دهید که متدولوژی خود را برای شمارش سالانه مقالات مستند کرده است. همواره کوئری دقیق و تاریخ اجرای آن را ثبت کنید تا استناد شما بازتولیدپذیر باشد.
گام بعدی شما
- برای تحلیل ترندها، بهجای تعداد مطلق، نسبت مقالات AI به کل پیشچاپهای علمی را محاسبه کنید.
- در کوئریهای arXiv، حتماً عملیات حذف تکراریها (Deduplication) را بر اساس شناسه مقاله اجرا کنید.
- برای بررسی اعتبار یک ادعای رشد، متدولوژی استخراج داده را با استانداردهای Stanford HAI مقایسه کنید.
اما این شکاف بین مقالات و واقعیت، در حوزه سختافزاری شدیدتر است — به تحلیل ما دربارهی تراشههای نسل جدید Blackwell مراجعه کنید.




گفتگو