۳.۳ درصد؛ این رقم دقیقِ رشد مهارتهای غیرانگلیسی در عاملهای هوش مصنوعی (AI Agents) تنها در بازه زمانی سه ماه است. طبق تحلیل فنی پلیکارا لبز (Plicara Labs)، این تغییر نشان میدهد که توسعه هوش مصنوعی با سرعتی بسیار بیشتر از روندهای پیشینِ مستندسازی نرمافزار، در حال فاصله گرفتن از مرکزیت سانفرانسیسکو است.
این تحول در حالی رخ میدهد که صنعت از پرامپتهای ایستا به سمت «مهارتها» (Skills) حرکت میکند؛ دستورالعملهای ساختاریافتهای در فایلهای SKILL.md که عاملها بهصورت پویا بارگذاری میکنند. در حالی که مستندات سنتی نرمافزار یک دهه زمان برد تا سهم غیرانگلیسی خود را در گیتهاب از ۳.۷٪ به ۱۳.۰٪ برساند، مهارتهای عاملها این نقاط عطف را در کسری از آن زمان طی کردهاند.
مفهوم مهارت در اکوسیستم عاملها
یک مهارت به عنوان یک فایل SKILL.md تعریف میشود که در یک پوشه قرار دارد و حاوی دستورالعملهایی برای یک عامل هوش مصنوعی است که به زبان ساده (Plain Prose) نوشته شدهاند. این فایلها تنها زمانی بارگذاری میشوند که عامل تشخیص دهد وظیفه پیشرو با آن مهارت مرتبط است. برای درک بهتر کاربرد عملی این ساختار، میتوان به بررسی ۵ مهارت قابلحمل برای تبدیل پرامپتهای تکراری به گردشکارهای بازرسیپذیر اشاره کرد که نحوه پیادهسازی این مهارتها را در محیطهای عملیاتی نشان میدهد.
آنتروپیک (Anthropic) مشخصات اولیه این فرمت را در اکتبر ۲۰۲۵ منتشر کرد. این فرمت بهسرعت، شبیه به پخش شدن یک دستور پخت غذا، میان توسعهدهندگانی که ساختار آن را کپی میکردند، گسترش یافت. تا ژوئیه ۲۰۲۶، یعنی نه ماه پس از انتشار مشخصات، ۳.۸ میلیون مهارت در ۲۸۲,۲۰۰ مخزن عمومی ثبت شد که اساس مجموعه داده گیتاسکیلز (GitSkills) را تشکیل میدهد.
همانطور که در تحلیلهای پیشین ما دربارهی استقلال مدلهای زبانی از زبان انگلیسی اشاره کردیم، مهارتها نشاندهنده تغییری بنیادین در نرمافزار هستند. برخلاف کدهای سنتی، این مهارتها به زبان انسانی نوشته شده و توسط یک مدل چندزبانه اجرا میشوند. هیچ الزام فنی برای نوشتن آنها به زبان انگلیسی وجود ندارد؛ بنابراین یک توسعهدهنده در سائوپائولو یا شنژن میتواند رویه کاری را با دقت بیشتری به زبان مادری خود بنویسد و عامل آن را اجرا کند.
مقیاس تغییرات زبانی
پلیکارا لبز با تحلیل مجموعه داده گیتاسکیلز، که شامل ۳.۸ میلیون مهارت در ۲۸۲,۲۰۰ مخزن عمومی است، مسیر صعودی تنوع زبانی را به شرح زیر گزارش کرده است:
- سه ماهه اول ۲۰۲۶: ۱۳.۰٪ از مهارتهای جدید به زبانی غیر از انگلیسی نوشته شده بودند (با بازه اطمینان ویلسون ۹۵٪ در محدوده [۱۲.۸, ۱۳.۱]).
- سه ماهه دوم ۲۰۲۶: این رقم به ۱۶.۳٪ افزایش یافت (در محدوده [۱۶.۱, ۱۶.۴]).
- مقایسه ژانویه و ژوئیه ۲۰۲۶: سهم زبانهای غیرانگلیسی از ۱۳.۱٪ در ژانویه به ۱۷.۶٪ در ژوئیه رسید.
این رشد برای فرمتی که حدود ۱۸ ماه قدمت دارد، طبیعی است؛ زیرا انواع جدید از مصنوعات دیجیتال معمولاً سریعتر از موارد قدیمی و تثبیتشده، تنوع جمعیتی خود را به دست میآورند، چرا که با هیچ پیشزمینه یا سلطه تاریخی روبرو نیستند.
توزیع زبانها و تسلطها
از میان ۱,۸۷۰,۲۹۹ محتوای مهارت تحلیلشده (پس از حذف متادیتای ابتدایی و کدهای محصور)، ۱۴.۳٪ غیرانگلیسی بودند. توزیع این زبانها به ترتیب زیر است:
- انگلیسی: ۸۵.۳٪
- چینی (中文): ۶.۲٪
- ژاپنی (日本語): ۱.۷٪
- آلمانی (Deutsch): ۱.۶٪
- کرهای (한국어): ۱.۲٪
- پرتغالی (Português): ۱.۱٪
- اسپانیایی (Español): ۰.۹٪
- فرانسوی (Français): ۰.۴٪
در بخش زبان چینی، دادهها نشاندهنده ۱۰۴,۹۸۵ مورد از خط سادهشده در مقابل ۹,۱۱۲ مورد از خط سنتی است. تعداد کمی از مهارتها (۶,۸۱۰ مورد) پایینتر از حد اطمینان شناسایی بودند و در هیچیک از این دو دسته قرار نگرفتند.
در مقایسه با مطالعه ICSE در سال ۲۰۲۶ روی مستندات عمومی مخازن، سهم ۱۴.۳ درصدی مهارتهای غیرانگلیسی تقریباً با سهم ۱۳.۰ درصدی مستندات عمومی برابر است (یک رقابت تنگاتنگ). اما مهارتها بهطور قابلتوجهی چینیتر (۶.۲٪ در برابر ۳.۳٪ در مستندات عمومی) هستند.
روندهای رشد منطقهای
رشد در تمام گروههای غیرانگلیسی یکسان نبوده است. بین سه ماهه اول و دوم ۲۰۲۶، دو گروه اصلی پیشران این رشد بودند:
- زبانهای اروپایی: (شامل آلمانی، فرانسوی، اسپانیایی، پرتغالی، ایتالیایی، روسی و هلندی) که سهمشان بیش از دو برابر شد و از ۲.۷٪ [۲.۶, ۲.۸] به ۵.۵٪ [۵.۴, ۵.۶] رسید (افزایش ۲.۸ واحدی).
- چینی: رشد مداوم از ۴.۲٪ [۴.۱, ۴.۴] به ۵.۳٪ [۵.۲, ۵.۴] (افزایش ۱.۱ واحدی).
- کرهای: تقریباً ثابت ماند و از ۲.۲٪ به ۲.۰٪ رسید (کاهش ۰.۲ واحدی).
- ژاپنی: از ۳.۲٪ به ۲.۵٪ کاهش یافت (کاهش ۰.۷ واحدی)، هرچند در پایان سال ۲۰۲۵ رایجترین زبان غیرانگلیسی بود. دادههای سانسور شده از ژوئیه احتمال بهبودی را نشان میدهند.
اعتبارسنجی دادهها و تحلیل جغرافیایی
به دلیل تضاد در آمارهای منتشرشده، پلیکارا لبز بررسی کرد که چرا برخی مطالعات سهم انگلیسی را ۶۵.۰٪ (۵۵۷ مهارت مراقبت بهداشتی از طریق ClawHub 2605.02709) و برخی دیگر ۹۹.۷٪ (خزشهای Seeded انگلیسی 2606.03565) گزارش کردهاند. ارقام دیگر شامل ۸۱.۸٪ (۲۶,۵۰۲ مهارت از طریق ClawHub 2604.13064) و ۹۲.۶٪ (۱۳۳,۱۴۹ مهارت از طریق skills.sh 2607.01456) است.
محققان به این نتیجه رسیدند که اینها جمعیتهای متفاوتی هستند: بازارگاههای منتخب (Curated) به انگلیسی متمایلاند، برشهای دامنه (Domain Slices) به جایی متمایلاند که آن حوزه فعال است، و خزشهای Seeded دقیقاً همان چیزی را مییابند که به دنبالش هستند.
برای اطمینان از اینکه این اعداد ناشی از ابزارهای مورد استفاده نیستند، پلیکارا لبز شناسگر py3langid (با اطمینان >= ۰.۸۰) را با fast-langdetect مقایسه کرد. این دو ابزار در ۹۷.۶٪ اسناد اتفاق نظر داشتند و تفاوت سهم انگلیسی تنها ۱.۲ واحد بود که بسیار کمتر از شکاف هفت واحدی بین مطالعات مختلف است.
آنها همچنین سوگیری غربالگری کیفیت را آزمایش کردند. مهارتهای غیرانگلیسی در واقع اعتبار متادیتای ابتدایی (Front-matter) بهتری داشتند (۸۸.۱٪) نسبت به مهارتهای انگلیسی (۸۶.۶٪). فیلتر کردن بر اساس متادیتای معتبر، سهم انگلیسی را تنها از ۸۵.۶٪ به ۸۵.۴٪ تغییر داد که ثابت میکند این روند نتیجه حذف فایلهای غیرانگلیسی نیست.
برای تأیید منشأ جغرافیایی، محققان از برچسبهای زمانی کامیتها استفاده کردند و «افتهای شبانه» را رصد کردند، زیرا آفستهای UTC اغلب نرمالسازی میشوند:
- مهارتهای چینی: کامیتها در ساعات شب شرق آسیا به کمتر از نصف نرخ انگلیسی رسید (۱۵.۳٪ در مقابل ۳۵.۷٪ برای انگلیسی).
- مهارتهای اسپانیایی و پرتغالی: اوج فعالیت در ساعت ۱۹:۰۰ UTC بود که با بعدازظهر برزیل و اواخر شب در شبهجزیره ایبری همخوانی دارد و نویسندگان را در قاره آمریکا قرار میدهد (سهم ۴۶.۵٪ در آن بازه زمانی).
- مهارتهای انگلیسی: فعالیت در ۲۴ ساعت شبانهروز یکنواخت بود که نشانه توزیع جهانی توسعهدهندگان است و هیچ «شب» واحدی ندارد.
این سیگنالها مستقل هستند زیرا شناسگر زبان به زمان کامیت دسترسی ندارد. اگرچه این یک تخمین در سطح جمعیت است و نمیتواند UTC+8 را از UTC+9 جدا کند، اما تأییدی قوی برای دادههای زبانی است.
اثر «کف» و رشد جهانی
پلیکارا لبز استدلال میکند که رقم ۱۴.۳٪ در واقع یک «کف» است نه سقف؛ زیرا بسیاری از توسعهدهندگان در سریعترین جمعیتهای در حال رشد — بهویژه در هند، نیجریه و سنگاپور — مهارتهای خود را به انگلیسی مینویسند. در نتیجه، شمارش زبانی نمیتواند وسعت کامل تغییر اکوسیستم به خارج از ایالات متحده را ببیند.
دادههای خارجی این موضوع را تأیید میکنند:
- گزارش Octoverse ۲۰۲۵ گیتهاب: هند در یک سال ۵.۲ میلیون توسعهدهنده اضافه کرد (۱۴٪ از تمام حسابهای جدید جهانی) و به ۲۱.۹ میلیون کاربر رسید که ۴.۹ برابر جمعیت سال ۲۰۲۰ آن است. برزیل ۴.۱ برابر، اندونزی ۴.۸ برابر و ژاپن ۳ برابر رشد کردند. ثبتنامهای جدید در APAC اکنون حدود ۲۵ مورد در دقیقه است در حالی که در اروپا ۱۲ مورد است. هند، برزیل و اندونزی با هم حدود نیمی از تمام حسابهای جدید را تشکیل میدهند.
- شاخص AI استنفورد ۲۰۲۶: نرخ پذیرش هوش مصنوعی زاینده (Generative AI) در امارات ۶۴٪ و در سنگاپور ۶۱٪ است، در حالی که آمریکا با ۲۸.۳٪ در رتبه ۲۴ قرار دارد. مشارکتهای متنباز از «بقیه جهان» اکنون از اروپا پیشی گرفته و به آمریکا نزدیک شده است. مهارتهای مهندسی هوش مصنوعی در امارات، شیلی و آفریقای جنوبی با بیشترین سرعت در حال شتاب گرفتن هستند.
تفاوت در انتشار و نگهداری
یک تفاوت تکاندهنده در نحوه استفاده از مهارتها وجود دارد. مهارتهای انگلیسی «منتشر» (Propagated) میشوند: یک بار نوشته شده و بهطور گسترده کپی میشوند اما بهندرت بازبینی میشوند. اما مهارتهای غیرانگلیسی «پرورش» (Tended) مییابند: کمتر کپی میشوند اما دفعات بیشتری ویرایش و اصلاح میشوند.
جزئیات کپیبرداری و بازبینی:
- تعداد کپیها: سهم غیرانگلیسی با افزایش استفاده کاهش مییابد. این سهم در مهارتهایی با ۱ کپی ۱۵.۷٪ است (n=۱,۴۸۳,۵۷۵)، اما برای ۲ کپی به ۱۰.۸٪ (n=۱۷۹,۱۰۲)، برای ۳ تا ۵ کپی به ۹.۱٪ (n=۱۳۵,۲۷۱) و در مهارتهایی با ۶ کپی یا بیشتر به ۵.۸٪ (n=۷۲,۳۵۱) میرسد.
- اثر تجمیعکننده: ده مخزن، ۱۴.۵٪ از تمام فایلهای مهارت را در اختیار دارند. این ثبتها به زبانهای غیرانگلیسی متمایلتر هستند (۲۰.۵٪ در مقابل ۱۳.۷٪ در جاهای دیگر). حذف آنها در واقع شکاف را بیشتر میکند و سهم غیرانگلیسی را از ۱۵.۱٪ (۱ کپی) به ۵.۳٪ میرساند. شمارش مالکان متمایز این شکاف را بیشتر کرده و رقم را به ۱۵.۱٪ در مقابل ۴.۶٪ میرساند.
- نرخ بازبینی (اصلاح شده بر اساس سن):
- در ۷ روز اول: انگلیسی ۱۴.۴٪ در مقابل غیرانگلیسی ۱۵.۷٪ (+۱.۳ واحد)
- در ۳۰ روز اول: انگلیسی ۲۱.۷٪ در مقابل غیرانگلیسی ۲۶.۹٪ (+۵.۲ واحد)
- در ۹۰ روز اول: انگلیسی ۲۸.۷٪ در مقابل غیرانگلیسی ۳۳.۹٪ (+۵.۲ واحد)
این شکاف احتمالاً ناشی از نقص در ابزارها است. چون کشف مهارتها لغوی (مبتنی بر جستوجو) است، توسعهدهندهای که به انگلیسی جستوجو میکند، مهارت باکیفیت نوشته شده به زبان چینی را پیدا نمیکند، حتی اگر مدل چندزبانه بتواند آن را بهطور کامل اجرا کند. اکوسیستم در آنچه «نوشته میشود» بسیار زودتر از آنچه «استفاده مجدد میشود» جهانی میگردد.
نقش نویسندگی هوش مصنوعی
در نهایت، این مطالعه بررسی کرد که چه کسی این مهارتها را مینویسد. چون تگ bot گیتهاب تنها ۱.۰٪ از مهارتها را شناسایی کرد، محققان تریلر «Co-Authored-By» را در کامیتهای git تحلیل کردند.
آنها دریافتند که ۳۰.۴٪ [۳۰.۳, ۳۰.۶] از مهارتها توسط عاملهای هوش مصنوعی نوشته شدهاند. کلود (Claude) اکثریت مطلق این تریلرها را به خود اختصاص داده است و Cursor, Copilot و Codex بسیار عقبتر هستند. این تریلرها حتی نسخههای خاص مدل را حمل میکنند. این روند بر اساس زبان متفاوت بود:
- مهارتهای ژاپنی: ۴۳.۴٪ توسط عاملها نوشته شدهاند.
- مهارتهای چینی: ۲۳.۲٪ توسط عاملها نوشته شدهاند.
پیامدهای فنی و محدودیتها
برای جامعه فنی، این تغییر این فرض را به چالش میکشد که انگلیسی تنها واسطه اصلی برای ارکستراسیون هوش مصنوعی است. با این حال، محققان به چندین محدودیت در دادهها اشاره میکنند:
- همپوشانی زبانی: شناسایی زبان بر اساس خط و کلمات کاربردی است. یک مهارت آلمانی که سرشار از واژگان فنی انگلیسی باشد ممکن است بهاشتباه انگلیسی شناسایی شود، بنابراین سهم غیرانگلیسی یک «حد پایین» است.
- شکافهای زمانی: تاریخها تنها بخشی از مجموعه داده و نمایندگان حذف تکرار را پوشش میدهند. «ایجاد شده» به اولین کامیتی اشاره دارد که به آن کپی خاص دست زده است، نه اولین ظهور محتوا.
- سوگیری بازماندگان: خزش تنها بازماندگان را میبیند. هر مهارتی که قبل از ژوئیه ۲۰۲۶ ایجاد و حذف شده باشد، نامرئی است که احتمالاً ارقام نگهداری را بیش از حد نشان میدهد.
برای اینکه ببینیم آیا این موضوع به عملکرد تبدیل میشود، گام حیاتی بعدی تحلیل ردپاهای اجرا (Execution Traces) است تا مشخص شود آیا مهارتهای غیرانگلیسی در محیط تولید واقعاً بهتر یا بدتر از همتایان انگلیسی خود عمل میکنند. سؤال بزرگتر باقی میماند: اگر سهم غیرانگلیسی هر فصل ۳ واحد رشد میکند و سریعترین جمعیتهای در حال رشد به انگلیسی مینویسند، چه مقدار از اکوسیستم هوش مصنوعی همین حالا از ایالات متحده فراتر رفته است؟
گام بعدی شما
- اگر توسعهدهنده هستید، بررسی کنید که آیا مهارتهای عامل خود را در قالب SKILL.md استاندارد کردهاید یا خیر.
- برای دسترسی به بازارهای جهانی، از مدلهای چندزبانه برای ترجمه و بهینهسازی مهارتهای محلی خود به انگلیسی استفاده کنید تا نرخ کپی شدن (Reuse) آنها افزایش یابد.
- در صورت استفاده از عاملهای کدنویس، خروجیهای مدلهایی مانند Claude را برای تولید فایلهای مهارت ساختاریافته ارزیابی کنید.
اما تأثیر این تغییرات زبانی بر عملکرد واقعی مدلها در محیط تولید هنوز ناشناخته است — به تحلیل ما دربارهی تأخیر استنتاج در مدلهای چندزبانه مراجعه کنید.




گفتگو