پرش به محتوای اصلی
پرش به محتوای مقاله

سهم مهارت‌های غیرانگلیسی در عامل‌های هوش مصنوعی طی یک فصل ۳.۳٪ رشد کرد

·۳ شهریور ۱۴۰۵۱۳ دقیقه مطالعه
زبان نوشتن مهارت‌های عامل هوشمند چیست؟ · آزمایشگاه پلیکارا
زبان نوشتن مهارت‌های عامل هوشمند چیست؟ · آزمایشگاه پلیکارا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف تفاوت رفتاری بین مهارت‌های انگلیسی (کپی زیاد/ویرایش کم) و غیرانگلیسی (کپی کم/ویرایش زیاد)؛ این نشان می‌دهد که اکوسیستم AI در لایه تولید محتوا جهانی شده است، اما در لایه توزیع و بازاستفاده هنوز در تله زبان انگلیسی گرفتار است.

۳.۳ درصد؛ این رقم دقیقِ رشد مهارت‌های غیرانگلیسی در عامل‌های هوش مصنوعی (AI Agents) تنها در بازه زمانی سه ماه است. طبق تحلیل فنی پلیکارا لبز (Plicara Labs)، این تغییر نشان می‌دهد که توسعه هوش مصنوعی با سرعتی بسیار بیشتر از روندهای پیشینِ مستندسازی نرم‌افزار، در حال فاصله گرفتن از مرکزیت سان‌فرانسیسکو است.

این تحول در حالی رخ می‌دهد که صنعت از پرامپت‌های ایستا به سمت «مهارت‌ها» (Skills) حرکت می‌کند؛ دستورالعمل‌های ساختاریافته‌ای در فایل‌های SKILL.md که عامل‌ها به‌صورت پویا بارگذاری می‌کنند. در حالی که مستندات سنتی نرم‌افزار یک دهه زمان برد تا سهم غیرانگلیسی خود را در گیت‌هاب از ۳.۷٪ به ۱۳.۰٪ برساند، مهارت‌های عامل‌ها این نقاط عطف را در کسری از آن زمان طی کرده‌اند.

مفهوم مهارت در اکوسیستم عامل‌ها

یک مهارت به عنوان یک فایل SKILL.md تعریف می‌شود که در یک پوشه قرار دارد و حاوی دستورالعمل‌هایی برای یک عامل هوش مصنوعی است که به زبان ساده (Plain Prose) نوشته شده‌اند. این فایل‌ها تنها زمانی بارگذاری می‌شوند که عامل تشخیص دهد وظیفه پیش‌رو با آن مهارت مرتبط است. برای درک بهتر کاربرد عملی این ساختار، می‌توان به بررسی ۵ مهارت قابل‌حمل برای تبدیل پرامپت‌های تکراری به گردش‌کارهای بازرسی‌پذیر اشاره کرد که نحوه پیاده‌سازی این مهارت‌ها را در محیط‌های عملیاتی نشان می‌دهد.

آنتروپیک (Anthropic) مشخصات اولیه این فرمت را در اکتبر ۲۰۲۵ منتشر کرد. این فرمت به‌سرعت، شبیه به پخش شدن یک دستور پخت غذا، میان توسعه‌دهندگانی که ساختار آن را کپی می‌کردند، گسترش یافت. تا ژوئیه ۲۰۲۶، یعنی نه ماه پس از انتشار مشخصات، ۳.۸ میلیون مهارت در ۲۸۲,۲۰۰ مخزن عمومی ثبت شد که اساس مجموعه داده گیت‌اسکیلز (GitSkills) را تشکیل می‌دهد.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی استقلال مدل‌های زبانی از زبان انگلیسی اشاره کردیم، مهارت‌ها نشان‌دهنده تغییری بنیادین در نرم‌افزار هستند. برخلاف کدهای سنتی، این مهارت‌ها به زبان انسانی نوشته شده و توسط یک مدل چندزبانه اجرا می‌شوند. هیچ الزام فنی برای نوشتن آن‌ها به زبان انگلیسی وجود ندارد؛ بنابراین یک توسعه‌دهنده در سائوپائولو یا شنژن می‌تواند رویه کاری را با دقت بیشتری به زبان مادری خود بنویسد و عامل آن را اجرا کند.

مقیاس تغییرات زبانی

پلیکارا لبز با تحلیل مجموعه داده گیت‌اسکیلز، که شامل ۳.۸ میلیون مهارت در ۲۸۲,۲۰۰ مخزن عمومی است، مسیر صعودی تنوع زبانی را به شرح زیر گزارش کرده است:

  • سه ماهه اول ۲۰۲۶: ۱۳.۰٪ از مهارت‌های جدید به زبانی غیر از انگلیسی نوشته شده بودند (با بازه اطمینان ویلسون ۹۵٪ در محدوده [۱۲.۸, ۱۳.۱]).
  • سه ماهه دوم ۲۰۲۶: این رقم به ۱۶.۳٪ افزایش یافت (در محدوده [۱۶.۱, ۱۶.۴]).
  • مقایسه ژانویه و ژوئیه ۲۰۲۶: سهم زبان‌های غیرانگلیسی از ۱۳.۱٪ در ژانویه به ۱۷.۶٪ در ژوئیه رسید.

این رشد برای فرمتی که حدود ۱۸ ماه قدمت دارد، طبیعی است؛ زیرا انواع جدید از مصنوعات دیجیتال معمولاً سریع‌تر از موارد قدیمی و تثبیت‌شده، تنوع جمعیتی خود را به دست می‌آورند، چرا که با هیچ پیش‌زمینه یا سلطه تاریخی روبرو نیستند.

توزیع زبان‌ها و تسلط‌ها

از میان ۱,۸۷۰,۲۹۹ محتوای مهارت تحلیل‌شده (پس از حذف متادیتای ابتدایی و کدهای محصور)، ۱۴.۳٪ غیرانگلیسی بودند. توزیع این زبان‌ها به ترتیب زیر است:

  • انگلیسی: ۸۵.۳٪
  • چینی (中文): ۶.۲٪
  • ژاپنی (日本語): ۱.۷٪
  • آلمانی (Deutsch): ۱.۶٪
  • کره‌ای (한국어): ۱.۲٪
  • پرتغالی (Português): ۱.۱٪
  • اسپانیایی (Español): ۰.۹٪
  • فرانسوی (Français): ۰.۴٪

در بخش زبان چینی، داده‌ها نشان‌دهنده ۱۰۴,۹۸۵ مورد از خط ساده‌شده در مقابل ۹,۱۱۲ مورد از خط سنتی است. تعداد کمی از مهارت‌ها (۶,۸۱۰ مورد) پایین‌تر از حد اطمینان شناسایی بودند و در هیچ‌یک از این دو دسته قرار نگرفتند.

در مقایسه با مطالعه ICSE در سال ۲۰۲۶ روی مستندات عمومی مخازن، سهم ۱۴.۳ درصدی مهارت‌های غیرانگلیسی تقریباً با سهم ۱۳.۰ درصدی مستندات عمومی برابر است (یک رقابت تنگاتنگ). اما مهارت‌ها به‌طور قابل‌توجهی چینی‌تر (۶.۲٪ در برابر ۳.۳٪ در مستندات عمومی) هستند.

روندهای رشد منطقه‌ای

رشد در تمام گروه‌های غیرانگلیسی یکسان نبوده است. بین سه ماهه اول و دوم ۲۰۲۶، دو گروه اصلی پیشران این رشد بودند:

  • زبان‌های اروپایی: (شامل آلمانی، فرانسوی، اسپانیایی، پرتغالی، ایتالیایی، روسی و هلندی) که سهمشان بیش از دو برابر شد و از ۲.۷٪ [۲.۶, ۲.۸] به ۵.۵٪ [۵.۴, ۵.۶] رسید (افزایش ۲.۸ واحدی).
  • چینی: رشد مداوم از ۴.۲٪ [۴.۱, ۴.۴] به ۵.۳٪ [۵.۲, ۵.۴] (افزایش ۱.۱ واحدی).
  • کره‌ای: تقریباً ثابت ماند و از ۲.۲٪ به ۲.۰٪ رسید (کاهش ۰.۲ واحدی).
  • ژاپنی: از ۳.۲٪ به ۲.۵٪ کاهش یافت (کاهش ۰.۷ واحدی)، هرچند در پایان سال ۲۰۲۵ رایج‌ترین زبان غیرانگلیسی بود. داده‌های سانسور شده از ژوئیه احتمال بهبودی را نشان می‌دهند.

اعتبارسنجی داده‌ها و تحلیل جغرافیایی

به دلیل تضاد در آمارهای منتشرشده، پلیکارا لبز بررسی کرد که چرا برخی مطالعات سهم انگلیسی را ۶۵.۰٪ (۵۵۷ مهارت مراقبت بهداشتی از طریق ClawHub 2605.02709) و برخی دیگر ۹۹.۷٪ (خزش‌های Seeded انگلیسی 2606.03565) گزارش کرده‌اند. ارقام دیگر شامل ۸۱.۸٪ (۲۶,۵۰۲ مهارت از طریق ClawHub 2604.13064) و ۹۲.۶٪ (۱۳۳,۱۴۹ مهارت از طریق skills.sh 2607.01456) است.

محققان به این نتیجه رسیدند که این‌ها جمعیت‌های متفاوتی هستند: بازارگاه‌های منتخب (Curated) به انگلیسی متمایل‌اند، برش‌های دامنه (Domain Slices) به جایی متمایل‌اند که آن حوزه فعال است، و خزش‌های Seeded دقیقاً همان چیزی را می‌یابند که به دنبالش هستند.

برای اطمینان از اینکه این اعداد ناشی از ابزارهای مورد استفاده نیستند، پلیکارا لبز شناسگر py3langid (با اطمینان >= ۰.۸۰) را با fast-langdetect مقایسه کرد. این دو ابزار در ۹۷.۶٪ اسناد اتفاق نظر داشتند و تفاوت سهم انگلیسی تنها ۱.۲ واحد بود که بسیار کمتر از شکاف هفت واحدی بین مطالعات مختلف است.

آن‌ها همچنین سوگیری غربالگری کیفیت را آزمایش کردند. مهارت‌های غیرانگلیسی در واقع اعتبار متادیتای ابتدایی (Front-matter) بهتری داشتند (۸۸.۱٪) نسبت به مهارت‌های انگلیسی (۸۶.۶٪). فیلتر کردن بر اساس متادیتای معتبر، سهم انگلیسی را تنها از ۸۵.۶٪ به ۸۵.۴٪ تغییر داد که ثابت می‌کند این روند نتیجه حذف فایل‌های غیرانگلیسی نیست.

برای تأیید منشأ جغرافیایی، محققان از برچسب‌های زمانی کامیت‌ها استفاده کردند و «افت‌های شبانه» را رصد کردند، زیرا آفست‌های UTC اغلب نرمال‌سازی می‌شوند:

  • مهارت‌های چینی: کامیت‌ها در ساعات شب شرق آسیا به کمتر از نصف نرخ انگلیسی رسید (۱۵.۳٪ در مقابل ۳۵.۷٪ برای انگلیسی).
  • مهارت‌های اسپانیایی و پرتغالی: اوج فعالیت در ساعت ۱۹:۰۰ UTC بود که با بعدازظهر برزیل و اواخر شب در شبه‌جزیره ایبری همخوانی دارد و نویسندگان را در قاره آمریکا قرار می‌دهد (سهم ۴۶.۵٪ در آن بازه زمانی).
  • مهارت‌های انگلیسی: فعالیت در ۲۴ ساعت شبانه‌روز یکنواخت بود که نشانه توزیع جهانی توسعه‌دهندگان است و هیچ «شب» واحدی ندارد.

این سیگنال‌ها مستقل هستند زیرا شناسگر زبان به زمان کامیت دسترسی ندارد. اگرچه این یک تخمین در سطح جمعیت است و نمی‌تواند UTC+8 را از UTC+9 جدا کند، اما تأییدی قوی برای داده‌های زبانی است.

اثر «کف» و رشد جهانی

پلیکارا لبز استدلال می‌کند که رقم ۱۴.۳٪ در واقع یک «کف» است نه سقف؛ زیرا بسیاری از توسعه‌دهندگان در سریع‌ترین جمعیت‌های در حال رشد — به‌ویژه در هند، نیجریه و سنگاپور — مهارت‌های خود را به انگلیسی می‌نویسند. در نتیجه، شمارش زبانی نمی‌تواند وسعت کامل تغییر اکوسیستم به خارج از ایالات متحده را ببیند.

داده‌های خارجی این موضوع را تأیید می‌کنند:

  • گزارش Octoverse ۲۰۲۵ گیت‌هاب: هند در یک سال ۵.۲ میلیون توسعه‌دهنده اضافه کرد (۱۴٪ از تمام حساب‌های جدید جهانی) و به ۲۱.۹ میلیون کاربر رسید که ۴.۹ برابر جمعیت سال ۲۰۲۰ آن است. برزیل ۴.۱ برابر، اندونزی ۴.۸ برابر و ژاپن ۳ برابر رشد کردند. ثبت‌نام‌های جدید در APAC اکنون حدود ۲۵ مورد در دقیقه است در حالی که در اروپا ۱۲ مورد است. هند، برزیل و اندونزی با هم حدود نیمی از تمام حساب‌های جدید را تشکیل می‌دهند.
  • شاخص AI استنفورد ۲۰۲۶: نرخ پذیرش هوش مصنوعی زاینده (Generative AI) در امارات ۶۴٪ و در سنگاپور ۶۱٪ است، در حالی که آمریکا با ۲۸.۳٪ در رتبه ۲۴ قرار دارد. مشارکت‌های متن‌باز از «بقیه جهان» اکنون از اروپا پیشی گرفته و به آمریکا نزدیک شده است. مهارت‌های مهندسی هوش مصنوعی در امارات، شیلی و آفریقای جنوبی با بیشترین سرعت در حال شتاب گرفتن هستند.

تفاوت در انتشار و نگهداری

یک تفاوت تکان‌دهنده در نحوه استفاده از مهارت‌ها وجود دارد. مهارت‌های انگلیسی «منتشر» (Propagated) می‌شوند: یک بار نوشته شده و به‌طور گسترده کپی می‌شوند اما به‌ندرت بازبینی می‌شوند. اما مهارت‌های غیرانگلیسی «پرورش» (Tended) می‌یابند: کمتر کپی می‌شوند اما دفعات بیشتری ویرایش و اصلاح می‌شوند.

جزئیات کپی‌برداری و بازبینی:

  • تعداد کپی‌ها: سهم غیرانگلیسی با افزایش استفاده کاهش می‌یابد. این سهم در مهارت‌هایی با ۱ کپی ۱۵.۷٪ است (n=۱,۴۸۳,۵۷۵)، اما برای ۲ کپی به ۱۰.۸٪ (n=۱۷۹,۱۰۲)، برای ۳ تا ۵ کپی به ۹.۱٪ (n=۱۳۵,۲۷۱) و در مهارت‌هایی با ۶ کپی یا بیشتر به ۵.۸٪ (n=۷۲,۳۵۱) می‌رسد.
  • اثر تجمیع‌کننده: ده مخزن، ۱۴.۵٪ از تمام فایل‌های مهارت را در اختیار دارند. این ثبت‌ها به زبان‌های غیرانگلیسی متمایل‌تر هستند (۲۰.۵٪ در مقابل ۱۳.۷٪ در جاهای دیگر). حذف آن‌ها در واقع شکاف را بیشتر می‌کند و سهم غیرانگلیسی را از ۱۵.۱٪ (۱ کپی) به ۵.۳٪ می‌رساند. شمارش مالکان متمایز این شکاف را بیشتر کرده و رقم را به ۱۵.۱٪ در مقابل ۴.۶٪ می‌رساند.
  • نرخ بازبینی (اصلاح شده بر اساس سن):
    • در ۷ روز اول: انگلیسی ۱۴.۴٪ در مقابل غیرانگلیسی ۱۵.۷٪ (+۱.۳ واحد)
    • در ۳۰ روز اول: انگلیسی ۲۱.۷٪ در مقابل غیرانگلیسی ۲۶.۹٪ (+۵.۲ واحد)
    • در ۹۰ روز اول: انگلیسی ۲۸.۷٪ در مقابل غیرانگلیسی ۳۳.۹٪ (+۵.۲ واحد)

این شکاف احتمالاً ناشی از نقص در ابزارها است. چون کشف مهارت‌ها لغوی (مبتنی بر جست‌وجو) است، توسعه‌دهنده‌ای که به انگلیسی جست‌وجو می‌کند، مهارت باکیفیت نوشته شده به زبان چینی را پیدا نمی‌کند، حتی اگر مدل چندزبانه بتواند آن را به‌طور کامل اجرا کند. اکوسیستم در آنچه «نوشته می‌شود» بسیار زودتر از آنچه «استفاده مجدد می‌شود» جهانی می‌گردد.

نقش نویسندگی هوش مصنوعی

در نهایت، این مطالعه بررسی کرد که چه کسی این مهارت‌ها را می‌نویسد. چون تگ bot گیت‌هاب تنها ۱.۰٪ از مهارت‌ها را شناسایی کرد، محققان تریلر «Co-Authored-By» را در کامیت‌های git تحلیل کردند.

آن‌ها دریافتند که ۳۰.۴٪ [۳۰.۳, ۳۰.۶] از مهارت‌ها توسط عامل‌های هوش مصنوعی نوشته شده‌اند. کلود (Claude) اکثریت مطلق این تریلرها را به خود اختصاص داده است و Cursor, Copilot و Codex بسیار عقب‌تر هستند. این تریلرها حتی نسخه‌های خاص مدل را حمل می‌کنند. این روند بر اساس زبان متفاوت بود:

  • مهارت‌های ژاپنی: ۴۳.۴٪ توسط عامل‌ها نوشته شده‌اند.
  • مهارت‌های چینی: ۲۳.۲٪ توسط عامل‌ها نوشته شده‌اند.

پیامدهای فنی و محدودیت‌ها

برای جامعه فنی، این تغییر این فرض را به چالش می‌کشد که انگلیسی تنها واسطه اصلی برای ارکستراسیون هوش مصنوعی است. با این حال، محققان به چندین محدودیت در داده‌ها اشاره می‌کنند:

  • هم‌پوشانی زبانی: شناسایی زبان بر اساس خط و کلمات کاربردی است. یک مهارت آلمانی که سرشار از واژگان فنی انگلیسی باشد ممکن است به‌اشتباه انگلیسی شناسایی شود، بنابراین سهم غیرانگلیسی یک «حد پایین» است.
  • شکاف‌های زمانی: تاریخ‌ها تنها بخشی از مجموعه داده و نمایندگان حذف تکرار را پوشش می‌دهند. «ایجاد شده» به اولین کامیتی اشاره دارد که به آن کپی خاص دست زده است، نه اولین ظهور محتوا.
  • سوگیری بازماندگان: خزش تنها بازماندگان را می‌بیند. هر مهارتی که قبل از ژوئیه ۲۰۲۶ ایجاد و حذف شده باشد، نامرئی است که احتمالاً ارقام نگهداری را بیش از حد نشان می‌دهد.

برای اینکه ببینیم آیا این موضوع به عملکرد تبدیل می‌شود، گام حیاتی بعدی تحلیل ردپاهای اجرا (Execution Traces) است تا مشخص شود آیا مهارت‌های غیرانگلیسی در محیط تولید واقعاً بهتر یا بدتر از همتایان انگلیسی خود عمل می‌کنند. سؤال بزرگتر باقی می‌ماند: اگر سهم غیرانگلیسی هر فصل ۳ واحد رشد می‌کند و سریع‌ترین جمعیت‌های در حال رشد به انگلیسی می‌نویسند، چه مقدار از اکوسیستم هوش مصنوعی همین حالا از ایالات متحده فراتر رفته است؟

گام بعدی شما

  • اگر توسعه‌دهنده هستید، بررسی کنید که آیا مهارت‌های عامل خود را در قالب SKILL.md استاندارد کرده‌اید یا خیر.
  • برای دسترسی به بازارهای جهانی، از مدل‌های چندزبانه برای ترجمه و بهینه‌سازی مهارت‌های محلی خود به انگلیسی استفاده کنید تا نرخ کپی شدن (Reuse) آن‌ها افزایش یابد.
  • در صورت استفاده از عامل‌های کدنویس، خروجی‌های مدل‌هایی مانند Claude را برای تولید فایل‌های مهارت ساختاریافته ارزیابی کنید.

اما تأثیر این تغییرات زبانی بر عملکرد واقعی مدل‌ها در محیط تولید هنوز ناشناخته است — به تحلیل ما درباره‌ی تأخیر استنتاج در مدل‌های چندزبانه مراجعه کنید.

چرا این موضوع مهم است؟

این داده‌ها بر اساس تحلیل آماری ۳.۸ میلیون فایل در گیت‌هاب، اعتبار ادعای کاهش وابستگی اکوسیستم AI به زبان انگلیسی را تأیید می‌کند. این تغییر باعث می‌شود توسعه‌دهندگان در مناطق غیرانگلیسی‌زبان بتوانند با دقت بالاتر و بدون واسطه، رفتار عامل‌های هوشمند را کنترل کنند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی، این روند فرصتی است تا مهارت‌های عامل‌های خود را به زبان فارسی بنویسند و از دقت بالاتر در تعریف دستورالعمل‌های محلی بهره ببرند، هرچند برای جذب کاربر جهانی همچنان نیاز به نسخه‌های انگلیسی است.

·نگاه ما
تحریریه دات‌هوش

تمرکززدایی از زبان انگلیسی در لایه ارکستراسیون عامل‌ها، نشان‌دهنده گذار از «هوش مصنوعی به عنوان ابزار آمریکایی» به «هوش مصنوعی به عنوان زیرساخت بومی» است. نکته کلیدی اینجاست که مدل‌های زبانی اکنون به قدری قدرتمند شده‌اند که زبان مادری توسعه‌دهنده دیگر یک مانع فنی نیست، بلکه به ابزاری برای دقت بیشتر در تعریف رویه‌ها تبدیل شده است. این روند احتمالاً منجر به ظهور «سیلوهای دانش» زبانی می‌شود که در آن مهارت‌های بسیار پیشرفته‌ای در زبان‌های غیرانگلیسی تولید می‌شوند اما به دلیل ضعف در ابزارهای جست‌وجوی متنی، در سطح جهانی دیده نمی‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.