پرش به محتوای اصلی
پرش به محتوای مقاله

۲ شرکت پیشرو که شفافیت داده‌های آموزشی را در اروپا پذیرفتند

·۱۶ مهر ۱۴۰۵۶ دقیقه مطالعه
تنها ۲ از ۲۱ ارائه‌دهنده هوش مصنوعی، سند مورد نیاز قانون اتحادیه اروپا را منتشر کرده‌اند
تنها ۲ از ۲۱ ارائه‌دهنده هوش مصنوعی، سند مورد نیاز قانون اتحادیه اروپا را منتشر کرده‌اند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین پایش کمی از میزان تطبیق ارائه‌دهندگان AI با قالب‌های اجباری EU AI Act که نشان می‌دهد ۹۰٪ از پیشروان صنعت، حتی با وجود مهلت قانونی، استانداردهای حداقلی مستندسازی را نادیده گرفته‌اند.

اگر مدیر محصول یا توسعه‌دهنده‌ای هستید که برای ورود به بازار اروپا برنامه‌ریزی می‌کنید، باید بدانید که شفافیت در داده‌های آموزشی دیگر یک انتخاب نیست، بلکه یک الزام قانونی است. طبق گزارش منتشر شده در ۸ اکتبر ۲۰۲۶، ۱۹ شرکت از ۲۱ ارائه‌دهنده بزرگ هوش مصنوعی زاینده (Generative AI) — که شبیه آشپزی با دستور پختی است که از میلیاردها صفحه متن یاد گرفته — قالب‌های مستندسازی اجباری اتحادیه اروپا را نادیده گرفته‌اند.

این اصطکاک رگولاتوری درست زمانی رخ داد که دفتر هوش مصنوعی اتحادیه اروپا در ۲ اوت ۲۰۲۶ نظارت رسمی بر قوانین مدل‌های عمومی را آغاز کرد. بر اساس مستندات ماده ۵۳(۱)(د) از مقررات (EU) 2024/1689، ارائه‌دهندگان باید یک «خلاصه عمومی با جزئیات کافی» از محتوای آموزشی خود منتشر کنند. این رویکرد نظارتی سخت‌گیرانه در اروپا، مشابه تغییراتی است که در سایر نقاط جهان می‌بینیم؛ برای مثال، دولت بریتانیا نیز اخیراً نظارت بر تجهیزات پزشکی AI را از تأیید تک‌مرحله‌ای به مدل چرخهٔ عمر تغییر داد تا ایمنی بلندمدت را تضمین کند. این قانون برای همه، از مدل‌های رایگان گرفته تا مدل‌های با وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پختشان علناً منتشر شده و نه فقط غذای آماده — لازم است. اگرچه این الزام از ۲ اوت ۲۰۲۵ شروع شد، اما مدل‌های قدیمی‌تر تا ۲ اوت ۲۰۲۷ فرصت دارند تا خود را تطبیق دهند.

کمیسیون اروپا برای استانداردسازی این فرآیند، در ۵ دسامبر ۲۰۲۵ یک قالب اجباری تحت عنوان (C(2025) 8311 final) منتشر کرد. این فرم از یک «اطلاعیه توضیحی» و یک فرم پرکردنی تشکیل شده است که شامل سه بخش حیاتی است:

  • اطلاعات کلی: شامل نام ارائه‌دهنده، نماینده قانونی مجاز در اتحادیه اروپا، نام مدل همراه با نسخه، تاریخ عرضه در بازار اروپا، مودالیته (نوع ورودی/خروجی)، بازه‌های اندازه داده برای هر مودالیته و انواع محتوا.
  • لیست منابع داده‌ها.
  • جنبه‌های پردازش داده‌ها.

کمیسیون تأکید کرده است که این قالب یک «خط پایه حداقلی» است؛ یعنی هر سندی که جزئیات کمتری داشته باشد یا از این ساختار پیروی نکند، غیرقانونی و غیرمنطبق تلقی می‌شود.

شکاف در رعایت قوانین

تنها ۲ از ۲۱ ارائه‌دهنده هوش مصنوعی سند مورد درخواست قانون هوش مصنوعی اتحادیه اروپا را منتشر کرده‌اند

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، شکاف بین استانداردهای صنعتی و الزامات قانونی همواره یک نقطه ضعف است. در این مورد، DeepSeek الگوی رعایت قانون است. خلاصه مدل V3.2 این شرکت که در ۳ سپتامبر ۲۰۲۶ به‌روز شد، یک سند ۵ صفحه‌ای است که دقیقاً از قالب اتحادیه اروپا پیروی می‌کند. این سند صراحتاً نماینده قانونی، تاریخ عرضه (۲۱ اوت ۲۰۲۵) و بازه‌های اندازه داده برای هر مودالیته را نام می‌برد. لیست منابع آن شامل Common Crawl، Stack Exchange، داده‌های دارای لایسنس و داده‌های سنتتیک است. همچنین صراحتاً ذکر شده که هیچ داده‌ای از کاربران استفاده نشده و رزرو مربوط به استخراج متن و داده (TDM) در آن گنجانده شده است.

شرکت Mistral نیز با ایجاد یک مرکز قانونی برای ۴۲ مدل خود، این معیارها را برآورده کرده است. این مرکز مستندات فنی و چرخه عمر هر مدل را ارائه می‌دهد. به‌طور خاص، مدل Large 3 این شرکت دارای یک «خلاصه عمومی محتوای آموزشی» است که ساختار مورد نیاز اتحادیه اروپا را کاملاً رعایت کرده است.

در مقابل، غول‌های آمریکایی شفافیت را به حاشیه رانده‌اند. به گزارش دیده‌بان Open Future در دسامبر ۲۰۲۵ در پستی با عنوان «۵+۳+۳=۰ شفافیت»، کارت‌های مدل آمریکایی حتی شباهتی به قالب اتحادیه اروپا ندارند. بررسی ۸ اکتبر این الگوی «مستندات پوچ» را تأیید می‌کند:

  • OpenAI: در کارت مدل GPT-6.1 Sol (به تاریخ ۲۹ سپتامبر ۲۰۲۶)، کل بخش «داده‌های مدل و آموزش» تنها یک جمله است که کاربر را به کارت مدل GPT-6 Astra ارجاع می‌دهد.
  • Google: کارت مدل Gemini 3 Pro تنها یک پاراگراف کوتاه درباره داده‌های آموزشی دارد.
  • Meta: کارت مدل Llama 4 فقط دو خط متن در کنار تعداد توکن‌های تقریبی ۴۰ تریلیون و ۲۲ تریلیون دارد.
  • Anthropic: با وجود انتشار یک کارت سیستم عظیم ۱۴۹ صفحه‌ای برای Claude Sonnet 4.5 در ۳ دسامبر ۲۰۲۵، بخش آموزش آن تنها دو پاراگراف است. این بخش به ترکیب داده‌ها، فایل robots.txt و کاربران داوطلب اشاره می‌کند، اما فاقد نام نماینده قانونی در اروپا و تاریخ عرضه در بازار است.

تحلیل ارائه‌دهندگان جهانی

سایر بازیگران جهانی نیز در سطوح مختلفی از جزئیات قرار دارند اما همچنان در آزمون قالب اتحادیه اروپا شکست خورده‌اند. این سرشماری ارائه‌دهندگان را بر اساس کیفیت مستندات به دسته‌های زیر تقسیم کرد:

دسته T2+ (جزئیات زیاد اما بدون قالب قانونی):

  • Aleph Alpha: گزارش فنی مدل Kolibri-1 قوی‌ترین کارت مدل مشاهده شده است که تفکیک ۲۰ تریلیون توکن و توزیع زبانی را ارائه می‌دهد. این شرکت همچنین امضاکننده «کد رویه» (Code of Practice) است.
  • Alibaba (Qwen): مقاله arXiv مدل Qwen3 (با کد 2505.09388) ترکیب ۳۶ تریلیون توکن را ارائه کرده است.
  • Moonshot (Kimi): گزارش فنی مدل K2 تعداد ۱۵.۵ تریلیون توکن را لیست کرده است.
  • Baidu: مقاله arXiv مدل ERNIE 5.0 (با کد 2602.04705) جزئیات فنی دارد اما خلاصه رگولاتوری ارائه نداده است.
  • IBM: مدل Granite 4.0 از ترکیبی از یک کارت برای منابع SFT و یک گزارش فنی برای مخلوط پیش‌آموزش استفاده می‌کند.
  • NVIDIA: گزارش فنی PDF مدل Nemotron 3 Ultra جزئیات زیادی دارد اما ساختار قالب را ندارد.
  • Cerebras: برای مدل Cerebras-GPT از ترکیبی از مقاله و کارت مدل استفاده می‌کند.

دسته T2 (بخش‌های کوتاه):

  • xAI: کارت مدل Grok 4.6 (به تاریخ ۱۲ اوت ۲۰۲۶) تنها شامل یک پاراگراف است.
  • Amazon: کارت هوش مصنوعی مسئولانه برای Nova 2 Lite تنها یک پاراگراف دارد.
  • Cohere: صفحه مستندات Command A+ شامل سه خط کلی است.
  • Microsoft: کارت مدل Phi-4 چهار دسته منبع (۹.۸ تریلیون توکن) را لیست کرده، در حالی که سری MAI اصلاً کارت مدل ندارد.

دسته T1-2 و تایید نشده (بسیار ضعیف یا مفقود):

  • Stability AI: کارت مدل SD 3.5 در یک مخزن بسته (gated) در Hugging Face پنهان شده است.
  • ByteDance: اطلاعات مدل Doubao Seed محدود به صفحات پژوهشی است.
  • Zhipu: مدل GLM-4.6 از یک کارت و یک گزارش GLM-4.5 استفاده می‌کند.
  • Tencent: مدل Hunyuan تایید نشده باقی مانده و اطلاعات آن فقط در سطح وبلاگ موجود است.

پارادوکس شفافیت

این شکاف نشان‌دهنده یک تضاد بنیادین در نگاه آزمایشگاه‌های هوش مصنوعی به رگولاتوری است. برای DeepSeek و Mistral، قالب اتحادیه اروپا همان «خروجی نهایی» و تحویل‌دادنی است. اما برای بقیه صنعت، «کارت مدل» (Model Card) — که یک استاندارد داوطلبانه صنعتی است — جایگزینی کافی دیده می‌شود.

اما دفتر هوش مصنوعی اروپا به دنبال گزارش‌های فنی کلی نیست؛ آن‌ها با درخواست فیلدهایی خاص مثل «نماینده قانونی» و «بازه‌های اندازه داده»، در حال ساخت یک مسیر حسابرسی (Audit Trail) قابل تایید هستند. تکیه فعلی شرکت‌ها به پاراگراف‌های مبهم در کارت‌های سیستم نشان می‌دهد که بسیاری از ارائه‌دهندگان شرط‌بندی کرده‌اند که دفتر هوش مصنوعی، پاسخ‌های «تقریبی» را به عنوان رعایت قانون بپذیرد.

این سرشماری به عنوان یک تصویر لحظه‌ای در ۸ اکتبر ۲۰۲۶ انجام شد. متدولوژی این بررسی، نقاط کوری مانند مخازن بسته و اسناد زبان چینی را که در جستجوی انگلیسی‌زبان نبوده‌اند، می‌پذیرد. همچنین اشاره شده است که وضعیت امضای «کد رویه» احتمالاً پیش‌بینی‌کننده رفتار ارائه‌دهندگان در رعایت قوانین است.

برای رهبران کسب‌وکار، این عدم شفافیت یک ریسک پنهان است. اگر دفتر هوش مصنوعی تصمیم بگیرد که یک پاراگراف کوتاه «خط پایه حداقلی» نیست، مدل‌ها پس از پایان مهلت ۲۰۲۷ با اقدامات اجرایی یا محدودیت دسترسی به بازار اروپا مواجه می‌شوند. ارزش این رصدها تنها در وضعیت فعلی نیست، بلکه در ردیابی تغییرات (diff) است؛ یعنی اینکه چه کسی مستندات خود را به‌روز می‌کند و چه زمانی، چرا که محیط رگولاتوری در حال تغییر است.

گام بعدی شما

  • اگر از مدل‌های تجاری در محصولات اروپایی استفاده می‌کنید، بررسی کنید که آیا ارائه‌دهنده مدل شما نماینده قانونی در اتحادیه اروپا دارد یا خیر.
  • برای مدل‌های متن‌باز، مستندات DeepSeek را به عنوان یک بنچمارک برای شفافیت داده‌ها مطالعه کنید.
  • تغییرات در کارت‌های مدل غول‌های فناوری را رصد کنید تا متوجه شوید چه زمانی فشار رگولاتوری آن‌ها را مجبور به تغییر می‌کند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این وضعیت اعتبار رگولاتوری اتحادیه اروپا را به چالش می‌کشد و نشان می‌دهد که اجرای قانون AI Act با مقاومت ساختاری غول‌های فناوری روبروست. عدم تطبیق با این قوانین می‌تواند منجر به خروج مدل‌های پیشرو از بازار یکی از بزرگ‌ترین اقتصادهای جهان شود.

تأثیر برای ایران

این خبر اثر مستقیمی بر کاربران ایرانی ندارد، اما برای توسعه‌دهندگانی که مدل‌های خود را برای بازار اروپا بهینه‌سازی می‌کنند، یک هشدار جدی درباره استانداردهای مستندسازی داده‌هاست.

·نگاه ما
تحریریه دات‌هوش

اتکا به «کارت‌های مدل» داوطلبانه به جای قالب‌های قانونی، نشان می‌دهد که غول‌های AI هنوز سعی دارند استانداردهای خودشان را به رگولاتورها تحمیل کنند. این تقابل احتمالاً به یک رویارویی حقوقی منجر می‌شود که در آن تعریف «شفافیت کافی» به جای یک بحث فنی، به یک بحث قضایی تبدیل خواهد شد. در واقع، شرکت‌های آمریکایی روی این قمار کرده‌اند که اتحادیه اروپا در نهایت تسلیم استانداردهای صنعت شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.