اگر مدیر محصول یا توسعهدهندهای هستید که برای ورود به بازار اروپا برنامهریزی میکنید، باید بدانید که شفافیت در دادههای آموزشی دیگر یک انتخاب نیست، بلکه یک الزام قانونی است. طبق گزارش منتشر شده در ۸ اکتبر ۲۰۲۶، ۱۹ شرکت از ۲۱ ارائهدهنده بزرگ هوش مصنوعی زاینده (Generative AI) — که شبیه آشپزی با دستور پختی است که از میلیاردها صفحه متن یاد گرفته — قالبهای مستندسازی اجباری اتحادیه اروپا را نادیده گرفتهاند.
این اصطکاک رگولاتوری درست زمانی رخ داد که دفتر هوش مصنوعی اتحادیه اروپا در ۲ اوت ۲۰۲۶ نظارت رسمی بر قوانین مدلهای عمومی را آغاز کرد. بر اساس مستندات ماده ۵۳(۱)(د) از مقررات (EU) 2024/1689، ارائهدهندگان باید یک «خلاصه عمومی با جزئیات کافی» از محتوای آموزشی خود منتشر کنند. این رویکرد نظارتی سختگیرانه در اروپا، مشابه تغییراتی است که در سایر نقاط جهان میبینیم؛ برای مثال، دولت بریتانیا نیز اخیراً نظارت بر تجهیزات پزشکی AI را از تأیید تکمرحلهای به مدل چرخهٔ عمر تغییر داد تا ایمنی بلندمدت را تضمین کند. این قانون برای همه، از مدلهای رایگان گرفته تا مدلهای با وزنهای باز (Open Weights) — یعنی مدلهایی که دستور پختشان علناً منتشر شده و نه فقط غذای آماده — لازم است. اگرچه این الزام از ۲ اوت ۲۰۲۵ شروع شد، اما مدلهای قدیمیتر تا ۲ اوت ۲۰۲۷ فرصت دارند تا خود را تطبیق دهند.
کمیسیون اروپا برای استانداردسازی این فرآیند، در ۵ دسامبر ۲۰۲۵ یک قالب اجباری تحت عنوان (C(2025) 8311 final) منتشر کرد. این فرم از یک «اطلاعیه توضیحی» و یک فرم پرکردنی تشکیل شده است که شامل سه بخش حیاتی است:
- اطلاعات کلی: شامل نام ارائهدهنده، نماینده قانونی مجاز در اتحادیه اروپا، نام مدل همراه با نسخه، تاریخ عرضه در بازار اروپا، مودالیته (نوع ورودی/خروجی)، بازههای اندازه داده برای هر مودالیته و انواع محتوا.
- لیست منابع دادهها.
- جنبههای پردازش دادهها.
کمیسیون تأکید کرده است که این قالب یک «خط پایه حداقلی» است؛ یعنی هر سندی که جزئیات کمتری داشته باشد یا از این ساختار پیروی نکند، غیرقانونی و غیرمنطبق تلقی میشود.
شکاف در رعایت قوانین

همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، شکاف بین استانداردهای صنعتی و الزامات قانونی همواره یک نقطه ضعف است. در این مورد، DeepSeek الگوی رعایت قانون است. خلاصه مدل V3.2 این شرکت که در ۳ سپتامبر ۲۰۲۶ بهروز شد، یک سند ۵ صفحهای است که دقیقاً از قالب اتحادیه اروپا پیروی میکند. این سند صراحتاً نماینده قانونی، تاریخ عرضه (۲۱ اوت ۲۰۲۵) و بازههای اندازه داده برای هر مودالیته را نام میبرد. لیست منابع آن شامل Common Crawl، Stack Exchange، دادههای دارای لایسنس و دادههای سنتتیک است. همچنین صراحتاً ذکر شده که هیچ دادهای از کاربران استفاده نشده و رزرو مربوط به استخراج متن و داده (TDM) در آن گنجانده شده است.
شرکت Mistral نیز با ایجاد یک مرکز قانونی برای ۴۲ مدل خود، این معیارها را برآورده کرده است. این مرکز مستندات فنی و چرخه عمر هر مدل را ارائه میدهد. بهطور خاص، مدل Large 3 این شرکت دارای یک «خلاصه عمومی محتوای آموزشی» است که ساختار مورد نیاز اتحادیه اروپا را کاملاً رعایت کرده است.
در مقابل، غولهای آمریکایی شفافیت را به حاشیه راندهاند. به گزارش دیدهبان Open Future در دسامبر ۲۰۲۵ در پستی با عنوان «۵+۳+۳=۰ شفافیت»، کارتهای مدل آمریکایی حتی شباهتی به قالب اتحادیه اروپا ندارند. بررسی ۸ اکتبر این الگوی «مستندات پوچ» را تأیید میکند:
- OpenAI: در کارت مدل GPT-6.1 Sol (به تاریخ ۲۹ سپتامبر ۲۰۲۶)، کل بخش «دادههای مدل و آموزش» تنها یک جمله است که کاربر را به کارت مدل GPT-6 Astra ارجاع میدهد.
- Google: کارت مدل Gemini 3 Pro تنها یک پاراگراف کوتاه درباره دادههای آموزشی دارد.
- Meta: کارت مدل Llama 4 فقط دو خط متن در کنار تعداد توکنهای تقریبی ۴۰ تریلیون و ۲۲ تریلیون دارد.
- Anthropic: با وجود انتشار یک کارت سیستم عظیم ۱۴۹ صفحهای برای Claude Sonnet 4.5 در ۳ دسامبر ۲۰۲۵، بخش آموزش آن تنها دو پاراگراف است. این بخش به ترکیب دادهها، فایل robots.txt و کاربران داوطلب اشاره میکند، اما فاقد نام نماینده قانونی در اروپا و تاریخ عرضه در بازار است.
تحلیل ارائهدهندگان جهانی
سایر بازیگران جهانی نیز در سطوح مختلفی از جزئیات قرار دارند اما همچنان در آزمون قالب اتحادیه اروپا شکست خوردهاند. این سرشماری ارائهدهندگان را بر اساس کیفیت مستندات به دستههای زیر تقسیم کرد:
دسته T2+ (جزئیات زیاد اما بدون قالب قانونی):
- Aleph Alpha: گزارش فنی مدل Kolibri-1 قویترین کارت مدل مشاهده شده است که تفکیک ۲۰ تریلیون توکن و توزیع زبانی را ارائه میدهد. این شرکت همچنین امضاکننده «کد رویه» (Code of Practice) است.
- Alibaba (Qwen): مقاله arXiv مدل Qwen3 (با کد 2505.09388) ترکیب ۳۶ تریلیون توکن را ارائه کرده است.
- Moonshot (Kimi): گزارش فنی مدل K2 تعداد ۱۵.۵ تریلیون توکن را لیست کرده است.
- Baidu: مقاله arXiv مدل ERNIE 5.0 (با کد 2602.04705) جزئیات فنی دارد اما خلاصه رگولاتوری ارائه نداده است.
- IBM: مدل Granite 4.0 از ترکیبی از یک کارت برای منابع SFT و یک گزارش فنی برای مخلوط پیشآموزش استفاده میکند.
- NVIDIA: گزارش فنی PDF مدل Nemotron 3 Ultra جزئیات زیادی دارد اما ساختار قالب را ندارد.
- Cerebras: برای مدل Cerebras-GPT از ترکیبی از مقاله و کارت مدل استفاده میکند.
دسته T2 (بخشهای کوتاه):
- xAI: کارت مدل Grok 4.6 (به تاریخ ۱۲ اوت ۲۰۲۶) تنها شامل یک پاراگراف است.
- Amazon: کارت هوش مصنوعی مسئولانه برای Nova 2 Lite تنها یک پاراگراف دارد.
- Cohere: صفحه مستندات Command A+ شامل سه خط کلی است.
- Microsoft: کارت مدل Phi-4 چهار دسته منبع (۹.۸ تریلیون توکن) را لیست کرده، در حالی که سری MAI اصلاً کارت مدل ندارد.
دسته T1-2 و تایید نشده (بسیار ضعیف یا مفقود):
- Stability AI: کارت مدل SD 3.5 در یک مخزن بسته (gated) در Hugging Face پنهان شده است.
- ByteDance: اطلاعات مدل Doubao Seed محدود به صفحات پژوهشی است.
- Zhipu: مدل GLM-4.6 از یک کارت و یک گزارش GLM-4.5 استفاده میکند.
- Tencent: مدل Hunyuan تایید نشده باقی مانده و اطلاعات آن فقط در سطح وبلاگ موجود است.
پارادوکس شفافیت
این شکاف نشاندهنده یک تضاد بنیادین در نگاه آزمایشگاههای هوش مصنوعی به رگولاتوری است. برای DeepSeek و Mistral، قالب اتحادیه اروپا همان «خروجی نهایی» و تحویلدادنی است. اما برای بقیه صنعت، «کارت مدل» (Model Card) — که یک استاندارد داوطلبانه صنعتی است — جایگزینی کافی دیده میشود.
اما دفتر هوش مصنوعی اروپا به دنبال گزارشهای فنی کلی نیست؛ آنها با درخواست فیلدهایی خاص مثل «نماینده قانونی» و «بازههای اندازه داده»، در حال ساخت یک مسیر حسابرسی (Audit Trail) قابل تایید هستند. تکیه فعلی شرکتها به پاراگرافهای مبهم در کارتهای سیستم نشان میدهد که بسیاری از ارائهدهندگان شرطبندی کردهاند که دفتر هوش مصنوعی، پاسخهای «تقریبی» را به عنوان رعایت قانون بپذیرد.
این سرشماری به عنوان یک تصویر لحظهای در ۸ اکتبر ۲۰۲۶ انجام شد. متدولوژی این بررسی، نقاط کوری مانند مخازن بسته و اسناد زبان چینی را که در جستجوی انگلیسیزبان نبودهاند، میپذیرد. همچنین اشاره شده است که وضعیت امضای «کد رویه» احتمالاً پیشبینیکننده رفتار ارائهدهندگان در رعایت قوانین است.
برای رهبران کسبوکار، این عدم شفافیت یک ریسک پنهان است. اگر دفتر هوش مصنوعی تصمیم بگیرد که یک پاراگراف کوتاه «خط پایه حداقلی» نیست، مدلها پس از پایان مهلت ۲۰۲۷ با اقدامات اجرایی یا محدودیت دسترسی به بازار اروپا مواجه میشوند. ارزش این رصدها تنها در وضعیت فعلی نیست، بلکه در ردیابی تغییرات (diff) است؛ یعنی اینکه چه کسی مستندات خود را بهروز میکند و چه زمانی، چرا که محیط رگولاتوری در حال تغییر است.
گام بعدی شما
- اگر از مدلهای تجاری در محصولات اروپایی استفاده میکنید، بررسی کنید که آیا ارائهدهنده مدل شما نماینده قانونی در اتحادیه اروپا دارد یا خیر.
- برای مدلهای متنباز، مستندات DeepSeek را به عنوان یک بنچمارک برای شفافیت دادهها مطالعه کنید.
- تغییرات در کارتهای مدل غولهای فناوری را رصد کنید تا متوجه شوید چه زمانی فشار رگولاتوری آنها را مجبور به تغییر میکند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو