پرش به محتوای اصلی
پرش به محتوای مقاله

نشت داده‌های کاربران در زنجیره تأمین مدل‌های بنیادی؛ شکافی در قانون اتحادیه

·۲۱ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
مقاله‌ای درباره قانون هوش مصنوعی اتحادیه اروپا و داده‌های آموزشی برای بنیان‌گذاران
مقاله‌ای درباره قانون هوش مصنوعی اتحادیه اروپا و داده‌های آموزشی برای بنیان‌گذاران
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای این واقعیت که حتی شرکت‌های پیشرو مانند گوگل و OpenAI، به‌طور پیش‌فرض از داده‌های API برای آموزش استفاده می‌کنند و گزینه‌های انصراف در برخی موارد (مانند بررسی‌های انسانی) عملاً بی‌اثر است.

اگر امروز برای مدل‌های هوش مصنوعی هزینه پرداخت می‌کنید، احتمالاً داده‌های حساس کاربران شما در حال تبدیل شدن به سوخت رایگان برای آموزش مدل‌های شرکت‌های بزرگ است. با وجود وعده‌هایی که به کاربران درباره امنیت داده‌ها می‌دهید، مدل‌های بنیادینی که در محصول خود ادغام می‌کنید، احتمالاً به‌صورت پیش‌فرض با این گفتگوها به عنوان متریال آموزشی رایگان برخورد می‌کنند. این یعنی حریم خصوصی محصول شما، تنها به اندازه ضعیف‌ترین حلقه در زنجیره APIهایتان است.

این وضعیت به دلیل یک نقطه کور خاص در قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) رخ داده است. ماده ۵۰ این قانون سیستم‌های هوش مصنوعی را موظف می‌کند اعلام کنند که یک شخص در حال تعامل با یک ماشین است، اما درباره نحوه نگهداری داده‌ها یا استفاده از آن‌ها برای آموزش مدل‌ها پس از این افشا، هیچ سخنی نمی‌گوید. جزئیات دقیق‌تر این تعهدات و الزامات شفافیت در گزارش ما درباره ماده ۵۰ قانون اتحادیه اروپا بررسی شده است. برای بنیان‌گذاران، این به معنای آن است که رعایت قانون لزوماً به معنای حفاظت از حریم خصوصی کاربر نیست.

زمینه رگولاتوری

عدم مدیریت درست در این مسیر می‌تواند بسیار گران تمام شود. این مقررات از ۲ اوت ۲۰۲۶ اجرایی شده‌اند و جریمه‌های عدم رعایت آن‌ها می‌تواند تا ۱۵ میلیون یورو یا ۳٪ از گردش سالانه جهانی شرکت باشد، هر کدام که مبلغش بیشتر باشد. این تاریخ دقیقاً با آغاز اجرای رویکرد جدید اتحادیه اروپا برای مقابله با محتواهای ناشناس AI هم‌زمان است.

با این حال، موضوع نگهداری و آموزش داده‌ها کاملاً خارج از محدوده ماده ۵۰ قرار دارد. اگر اپلیکیشن شما گفتگوهای کاربر را به یک مدل شخص ثالث می‌فرستد، رویه‌های داده‌ای آن ارائه‌دهنده — چه بخواهید و چه نخواهید — بخشی از محصول شما می‌شود. ریسک واقعی تنها جریمه‌های نقدی نیست، بلکه به ارث بردن رویه‌های داده‌ای تامین‌کنندگان شماست.

تله آموزش پیش‌فرض

پژوهشگران مؤسسه هوش مصنوعی انسان‌محور استنفورد (Stanford’s Institute for Human-Centered AI) سیاست‌های حریم خصوصی ۶ توسعه‌دهنده بزرگ آمریکایی شامل آمازون، آنتروپیک، گوگل، متا، مایکروسافت و OpenAI را بررسی کردند. یافته‌ها تکان‌دهنده است: تک‌تک این شرکت‌ها از داده‌های چت مشتریان به‌صورت پیش‌فرض برای آموزش مدل‌های خود استفاده می‌کنند و برخی از آن‌ها این داده‌ها را برای مدت نامحدود نگه می‌دارند.

جنیفر کینگ، پژوهشگر ارشد این پروژه، در پاسخ به سؤال این‌که آیا کاربران سیستم‌های چت هوش مصنوعی باید نگران حریم خصوصی خود باشند، صراحتاً پاسخ داد: «قطعاً بله». این موضوع باعث می‌شود که در هر ادغام API، فرض بر این باشد که آموزش مدل حالت پیش‌فرض است، مگر اینکه مستندات صراحتاً خلاف آن را اعلام کنند.

نوسانات در شرایط تامین‌کنندگان

حتی شرکت‌هایی که ادعای «اولویت با حریم خصوصی» دارند، اهداف خود را تغییر می‌دهند. آنتروپیک پیش‌تر رویکردی آگاهانه نسبت به حریم خصوصی را بازاریابی می‌کرد، اما بعداً شرایط مصرف‌کننده را تغییر داد تا گفتگوهای کلود (Claude) به‌صورت پیش‌فرض برای آموزش استفاده شوند و کاربر باید به‌صورت دستی از این روند انصراف دهد (Opt-out). این نشان می‌دهد که سیاست‌های آموزشی یک تامین‌کننده چقدر سریع می‌تواند تغییر کند، حتی زمانی که حریم خصوصی بخشی از وعده‌های اولیه آن بوده است.

در برخی موارد دیگر، گزینه انصراف تنها یک توهم است. گوگل گفتگوهای جمینای (Gemini) را تا سه سال برای بررسی توسط ارزیابان انسانی نگه می‌دارد. خاموش کردن تنظیمات «فعالیت اپلیکیشن‌های جمینای» (Gemini Apps Activity)، داده‌هایی را که قبلاً برای بررسی انسانی علامت‌گذاری شده‌اند، پاک نمی‌کند. وقتی یک گفتگو علامت‌گذاری شود، صرف‌نظر از اینکه کاربر بعداً چه اقدامی انجام دهد، در سیستم‌های گوگل در یک مسیر نگهداری مجزا باقی می‌ماند.

نقطه کور پیمانکاران

نشت داده‌ها تنها به ارائه‌دهنده اصلی محدود نمی‌شود و به برچسب‌گذاران شخص ثالث نیز می‌رسد. ارائه‌دهندگان مدل‌ها به‌طور منظم برچسب‌گذاری داده‌ها و بررسی‌های ایمنی را به پیمانکاران برون‌سپاری می‌کنند. این جزئیات — مانند بازه‌های زمانی نگهداری، محرک‌های بررسی انسانی و دسترسی پیمانکاران — به‌ندرت در متون اصلی سیاست‌های حریم خصوصی دیده می‌شوند و معمولاً در بخش‌های ریز نوشته شده (fine print) پنهان هستند.

در می ۲۰۲۶، دادستان کل تگزاس، کن پاکستون، تحقیقاتی را درباره عینک‌های هوش مصنوعی متا آغاز کرد. این اقدام پس از آن صورت گرفت که گزارش شد ارزیابان داده در شرکت ساما (Sama) — پیمانکاری مستقر در کنیا — می‌توانستند به تصاویر خصوصی کاربران، از جمله تصاویر محیط حمام، دسترسی داشته باشند.

اگرچه این مورد مربوط به دوربین بود، اما همان ریسک برای هوش مصنوعی متنی نیز وجود دارد. وعده یک تامین‌کننده مبنی بر اینکه داده‌ها را «نمی‌فروشد»، به این معنا نیست که کارکنان داخلی یا پیمانکاران برون‌سپاری نمی‌توانند پیش از ورود داده‌ها به خط لوله آموزش، آن‌ها را بخوانند. شرکت‌هایی که این APIها را ادغام می‌کنند، اغلب مجبورند تحقیقات گسترده‌ای انجام دهند تا بفهمند چه کسانی دیگر می‌توانند داده‌ها را ببینند، اما تقریباً هیچ‌کدام از این جزئیات هرگز به دست کاربران نهایی نمی‌رسد.

مسئولیت‌های حقوقی و پیشینه‌ها

مسئولیت قانونی می‌تواند به شرکت‌های پشتیبان ارائه‌دهندگان نیز سرایت کند. Character.AI نمونه‌ای از بازترین و سهل‌گیرانه‌ترین رویه‌های داده‌ای است؛ این شرکت به‌صورت پیش‌فرض از گفتگوهای کاربران برای آموزش استفاده می‌کند و گزینه انصراف را تنها برای کاربران بریتانیا و منطقه اقتصادی اروپا (EEA) ارائه داده است.

به‌طور جداگانه، این شرکت با چالش‌های حقوقی قابل‌توجهی روبرو شده است. در ژانویه ۲۰۲۶، Character.AI و گوگل در اصل پذیرفتند که مجموعه‌ای از شکایت‌ها را تسویه کنند که مدعی بود تعاملات چت‌بات این پلتفرم با افراد زیر سن قانونی باعث آسیب شده است. هرچند این پرونده مستقیماً به آموزش مدل مربوط نبود و هیچ مسئولیتی پذیرفته نشد، اما ثابت می‌کند که ریسک‌های قانونی یک ارائه‌دهنده می‌تواند به شرکت‌های پشتیبان آن منتقل شود.

چک‌لیست بررسی دقیق برای بنیان‌گذاران

اگر محصول شما گفتگوهای کاربر را از طریق یک مدل بنیادین با آموزش پیش‌فرض فعال هدایت می‌کند، شما بدون اطلاع کاربران، یک سیاست داده‌ای را از طرف آن‌ها پذیرفته‌اید. برای جلوگیری از به ارث بردن این ریسک‌ها، بنیان‌گذاران باید تامین‌کنندگان خود را با این چهار گام ارزیابی کنند:

  • مطالعه توافق‌نامه پردازش داده (DPA): این سند اصلی است که نحوه مدیریت داده‌های کاربر را تعیین می‌کند. خواندن کامل آن ضروری است.
  • تأیید سطح قرارداد: ارائه‌دهندگان اغلب در قراردادهای سازمانی (Enterprise) یا API شرایط سخت‌گیرانه‌تری برای عدم آموزش نسبت به محصولات چت مصرف‌کننده ارائه می‌دهند. به‌صورت کتبی تأیید کنید کدام شرایط بر ادغام خاص شما اعمال می‌شود، زیرا بسیاری از بنیان‌گذاران به‌اشتباه فرض می‌کنند زبان قراردادهای سازمانی به‌طور پیش‌فرض آن‌ها را پوشش می‌دهد.
  • تست گزینه‌های انصراف: تعیین کنید که آیا انصراف (Opt-out) هم آموزش و هم بررسی انسانی را متوقف می‌کند یا فقط یکی از این دو را. تامین‌کننده باید بتواند به‌وضوح بگوید کدام یک متوقف شده است.
  • نقشه‌برداری از دسترسی‌های پایین‌دستی: بپرسید چه کسانی برای بررسی‌های ایمنی به داده‌ها دسترسی دارند. وعده‌های حریم خصوصی خود تامین‌کننده به‌طور خودکار به هر پیمانکار در زنجیره گسترش نمی‌یابد.

این یک بررسی یک‌باره نیست. شرایط تامین‌کنندگان به‌سرعت تغییر می‌کند و قراردادی که سال گذشته امضا کردید، ممکن است امروز دیگر از کاربران شما محافظت نکند.

ایجاد یک استاندارد جدید در بازار

ساخت یک گزینه «پذیرش صریح» (Opt-in) و قابل مشاهده برای آموزش، تنها راه پیشی گرفتن از مقررات آینده است. مرز واقعی بین بهبود یک مدل و کسب سود بی‌صدا از اعتماد کاربران وجود دارد. بسیاری از خدمات هوش مصنوعی هنوز با استفاده از گفتگوها برای آموزش بدون درخواست رضایت صریح و آگاهانه، از این مرز عبور می‌کنند.

این رویکرد دارای پیشینه است. اپلیکیشن‌های پیام‌رسان رمزنگاری‌شده و مدیریت‌کننده‌های رمز عبور منتظر نماندند تا رگولاتورها پیش‌فرض‌های سخت‌گیرانه را استاندارد کنند؛ آن‌ها خودشان این انتخاب‌ها را کردند و آن را به یک جایگاه رقابتی در بازار تبدیل کردند. بنیان‌گذاران هوش مصنوعی که اکنون رضایت آگاهانه را اولویت قرار می‌دهند، می‌توانند یکپارچگی داده‌ها را به یک مزیت رقابتی تبدیل کنند.

منتظر دور بعدی به‌روزرسانی‌های حاکمیت داده اتحادیه اروپا باشید، زیرا بعید است ماده ۵۰ آخرین حرف درباره حاکمیت داده‌های هوش مصنوعی باشد. بنیان‌گذاران کسانی هستند که پیش از اجباری شدن، این مرز را ترسیم کنند و مورد اعتماد کاربران برای حساس‌ترین گفتگوهایشان خواهند بود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع اعتبار شرکت‌های فناوری را به شدت به رویه‌های پنهان پیمانکاران وابسته می‌کند. بر اساس استانداردهای اعتماد (Trust)، عدم شفافیت در مورد دسترسی ارزیابان انسانی می‌تواند منجر به جریمه‌های سنگین و تخریب برند شود.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های API، اکثر توسعه‌دهندگان ایرانی از واسطه‌ها یا اکانت‌های غیررسمی استفاده می‌کنند که این ریسک نشت داده‌ها را به دلیل نبود قراردادهای رسمی (DPA) دوچندان می‌کند.

·نگاه ما
تحریریه دات‌هوش

بسیاری از بنیان‌گذاران به اشتباه تصور می‌کنند استفاده از APIهای سازمانی به‌طور خودکار امنیت داده‌ها را تضمین می‌کند، در حالی که در واقعیت، لایه‌های برون‌سپاری (مانند ارزیابان انسانی در کشورهای ثالث) بزرگ‌ترین حفره امنیتی هستند. این وضعیت نشان می‌دهد که «حریم خصوصی» در عصر مدل‌های بنیادی، دیگر یک تنظیم فنی نیست، بلکه یک مدیریت زنجیره تأمین است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.