اگر در بازار اتحادیه اروپا محتوای تولیدشده با هوش مصنوعی منتشر میکنید، از این پس متون شما یک اثر انگشت دیجیتال نامرئی دارند. اوپنایآی در ۵ اکتبر ۲۰۲۶ استقرار مرحلهای سیستم نشانگذاری متنی را آغاز کرد تا الزامات قانونی اتحادیه اروپا را برآورده کند. این استقرار به گونهای طراحی شده است که سیگنالهای آماری را به صورت تدریجی اعمال کند تا اطمینان حاصل شود که شرکت تمامی دستورات قانونی قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) را به طور کامل اجرا میکند.
این اقدام در حالی رخ میدهد که رگولاتورها فشار را برای شناسایی منشأ هوش مصنوعی زاینده (Generative AI) — که شبیه به گذاشتن یک مهر نامرئی روی هر صفحه از نوشتههای یک نویسنده است — افزایش دادهاند. طبق ماده ۵۰ قانون هوش مصنوعی اتحادیه اروپا، ارائهدهندگان باید تضمین کنند که محتوای تولیدشده توسط ماشین به صورتی قابل شناسایی باشد که سیستمهای دیگر بتوانند آن را در قالب یک فرمت ماشینخوان (machine-readable) بخوانند. این فشار قانونی در ادامه روند کلی تغییرات امنیتی شرکت است؛ همانطور که در تحلیل قبلی ما دربارهی تلاشهای OpenAI برای محدود کردن پرسوجوهای حساس مربوط به خودکشی کاربران اشاره کردیم، این شرکت اکنون در حال انطباق با استانداردهای سختگیرانه دولتی است تا از مخاطرات احتمالی جلوگیری کند.
زمینه رگولاتوری
طبق اعلام رسمی، تعهدات شفافیت ماده ۵۰ که شامل نشانگذاری محتوا و برچسبگذاری جعل عمیق (Deepfake) میشود، از ۲ اوت ۲۰۲۶ به طور رسمی اجرایی شده است. برای تسهیل این روند و کمک به شرکتها در جهت انطباق با قانون، دفتر هوش مصنوعی اتحادیه اروپا یک فرآیند چندجانبه را مدیریت کرد تا «کد رویه برای شفافیت محتوای تولیدشده توسط هوش مصنوعی» را تدوین کند. این سند راهنما در نهایت در ۱۰ ژوئن ۲۰۲۶ منتشر شد.
اگرچه رعایت این کد رویه به صورت داوطلبانه است، اما الزامات ماده ۵۰ تعهدات قانونی الزامآور هستند. هیئت مدیره هوش مصنوعی و کمیسیون اروپا تأیید کردهاند که این کد رویه، ابزاری مناسب برای اثبات رعایت قوانین است. تا پایان ژوئیه ۲۰۲۶، حدود ۱۹۰ سازمان و شرکت مختلف این کد را امضا کردهاند تا نشان دهند استانداردهای قانونی را رعایت میکنند.
برای اکثر کاربران، این تغییر کاملاً نامرئی است. این شرکت در هفتههای آینده نشانگذاری را برای کاربران واجد شرایط ChatGPT و Codex در تمام طرحها (از رایگان تا تجاری) در اتحادیه اروپا فعال میکند. این بهروزرسانی در حالی صورت میگیرد که مدل Codex اخیراً قابلیت حافظه پایدار را برای مدیریت بهتر محدودیتهای پروژه به دست آورده است. در خارج از این منطقه، این قابلیت برای مشتریان API به صورت یک تنظیم اختیاری (opt-in) است تا کسبوکارها خودشان تصمیم بگیرند چگونه تعهدات شفافیت را مدیریت کنند. همچنین اوپنایآی با شرکای ابری خود در حال همکاری است تا این قابلیت برای خروجیهای مدلهایی که از طریق سرویسهای آنها (مانند Azure) دسترسی دارند نیز فعال شود.
سازوکار فنی: textGrain
تکنولوژی زیربنایی این سیستم که textGrain نام دارد، برچسب بصری اضافه نمیکند. در عوض، سیگنالی را در کلماتی که مدل هنگام تولید انتخاب میکند، جای میگذارد. بر اساس گزارش فنی مورخ ۵ اکتبر ۲۰۲۶ با عنوان «textGrain: نشانگذاری کالیبره شده با آنتروپی برای متون مدل زبانی»، که توسط پژوهشگران OpenAI، دانشگاه ییل و دانشگاه پنسیلوانیا به طور مشترک نوشته شده است، این سیستم از چهار مکانیزم اصلی استفاده میکند:
- تصادفیسازی کلیددار: تولید توکن (Token) — تکههای کوچکی از متن، مثل برشهای یک کیک طولانی که مدل تکهتکه میخورد — به یک کلید سری گره خورده است. این کار از طریق حل یک مسئله «انتقال بهینه» (optimal transport problem) انجام میشود که هزینههای آن از متغیرهای تصادفی گامبل (Gumbel random variables) مشتق شده است.
- بودجهبندی آنتروپی: یک سقف یا بودجه برای میزان آنتروپی تعیین میشود تا میانگین آنتروپی نمونهبرداری که در ازای سیگنال از دست میرود، محدود شود. این کار تضمین میکند که نشانگذاری باعث افت کیفیت متن یا کاهش خلاقیت مدل نشود.
- منظمسازی KL: این روش از انحراف مدل از استقلال آماری جلوگیری میکند. در گزارش ذکر شده که جریمه KL دقیقاً برابر با میانگین آنتروپی است که نشانگذاری حذف میکند، و به این ترتیب پارامتر قدرت را به یک معنای مستقیم در تئوری اطلاعات تبدیل میکند.
- مسدودسازی واژگان: اعمال گام انتقال روی بلوکهای کلیددار از واژگان، حجم محاسبات بهینهسازی را کم میکند اما احتمال توکنهای نسبی را در هر بلوک بدون تغییر نگه میدارد.
برای شناسایی این نشان، تشخیصدهنده تنها به متن تولیدشده و کلید سری نیاز دارد. نکته مهم این است که تشخیصدهنده نیازی به دانستن بودجه آنتروپی خاصی که در طول فرآیند تولید اولیه استفاده شده است، ندارد.
نقاط ضعف و شکست
به گزارش اوپنایآی، عملکرد textGrain با ابزارهایی مثل SynthID برابری میکند یا از آنها پیشی میگیرد. با این حال، شرکت درباره شکنندگی این سیگنالها در دنیای واقعی صادق است و هشدار میدهد که این سیستم بینقص نیست.
در ارزیابیهای انجام شده روی پاسخهای انگلیسی از مجموعه داده ELI5، نرخ تشخیص در متون روانشناسی برای قطعات ۲۰۰ توکنی ۸۰٪ و برای قطعات ۴۰۰ توکنی ۹۵٪ بود. اما در متون ریاضی، به دلیل محدود بودن انتخاب کلمات و ساختار صلب پاسخها، فضای کمی برای سیگنالدهی آماری وجود دارد و نرخ موفقیت بهشدت کاهش یافت.
ویرایش متن، دشمن اصلی این سیستم است. در ارزیابی قطعات ۴۰۰ توکنی مشاهده شد که:
- جایگزینی ۱۰٪ کلمات با مترادفها، نرخ تشخیص را از ۹۲٪ به ۶۶٪ رساند.
- جایگزینی ۲۵٪ کلمات باعث سقوط شدید نرخ تشخیص به ۱۷٪ شد.
اثر بر کیفیت مدل
بسیاری نگراناند که نشانگذاری باعث کاهش هوش یا دقت مدل شود. اوپنایآی ادعا میکند این اتفاق برای مدل پیشرو جدیدش، Astra، نیفتاده است. این مدل پیشرفته که پیشتر با امتیاز خیرهکننده در محک ARC-AGI-3 معرفی شد، اکنون در محیطهای تجاری مانند Amazon Bedrock در دسترس است.
در بنچمارکهای داخلی، متن بدون نشان امتیاز ۴۹.۵۷ و متن نشانگذاریشده امتیاز ۴۹.۷۶ را در شاخص هوش Artificial Analysis کسب کرد. در محک GPQA Diamond نیز تفاوت ناچیز بود: ۹۴.۴۴٪ برای متن پاک در برابر ۹۳.۹۴٪ برای متن نشانگذاریشده، که نشان میدهد اثر منفی بر استدلال مدل وجود ندارد.
محدودیتهای شناسایی منشأ
اوپنایآی صراحتاً هشدار میدهد که این نشانگذاری راهکاری قطعی (silver bullet) برای اثبات حقیقت یا مالکیت نیست. شناسایی سیگنال، کاربر خاصی را معرفی نمیکند، دقت ادعاها را تأیید نمیکند و مسئولیت قانونی ایجاد نمیکند. همچنین این ابزار میزان مشارکت انسان در متن یا مالکیت قانونی اثر را تعیین نمیکند.
از سوی دیگر، نبودِ نشانگذاری هم ثابت نمیکند که متن توسط انسان نوشته شده است. محتوا ممکن است به دلایل زیر شناسایی نشود:
- بسیار کوتاه باشد، ویرایش شده باشد یا برای تشخیص قابل اعتماد، ترجمه شده باشد.
- توسط مدلی تولید شده باشد که پیش از استقرار سیستم نشانگذاری ساخته شده است.
- توسط ابزارهای شرکتهای دیگر یا مدلهای پشتیبانینشده تولید شده باشد.
به دلیل همین مثبتهای کاذب و خطاهای شناسایی، دسترسی به ابزار تشخیص در حال حاضر محدود است. در ۵ اکتبر ۲۰۲۶، اوپنایآی درخواستها برای دسترسی به این ابزار را باز کرد، اما دسترسی تنها برای پژوهشگران تأییدشده و سازمانهای خبره به صورت مورد به مورد صادر میشود. این اقدام در راستای کد رویه اتحادیه اروپا برای حمایت از بهبود شناسایی منشأ متن است.
لازم به ذکر است که این ابزارها فقط برای متن هستند. ابزارهای تأیید برای تصاویر و صوت، از جمله Content Provenance API و ابزار وب openai.com/verify، همچنان به صورت عمومی در دسترس هستند.
این استقرار محتاطانه نشاندهنده شکاف بین الزامات قانونی و واقعیت فنی است. در حالی که تعهدات قانون هوش مصنوعی اتحادیه اروپا از ۲ اوت ۲۰۲۶ قانونی شده، ابزارهای اجرایی آن هنوز ناقص هستند. اوپنایآی قصد دارد بررسی کند که نشانها در برابر ترجمه چه مقاومتی دارند و چگونه میتوان کمکِ هوش مصنوعی را از نویسندگیِ کامل آن تشخیص داد.
برای مدیران کسبوکار، این یعنی دیگر نمیتوان فرض کرد محتوای تولیدشده با هوش مصنوعی در بازار اروپا نامرئی است. شرکتهایی که برای مقیاسپذیری به مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — متکی هستند، باید بدانند خروجیهای آنها دارای اثر انگشتی است که رگولاتورها میتوانند آن را ردیابی کنند.
منتظر انتشار متنباز تکنولوژی textGrain باشید، که به توسعهدهندگان شخص ثالث اجازه میدهد لایههای تشخیص اختصاصی خود را بسازند.
گام بعدی شما
- اگر در اتحادیه اروپا فعالیت میکنید، خروجیهای مدل را با ابزارهای تشخیص رایگان (برای تصویر و صوت) تست کنید تا سطح شناسایی را بسنجید.
- در استراتژی تولید محتوا، به این نکته توجه کنید که ویرایش انسانی گسترده (بیش از ۲۵٪) میتواند اثر نشانگذاری را از بین ببرد.
- منتظر انتشار متنباز تکنولوژی textGrain باشید تا لایههای تشخیص اختصاصی خود را بسازید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو