پرش به محتوای اصلی
پرش به محتوای مقاله

نشان‌گذاری متون ChatGPT برای کاربران اتحادیه اروپا اجرایی شد

·۱۳ مهر ۱۴۰۵۵ دقیقه مطالعه
آغاز واترمارک‌گذاری تدریجی متن توسط اوپن‌ای‌ای بر اساس قوانین قانون هوش مصنوعی اتحادیه اروپا
آغاز واترمارک‌گذاری تدریجی متن توسط اوپن‌ای‌ای بر اساس قوانین قانون هوش مصنوعی اتحادیه اروپا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استقرار تجاری اولین سیستم نشان‌گذاری آماری نامرئی (textGrain) در مقیاس میلیونی برای کاربران اتحادیه اروپا جهت انطباق با ماده ۵۰ قانون AI Act.

اگر در بازار اتحادیه اروپا محتوای تولیدشده با هوش مصنوعی منتشر می‌کنید، از این پس متون شما یک اثر انگشت دیجیتال نامرئی دارند. اوپن‌ای‌آی در ۵ اکتبر ۲۰۲۶ استقرار مرحله‌ای سیستم نشان‌گذاری متنی را آغاز کرد تا الزامات قانونی اتحادیه اروپا را برآورده کند. این استقرار به گونه‌ای طراحی شده است که سیگنال‌های آماری را به صورت تدریجی اعمال کند تا اطمینان حاصل شود که شرکت تمامی دستورات قانونی قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) را به طور کامل اجرا می‌کند.

این اقدام در حالی رخ می‌دهد که رگولاتورها فشار را برای شناسایی منشأ هوش مصنوعی زاینده (Generative AI) — که شبیه به گذاشتن یک مهر نامرئی روی هر صفحه از نوشته‌های یک نویسنده است — افزایش داده‌اند. طبق ماده ۵۰ قانون هوش مصنوعی اتحادیه اروپا، ارائه‌دهندگان باید تضمین کنند که محتوای تولیدشده توسط ماشین به صورتی قابل شناسایی باشد که سیستم‌های دیگر بتوانند آن را در قالب یک فرمت ماشین‌خوان (machine-readable) بخوانند. این فشار قانونی در ادامه روند کلی تغییرات امنیتی شرکت است؛ همان‌طور که در تحلیل قبلی ما درباره‌ی تلاش‌های OpenAI برای محدود کردن پرس‌وجوهای حساس مربوط به خودکشی کاربران اشاره کردیم، این شرکت اکنون در حال انطباق با استانداردهای سخت‌گیرانه دولتی است تا از مخاطرات احتمالی جلوگیری کند.

زمینه رگولاتوری

طبق اعلام رسمی، تعهدات شفافیت ماده ۵۰ که شامل نشان‌گذاری محتوا و برچسب‌گذاری جعل عمیق (Deepfake) می‌شود، از ۲ اوت ۲۰۲۶ به طور رسمی اجرایی شده است. برای تسهیل این روند و کمک به شرکت‌ها در جهت انطباق با قانون، دفتر هوش مصنوعی اتحادیه اروپا یک فرآیند چندجانبه را مدیریت کرد تا «کد رویه برای شفافیت محتوای تولیدشده توسط هوش مصنوعی» را تدوین کند. این سند راهنما در نهایت در ۱۰ ژوئن ۲۰۲۶ منتشر شد.

اگرچه رعایت این کد رویه به صورت داوطلبانه است، اما الزامات ماده ۵۰ تعهدات قانونی الزام‌آور هستند. هیئت مدیره هوش مصنوعی و کمیسیون اروپا تأیید کرده‌اند که این کد رویه، ابزاری مناسب برای اثبات رعایت قوانین است. تا پایان ژوئیه ۲۰۲۶، حدود ۱۹۰ سازمان و شرکت مختلف این کد را امضا کرده‌اند تا نشان دهند استانداردهای قانونی را رعایت می‌کنند.

برای اکثر کاربران، این تغییر کاملاً نامرئی است. این شرکت در هفته‌های آینده نشان‌گذاری را برای کاربران واجد شرایط ChatGPT و Codex در تمام طرح‌ها (از رایگان تا تجاری) در اتحادیه اروپا فعال می‌کند. این به‌روزرسانی در حالی صورت می‌گیرد که مدل Codex اخیراً قابلیت حافظه پایدار را برای مدیریت بهتر محدودیت‌های پروژه به دست آورده است. در خارج از این منطقه، این قابلیت برای مشتریان API به صورت یک تنظیم اختیاری (opt-in) است تا کسب‌وکارها خودشان تصمیم بگیرند چگونه تعهدات شفافیت را مدیریت کنند. همچنین اوپن‌ای‌آی با شرکای ابری خود در حال همکاری است تا این قابلیت برای خروجی‌های مدل‌هایی که از طریق سرویس‌های آن‌ها (مانند Azure) دسترسی دارند نیز فعال شود.

سازوکار فنی: textGrain

تکنولوژی زیربنایی این سیستم که textGrain نام دارد، برچسب بصری اضافه نمی‌کند. در عوض، سیگنالی را در کلماتی که مدل هنگام تولید انتخاب می‌کند، جای می‌گذارد. بر اساس گزارش فنی مورخ ۵ اکتبر ۲۰۲۶ با عنوان «textGrain: نشان‌گذاری کالیبره شده با آنتروپی برای متون مدل زبانی»، که توسط پژوهشگران OpenAI، دانشگاه ییل و دانشگاه پنسیلوانیا به طور مشترک نوشته شده است، این سیستم از چهار مکانیزم اصلی استفاده می‌کند:

  • تصادفی‌سازی کلیددار: تولید توکن (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — به یک کلید سری گره خورده است. این کار از طریق حل یک مسئله «انتقال بهینه» (optimal transport problem) انجام می‌شود که هزینه‌های آن از متغیرهای تصادفی گامبل (Gumbel random variables) مشتق شده است.
  • بودجه‌بندی آنتروپی: یک سقف یا بودجه برای میزان آنتروپی تعیین می‌شود تا میانگین آنتروپی نمونه‌برداری که در ازای سیگنال از دست می‌رود، محدود شود. این کار تضمین می‌کند که نشان‌گذاری باعث افت کیفیت متن یا کاهش خلاقیت مدل نشود.
  • منظم‌سازی KL: این روش از انحراف مدل از استقلال آماری جلوگیری می‌کند. در گزارش ذکر شده که جریمه KL دقیقاً برابر با میانگین آنتروپی است که نشان‌گذاری حذف می‌کند، و به این ترتیب پارامتر قدرت را به یک معنای مستقیم در تئوری اطلاعات تبدیل می‌کند.
  • مسدودسازی واژگان: اعمال گام انتقال روی بلوک‌های کلیددار از واژگان، حجم محاسبات بهینه‌سازی را کم می‌کند اما احتمال توکن‌های نسبی را در هر بلوک بدون تغییر نگه می‌دارد.

برای شناسایی این نشان، تشخیص‌دهنده تنها به متن تولیدشده و کلید سری نیاز دارد. نکته مهم این است که تشخیص‌دهنده نیازی به دانستن بودجه آنتروپی خاصی که در طول فرآیند تولید اولیه استفاده شده است، ندارد.

نقاط ضعف و شکست

به گزارش اوپن‌ای‌آی، عملکرد textGrain با ابزارهایی مثل SynthID برابری می‌کند یا از آن‌ها پیشی می‌گیرد. با این حال، شرکت درباره شکنندگی این سیگنال‌ها در دنیای واقعی صادق است و هشدار می‌دهد که این سیستم بی‌نقص نیست.

در ارزیابی‌های انجام شده روی پاسخ‌های انگلیسی از مجموعه داده ELI5، نرخ تشخیص در متون روان‌شناسی برای قطعات ۲۰۰ توکنی ۸۰٪ و برای قطعات ۴۰۰ توکنی ۹۵٪ بود. اما در متون ریاضی، به دلیل محدود بودن انتخاب کلمات و ساختار صلب پاسخ‌ها، فضای کمی برای سیگنال‌دهی آماری وجود دارد و نرخ موفقیت به‌شدت کاهش یافت.

ویرایش متن، دشمن اصلی این سیستم است. در ارزیابی قطعات ۴۰۰ توکنی مشاهده شد که:

  • جایگزینی ۱۰٪ کلمات با مترادف‌ها، نرخ تشخیص را از ۹۲٪ به ۶۶٪ رساند.
  • جایگزینی ۲۵٪ کلمات باعث سقوط شدید نرخ تشخیص به ۱۷٪ شد.

اثر بر کیفیت مدل

بسیاری نگران‌اند که نشان‌گذاری باعث کاهش هوش یا دقت مدل شود. اوپن‌ای‌آی ادعا می‌کند این اتفاق برای مدل پیشرو جدیدش، Astra، نیفتاده است. این مدل پیشرفته که پیش‌تر با امتیاز خیره‌کننده در محک ARC-AGI-3 معرفی شد، اکنون در محیط‌های تجاری مانند Amazon Bedrock در دسترس است.

در بنچمارک‌های داخلی، متن بدون نشان امتیاز ۴۹.۵۷ و متن نشان‌گذاری‌شده امتیاز ۴۹.۷۶ را در شاخص هوش Artificial Analysis کسب کرد. در محک GPQA Diamond نیز تفاوت ناچیز بود: ۹۴.۴۴٪ برای متن پاک در برابر ۹۳.۹۴٪ برای متن نشان‌گذاری‌شده، که نشان می‌دهد اثر منفی بر استدلال مدل وجود ندارد.

محدودیت‌های شناسایی منشأ

اوپن‌ای‌آی صراحتاً هشدار می‌دهد که این نشان‌گذاری راهکاری قطعی (silver bullet) برای اثبات حقیقت یا مالکیت نیست. شناسایی سیگنال، کاربر خاصی را معرفی نمی‌کند، دقت ادعاها را تأیید نمی‌کند و مسئولیت قانونی ایجاد نمی‌کند. همچنین این ابزار میزان مشارکت انسان در متن یا مالکیت قانونی اثر را تعیین نمی‌کند.

از سوی دیگر، نبودِ نشان‌گذاری هم ثابت نمی‌کند که متن توسط انسان نوشته شده است. محتوا ممکن است به دلایل زیر شناسایی نشود:

  • بسیار کوتاه باشد، ویرایش شده باشد یا برای تشخیص قابل اعتماد، ترجمه شده باشد.
  • توسط مدلی تولید شده باشد که پیش از استقرار سیستم نشان‌گذاری ساخته شده است.
  • توسط ابزارهای شرکت‌های دیگر یا مدل‌های پشتیبانی‌نشده تولید شده باشد.

به دلیل همین مثبت‌های کاذب و خطاهای شناسایی، دسترسی به ابزار تشخیص در حال حاضر محدود است. در ۵ اکتبر ۲۰۲۶، اوپن‌ای‌آی درخواست‌ها برای دسترسی به این ابزار را باز کرد، اما دسترسی تنها برای پژوهشگران تأییدشده و سازمان‌های خبره به صورت مورد به مورد صادر می‌شود. این اقدام در راستای کد رویه اتحادیه اروپا برای حمایت از بهبود شناسایی منشأ متن است.

لازم به ذکر است که این ابزارها فقط برای متن هستند. ابزارهای تأیید برای تصاویر و صوت، از جمله Content Provenance API و ابزار وب openai.com/verify، همچنان به صورت عمومی در دسترس هستند.

این استقرار محتاطانه نشان‌دهنده شکاف بین الزامات قانونی و واقعیت فنی است. در حالی که تعهدات قانون هوش مصنوعی اتحادیه اروپا از ۲ اوت ۲۰۲۶ قانونی شده، ابزارهای اجرایی آن هنوز ناقص هستند. اوپن‌ای‌آی قصد دارد بررسی کند که نشان‌ها در برابر ترجمه چه مقاومتی دارند و چگونه می‌توان کمکِ هوش مصنوعی را از نویسندگیِ کامل آن تشخیص داد.

برای مدیران کسب‌وکار، این یعنی دیگر نمی‌توان فرض کرد محتوای تولیدشده با هوش مصنوعی در بازار اروپا نامرئی است. شرکت‌هایی که برای مقیاس‌پذیری به مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — متکی هستند، باید بدانند خروجی‌های آن‌ها دارای اثر انگشتی است که رگولاتورها می‌توانند آن را ردیابی کنند.

منتظر انتشار متن‌باز تکنولوژی textGrain باشید، که به توسعه‌دهندگان شخص ثالث اجازه می‌دهد لایه‌های تشخیص اختصاصی خود را بسازند.

گام بعدی شما

  • اگر در اتحادیه اروپا فعالیت می‌کنید، خروجی‌های مدل را با ابزارهای تشخیص رایگان (برای تصویر و صوت) تست کنید تا سطح شناسایی را بسنجید.
  • در استراتژی تولید محتوا، به این نکته توجه کنید که ویرایش انسانی گسترده (بیش از ۲۵٪) می‌تواند اثر نشان‌گذاری را از بین ببرد.
  • منتظر انتشار متن‌باز تکنولوژی textGrain باشید تا لایه‌های تشخیص اختصاصی خود را بسازید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام بر اساس اعتبار قانون AI Act اتحادیه اروپا، استانداردی جدید برای شفافیت محتوا ایجاد می‌کند که سایر شرکت‌های هوش مصنوعی را نیز مجبور به پذیرش می‌کند. در نتیجه، عصر محتوای کاملاً ناشناس تولیدشده توسط ماشین در بازارهای بزرگ به پایان می‌رسد.

تأثیر برای ایران

در حال حاضر اثر مستقیمی بر کاربران ایرانی ندارد، اما توسعه‌دهندگانی که برای بازار اروپا محتوا تولید می‌کنند باید بدانند خروجی‌های آن‌ها قابل ردیابی است.

·نگاه ما
تحریریه دات‌هوش

تلاش اوپن‌ای‌آی برای پیاده‌سازی textGrain نشان می‌دهد که حتی پیشرفته‌ترین مدل‌ها در برابر قوانین سخت‌گیرانه رگولاتوری تسلیم می‌شوند. نکته کلیدی این است که این سیستم بیشتر یک «سپر دفاعی قانونی» برای شرکت است تا یک ابزار واقعی برای مبارزه با جعل؛ چرا که با تغییرات ساده‌ای در متن، سیستم به‌راحتی دور زده می‌شود. این موضوع تضاد عمیقی بین «تعهد قانونی» و «توان فنی» در حوزه شناسایی منشأ محتوا ایجاد کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.