پرش به محتوای اصلی
پرش به محتوای مقاله

۱۳ هزار عبارت کلیدی؛ اثر انگشت‌های زبانی مدل‌های هوش مصنوعی فاش شدند

·۹ مهر ۱۴۰۵۴ دقیقه مطالعه
تصویر: مقاله‌ای درباره نشانه‌های شناسایی متن هوش مصنوعی در TechCrunch
تصویر: مقاله‌ای درباره نشانه‌های شناسایی متن هوش مصنوعی در TechCrunch
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف ۱۳ هزار عبارت اختصاصی که به‌عنوان اثر انگشت مدل‌ها عمل می‌کنند؛ در حالی که نشانه‌های قدیمی (مثل خط تیره) حذف شده‌اند، الگوهای جدید و نامرئی‌تری جایگزین شده‌اند.

اگر امروز متونی را می‌خوانید که بیش از حد «منظم» یا «ساختاریافته» به نظر می‌رسند، احتمالاً با اثر انگشت‌های دیجیتال رو‌به‌رو هستید. تشخیص نوشته‌های انسانی از الگوریتم‌ها اکنون به یک بازی پیچیده «موش و گربه» تبدیل شده است که در آن هر حذفِ نشانه، جای خود را به الگویی نامرئی‌تر می‌دهد.

طبق گزارش شرکت بازاریابی Graphite، مدل‌های پیشرو همچنان به ۱۳ هزار عبارت متمایز تکیه می‌کنند که به‌عنوان اثر انگشت زبانی عمل می‌کنند. این عبارت‌ها به‌گونه‌ای تعریف شده‌اند که تکرار آن‌ها در محتوای هوش مصنوعی حداقل دو برابر بیشتر از متون انسانی است. در حالی که آزمایشگاه‌ها موفق شده‌اند نشانه‌های واضحی مثل «خط تیره بلند» (em-dash) را پاک کنند، الگوهای ظریف‌تری جایگزین آن‌ها شده است.

برای مدیران کسب‌وکار و ویراستاران، توانایی تشخیص تفاوت میان ظرافت‌های انسانی و الگوهای الگوریتمی دیگر یک کنجکاوی ساده نیست، بلکه پیش‌نیازی برای حفظ اصالت محتواست. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، هرچه مدل‌ها پیشرفته‌تر می‌شوند، لایه‌های پنهان رفتار آن‌ها اهمیت بیشتری می‌یابد.

مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — برای تولید متن از توزیع‌های آماری خاصی استفاده می‌کند. برای جداسازی این الگوها، Graphite از یک گروه کنترل شامل ۱۰ هزار مقاله که پیش از عرضه ChatGPT منتشر شده بودند، استفاده کرد تا معیار دقیقی از نوشتار انسانی داشته باشد.

محققان سپس از مدل‌های مختلف خواستند تا این مقالات را بر اساس خلاصه‌ای از آن‌ها بازنویسی کنند. این طراحی خاص برای حذف هرگونه سوگیری از منبع اصلی بود تا بتوانند توزیع کلمات و الگوهای ساختاری جملات را به‌طور مستقیم مقایسه کنند.

بر اساس مستندات این پژوهش، هر آزمایشگاه سبک نوشتاری متمایزی ایجاد کرده است:

  • Claude Opus 5.5: این مدل کلمه «dependable» را ۲۳ برابر بیشتر از انسان‌ها به کار می‌برد. عبارت «why X matters» در این مدل ۹۲ برابر و عبارت «this matters» ۱۱۶ برابر بیشتر از نمونه‌های انسانی تکرار می‌شود. این چالش‌ها در راستای تلاش‌های مستمری است که آنتروپیک برای جلوگیری از افت کیفیت نوشتاری در مدل‌های جدید کلود انجام می‌دهد.
  • OpenAI Astra: این مدل به «قاب‌بندی اصلاحی» علاقه دارد و عباراتی مثل «not simply X» یا «rather than relying on X» را بیش از ۱۰۰ برابر بیشتر از انسان‌ها استفاده می‌کند. همچنین تمایل دارد ادعاهایش را با عباراتی مثل «may provide» یا «can provide» تعدیل کند.
  • Gemini 3.1 Pro: این مدل تقریباً به‌طور کامل استفاده از خط تیره بلند را از متون خود حذف کرده است.

آزمایشگاه‌های پیشرو به‌شدت روی حذف خط تیره بلند واکنش نشان داده‌اند. در نمونه‌های Graphite، مدل Opus 5.5 این علامت را ۹۹٪ کمتر از نسخه Opus 8 استفاده کرده و Astra نیز ۸۸٪ کمتر از نمونه‌های انسانی از آن بهره می‌برد.

با این حال، تعداد کل نشانه‌ها ثابت مانده است. به‌رغم ادعای Anthropic مبنی بر اینکه Opus 5.5 «طبیعی‌تر از مدل‌های قبلی ارتباط برقرار می‌کند»، یا وعده OpenAI برای نسخه‌های Sol و Luna از مدل GPT-6 مبنی بر «شفافیت بیشتر و اصطلاحات کمتر»، اثر انگشت‌ها از بین نرفته‌اند. این تضاد در حالی رخ می‌دهد که مدل کلود اکنون هدایت ۲۶٪ از پژوهش‌های داخلی آنتروپیک را بر عهده دارد و نقش محوری در توسعه این شرکت ایفا می‌کند.

گرگ دراک، مدیر ارشد هوش مصنوعی در Graphite، اشاره می‌کند که با حذف نشانه‌های شناخته‌شده، نشانه‌های جدیدی ظاهر می‌شوند. او مشاهده کرد که در حالی که مدل‌های کلود به توزیع کلمات انسانی نزدیک‌تر می‌شوند، مدل‌های GPT در واقع از آن فاصله می‌گیرند.

این موضوع نشان‌دهنده یک محدودیت بنیادی در تنظیم دقیق (Fine-tuning) — شبیه وقتی به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — مدل‌های غول‌پیکر با میلیاردها پارامتر است. به باور دراک، کنترل این تیک‌های زبانی سخت‌تر از آن است که تصور می‌شد، زیرا تعداد تست‌های ممکن محدود است و برخی الگوها از فیلترها می‌گریزند.

برای یک متخصص، این یعنی متون «شبیه به هوش مصنوعی» حذف نمی‌شوند، بلکه تکامل می‌یابند. شاید دیگر کلمه «delve» را در هر خط نبینید، اما با وسواسی غیرطبیعی در استفاده از عبارت «matters» رو‌به‌رو خواهید شد.

با نزدیک‌تر شدن مدل‌ها به توزیع کلمات انسانی، ابزارهای تشخیص باید از لیست‌های ساده کلمات به تحلیل‌های ساختاری پیچیده تغییر مسیر دهند. موج بعدی ابزارهای تشخیص احتمالاً روی «ساختارهای متضاد» تمرکز خواهند کرد، نه تک‌کلمات.

گام بعدی شما

  • در بازبینی متون تولید شده توسط AI، به‌جای جست‌وجوی کلمات کلیشه‌ای، روی تکرار غیرطبیعی ساختارهای «تأکیدی» (مانند This matters) تمرکز کنید.
  • برای کاهش اثر انگشت زبانی، از مدل بخواهید متنی را با «لحن یک خبرنگار تحقیقی» یا «نویسنده یادداشت‌های شخصی» بازنویسی کند تا توزیع کلمات تغییر کند.
  • ابزارهای تشخیص AI را به‌روزرسانی کنید و به دنبال آن‌هایی باشید که تحلیل ساختاری (Structural Analysis) انجام می‌دهند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید که در کنار سرمایه‌گذاری‌های جدید انویدیا و آمازون بر سخت‌افزارهای حافظه‌محور برای رفع گلوگاه‌های استنتاج، ابعاد جدیدی به این تکامل می‌بخشد.

چرا این موضوع مهم است؟

این یافته‌ها اعتبار ابزارهای فعلی تشخیص AI را زیر سؤال می‌برد و نشان می‌دهد که اصالت محتوا در عصر مدل‌های پیشرو، نیازمند تحلیل‌های آماری عمیق‌تر است. تخصص در شناسایی این الگوها برای ویراستاران و متخصصان سئو به یک مهارت حیاتی تبدیل می‌شود.

تأثیر برای ایران

برای تولیدکنندگان محتوای فارسی که از مدل‌های انگلیسی برای ترجمه یا ایده‌پردازی استفاده می‌کنند، این الگوها در ترجمه به فارسی نیز منتقل می‌شوند و باعث ایجاد متونی با ساختار «ترجمه‌گونه» و غیرطبیعی می‌گردند.

·نگاه ما
تحریریه دات‌هوش

تلاش آزمایشگاه‌ها برای حذف نشانه‌های زبانی، در واقع تبدیل یک مشکل «واژگانی» به یک مشکل «ساختاری» است. این نشان می‌دهد که مدل‌های زبانی هرگز نمی‌توانند کاملاً انسانی شوند، زیرا ماهیت احتمالی آن‌ها لزوماً منجر به ایجاد الگوهای تکرارشونده می‌شود. در واقع، هرچه مدل سعی می‌کند «طبیعی‌تر» باشد، اثر انگشت جدید و پیچیده‌تری خلق می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.