پرش به محتوای اصلی
پرش به محتوای مقاله

آیا مدل‌های زبانی مختلف اثرانگشت نویسندگی یکسانی دارند؟

·۱ مرداد ۱۴۰۵۴۸۸ دقیقه مطالعه
لامپ تایپ: شما نسبتاً درست می‌گویید!
لامپ تایپ: شما نسبتاً درست می‌گویید!
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متدی برای اندازه‌گیری فاصله سبک‌شناختی (Stylistic Divergence) میان مدل‌ها با استفاده از تراگرام‌های نویسه‌ای و واگرایی KL، به جای ارزیابی محتوایی پاسخ‌ها.

تصور کنید دو نفر هر دو موافق باشند که آسمان آبی است، اما یکی آن را «لاجوردی» بنامد و دیگری «به رنگ آسمان». عقیده آن‌ها یکی است، اما سبکشان کاملاً متفاوت است؛ دقیقاً همین شکاف است که اکنون می‌توان آن را در مدل‌های هوش مصنوعی اندازه گرفت.

Typebulb در ۲۳ جولای ۲۰۲۶ تحلیل جدیدی منتشر کرد که اثرانگشت سبک‌شناختی ۲۲ مدل زبانی بزرگ (LLM) — که مثل کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — را بر اساس انتخاب کلمات نقشه‌برداری کرده است. این تحلیل نشان می‌دهد که سبک‌های نوشتاری در هوش مصنوعی تصادفی نیستند، بلکه اثرانگشت‌هایی قابل اندازه‌گیری هستند.

بیشتر محک‌های هوش مصنوعی روی این تمرکز دارند که مدل جواب درست می‌دهد یا غلط. اما طبق گزارش Typebulb، این ابزار کاملاً از صحت پاسخ‌ها چشم‌پوشی می‌کند. این سیستم هر واکنش مدل را به عنوان یک مجموعه متن می‌بیند تا بفهمد نثر مدل در بنیادی‌ترین سطح چگونه ساخته شده است. در واقع، این ابزار به جای بررسی دقت پاسخ، ساختار نثر را تحلیل می‌کند.

همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، مدل‌ها صرفاً تولیدکننده اطلاعات نیستند، بلکه الگوهای آماری خاصی را تکرار می‌کنند. این ابزار با محاسبه فاصله ریاضی بین این انتخاب‌های سبک‌شناختی، تفاوت‌های ظریف مدل‌ها را استخراج می‌کند.

سازوکار نقشهٔ سبک‌شناختی

برای ساخت این نقشه، سیستم تمام پاسخ‌های یک مدل را در یک مجموعه متنی واحد جمع می‌کند. سپس متن را به تراگرام‌های نویسه‌ای (Character Trigrams) — یعنی پنجره‌های سه حرفی متوالی و هم‌پوشان — تقسیم می‌کند. این فرآیند یک توزیع احتمالی از نثر مدل ایجاد می‌کند. برای درک عمیق‌تر اینکه این مدل‌ها چگونه زبان را می‌پذیرند و پردازش می‌کنند، می‌توان به کالبدشکافی مهندسی مدل‌های زبانی پرداخت که جزئیات توکن‌سازی و حافظه را بررسی می‌کند.

بر اساس مستندات فنی این ابزار، از معیاری به نام آنتروپی متقاطع (Cross-Entropy) برای اندازه‌گیری «غافلگیری» استفاده می‌شود. در واقع سیستم این سوال را می‌پرسد: اگر شما در حال خواندن متنی هستید که توسط مدل A تولید شده است، مدل داخلیِ سبکِ مدل B چقدر از دیدن آن غافلگیر می‌شود؟

این تحلیل در نهایت به واگرایی KL (KL Divergence) یا همان آنتروپی نسبی تبدیل می‌شود. اگرچه واگرایی KL از نظر فنی نامتقارن است، اما داده‌های Typebulb نشان می‌دهد که تفاوت در دو جهت بسیار اندک است. این موضوع اجازه می‌دهد تا نقشه، یک میانگین متقارن از عدم تطابق سبک‌ها را نمایش دهد.

برای جلوگیری از اثر کلمات بسیار رایج و جلوگیری از منحرف شدن داده‌ها، یک فاکتور ترکیب (λ = ۰.۸) با توزیع تجمیعی تمام مدل‌ها به کار گرفته شده است. این ترفند ریاضی مانع از آن می‌شود که هر یک از احتمالات صفر شود، زیرا مقدار صفر باعث شکست محاسبات ریاضی در این سیستم می‌شد.

شناسایی عادت‌های «لو دهنده»

جذاب‌ترین بخش این ابزار، یافتن «لو دهنده ها» (Tells) است؛ کلمات یا عبارات خاصی که مانند شناسنامه عمل می‌کنند و به عنوان شناسه‌های سبک‌شناختی شناخته می‌شوند. یک عبارت تنها زمانی «لو دهنده» شناخته می‌شود که چهار شرط سخت را داشته باشد:

  • حداقل ۳ بار در پاسخ‌های مختلف ظاهر شود.
  • نرخ تکرار آن حداقل ۲ برابر میانگین نرخ تکرار در کل حوزه باشد.
  • جزو ۲۵۰ کلمه رایج کل مجموعه متنی نباشد.
  • در توکن‌ساز cl100k مدل GPT-4، حداقل ۲ توکن هزینه داشته باشد (یا برای عبارات، ۳ توکن) تا از فیلتر نایابی عبور کند.

با مقایسه این نشانه‌ها، ابزار می‌تواند مدل‌های «خانواده‌نزدیک» را شناسایی کند. زمانی یک یافته ثبت می‌شود که دو مدل از آزمایشگاه‌های مختلف، در سبک نگارش به هم نزدیک‌تر باشند تا میانگین جفت-مدل‌های یک آزمایشگاه واحد.

یافته‌های کلیدی آزمایشگاه‌ها

این تحلیل مدل‌ها را به آزمایشگاه سازنده اصلی آن‌ها برمی‌گرداند، نه صرفاً به ارائه‌دهندگان API. به عنوان مثال، ورودی‌های مربوط به OpenRouter به سازندگان واقعی‌شان متصل شدند؛ مانند مدل Kimi که به آزمایشگاه Moonshot و مدل GLM که به Zhipu بازگردانده شد.

یک نتیجه قابل توجه، خوشه‌ای شدن مدل Grok (متعلق به xAI) و نسل‌های بعدی آن زیر چتر SpaceXAI در جولای ۲۰۲۶ است. داده‌ها تأیید می‌کنند که یک «شباهت خانوادگی» قوی وجود دارد، به طوری که مدل‌های یک ارائه‌دهنده همواره در نقشه حرارتی سبک در کنار یکدیگر خوشه‌بندی می‌شوند.

نقش تاریخ انتشار در رمزگشایی

ریاضیات می‌تواند ثابت کند دو مدل شبیه می‌نویسند، اما نمی‌تواند ثابت کند چه کسی از چه کسی کپی کرده است. برای حل این مشکل، Typebulb از تاریخ انتشار به عنوان تنها منبع جهت‌دهنده استفاده می‌کند. اگر مدل B بعد از مدل A عرضه شده باشد و هر دو یک عادت سبک‌شناختی غیرعادی مشترک داشته باشند، این موضوع به عنوان یک «پیکان صادقانه» برای تأثیر داده‌های آموزشی مدل A بر مدل B تلقی می‌شود.

تحلیل: فراتر از بنچمارک‌های سنتی

تغییر نگاه از «صحت» به «سبک»، یک چرخش راهبردی و حیاتی در حسابرسی هوش مصنوعی است. برای توسعه‌دهندگان و سازمان‌های تجاری، اثرانگشت‌های سبک‌شناختی اصلی‌ترین راه برای شناسایی «فروپاشی مدل» (Model Collapse) یا نشت ناخواسته‌ی داده‌های مصنوعی (Synthetic Data) در مجموعه‌های آموزشی جدید است.

اگر مدل جدید آزمایشگاه X ناگهان شباهت‌های عجیبی به «لو دهنده‌های» مدل آزمایشگاه Y پیدا کند، این یعنی مدل جدید روی خروجی‌های مدل رقیب آموزش دیده است. این همان «مدرک جرم» در آلودگی داده‌های مصنوعی است که بنچمارک‌های سنتی متوجه آن نمی‌شوند؛ زیرا مدل همچنان می‌تواند جواب درست بدهد، اما این کار را با لحنی بیگانه انجام می‌دهد.

برای کاربر نهایی، این موضوع دلیل حس «دره وهمی» (Uncanny Valley) در بعضی مدل‌هاست. برخی مدل‌ها برای توافق حداکثری و تملق تنظیم شده‌اند، در حالی که برخی دیگر برای بی‌طرفی کلینیکی طراحی شده‌اند. این‌ها صرفاً نتیجه پرامپت‌های ساده نیستند، بلکه عادت‌های احتمالی عمیقی هستند که در توزیع تراگرام‌های مدل حک شده‌اند.

گام بعدی شما

  • مجموعه داده‌های بازتولیدپذیر را در ارزیابی «You're absolutely right!» در پلتفرم Typebulb بررسی کنید.
  • تغییرات خوشه‌های سبک را با معرفی مدل‌های جدید رصد کنید تا بفهمید کدام آزمایشگاه‌ها از داده‌های مصنوعی رقیب استفاده می‌کنند.
  • در تحلیل‌های خود، تفاوت بین «دقت پاسخ» و «لحن تولید» را تفکیک کنید.

ama داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با استفاده از تخصص ریاضیات احتمال، امکان شناسایی نشت داده‌های مصنوعی را فراهم می‌کند که امنیت و اصالت مدل‌ها را تضمین می‌کند. اعتبار این روش در توانایی‌اش برای تفکیک هویت مدل‌ها، فارغ از پاسخ‌های درست یا غلط، نهفته است.

تأثیر برای ایران

این ابزار برای پژوهشگران ایرانی در حوزه تحلیل مدل‌های زبانی و شناسایی منشأ مدل‌های بازمتن کاربرد دارد. با توجه به محدودیت دسترسی به برخی APIها، استفاده از این متد تحلیل محتوایی روی خروجی‌ها، جایگزین مناسبی برای بنچمارک‌های گران‌قیمت است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «سبک» به جای «صحت»، نقطه پایان دوران اعتماد مطلق به بنچمارک‌های Closed-box است. این ابزار در واقع یک ردیاب برای «سرقت علمی» در عصر مدل‌های زبانی است و ثابت می‌کند که حتی با تغییر معماری، اثر داده‌های آموزشی (Training Data) مانند دی‌ان‌ای در خروجی باقی می‌ماند. احتمالاً در آینده نزدیک، شناسنامه‌های سبک‌شناختی به بخشی از استانداردهای کپی‌رایت مدل‌ها تبدیل شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.