پرش به محتوای اصلی
پرش به محتوای مقاله

آزمون‌های جدید: تغییر یک واژه توصیهٔ ChatGPT را به ۰ رساند

·۱۸ تیر ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
بازنویسی یک پرسش خریدار و سقوط ابزار صندوق ورودی مشترک از رتبه ۱۰ به صفر در ChatGPT
بازنویسی یک پرسش خریدار و سقوط ابزار صندوق ورودی مشترک از رتبه ۱۰ به صفر در ChatGPT
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف یک «شکاف خوانایی» (Legibility Gap) عمیق در LLMها؛ جایی که مدل‌ها نمی‌توانند لزوماً یک محصول را از طریق برچسب دسته‌بندی به یک نیاز عملیِ توصیف‌شده توسط کاربر متصل کنند.

تصور کنید صاحب کسب‌وکاری هستید که بهترین محصول بازار را دارید، اما چون مشتریان شما از کلماتی متفاوت با دفتر تبلیغاتتان استفاده می‌کنند، در دنیای دیجیتال کاملاً نامرئی می‌شوید. این دقیقاً همان اتفاقی است که اکنون در توصیه‌های هوش مصنوعی رخ می‌دهد.

طبق گزارشی که در ۹ جولای ۲۰۲۶ منتشر شد، یک پژوهشگر دریافت که تغییر ساده در نحوه بیان یک پرسش، می‌تواند یک شرکت نرم‌افزاری را برای ChatGPT کاملاً نامرئی کند. در این آزمایش، تغییر یک پرسش مبتنی بر «دسته‌بندی» به یک پرسش مبتنی بر «گردش کار واقعی خریدار»، نرخ توصیه یکی از ابزارها را از ۱۰ از ۱۰ به صفر کاهش داد.

این اتفاق در حالی رخ می‌دهد که خریداران به‌جای جست‌وجوی سنتی در گوگل، مستقیماً از مدل‌های هوش مصنوعی راهنمایی می‌گیرند. در حالی که پیش‌تر درباره تلاش‌های OpenAI برای ایجاد تعاملات طبیعی‌تر و تمام-دوطرفه (Full-duplex) از طریق GPT-Live بحث کردیم، این داده‌های جدید نشان می‌دهد که «خوانایی» (Legibility) حضور وب یک شرکت، همچنان تعیین‌کننده میزان کشف شدن آن است. مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیارد‌ها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — تنها زمانی محصول شما را پیشنهاد می‌کند که توصیفات وب‌سایت شما با زبانِ ذهنیِ کاربر تطبیق داشته باشد. این وضعیت شبیه ویترینی است که فقط اگر کلمه‌ای تخصصی از لغت‌نامه بگویید دیده می‌شود، اما اگر نیاز واقعی خود را توصیف کنید، ناپدید می‌شود.

جزئیات آزمایش و متدولوژی

این پژوهش برای شناسایی الگوها، روی نرم‌افزارهای «صندوق ورودی مشترک» (Shared Inbox) متمرکز شد تا ریسک‌های پیش‌روی فروشندگان نرم‌افزار را به تصویر بکشد. متدولوژی این آزمایش به‌گونه‌ای طراحی شده بود که هرگونه شانس یا ناهنجاری آماری در نتایج حذف شود. برای این منظور، دو نسخه از یک پرسش، هر کدام ۱۰ بار در چهار مدل اصلی اجرا شد:

  • ChatGPT
  • Claude
  • Perplexity
  • Gemini

نسخه اول از یک برچسب دسته‌بندی ساده استفاده کرد: «بهترین نرم‌افزار صندوق ورودی مشترک برای تیم‌های کوچک چیست؟». نسخه دوم دقیقاً شبیه نحوه تایپ یک خریدار واقعی بود که یک مشکل مشخص در ذهن دارد: «بهترین راه برای همکاری با تیمم در صندوق‌های ایمیل مشترک، بدون به هم ریختن گردش کار ایمیلی ما چیست؟».

نوسان شدید در نرخ توصیه‌ها

بر اساس مستندات این آزمایش، علی‌رغم اینکه هر دو پرسش یک هدف واحد داشتند و لیست کوتاهی از ابزارهای بالقوه برای هر دو مشترک بود، تغییر کلمات باعث تغییرات شدید در دیده شدن برندها شد:

  • Missive: در ChatGPT برای پرسش دسته‌بندی امتیاز ۱۰/۱۰ گرفت، اما در پرسش کاربر-محور به ۰/۱۰ سقوط کرد. یک جمله متفاوت، برند را کاملاً حذف کرد؛ در حالی که شرکت و وب‌سایت همان بود.
  • Hiver: در ChatGPT وضعیت پایداری داشت (از ۱۰ به ۹ رسید)، اما در Perplexity با تغییر پرسش کاملاً ناپدید شد. در آن ۱۰ بار اجرا، Perplexity حتی یک‌بار هم نام Hiver را نیاورد و در عوض کاربران را به انجام کارها در محیط Gmail و Outlook ارجاع داد.
  • Front و Help Scout: پایدارترین عملکرد را داشتند و در اکثر مدل‌ها از جمله ChatGPT، Claude و Gemini امتیاز ۱۰/۱۰ را بدون توجه به نوع عبارت‌بندی حفظ کردند. این دو برند تنها در Perplexity افت کردند، اما دلیل آن تغییر در رفتار خودِ مدل بود؛ چراکه Perplexity در آن حالت کلاً از نام بردن محصولات دست کشید و تعداد نام‌های ذکر شده برای همه کاهش یافت.

تفاوت رفتار مدل‌ها

نتایج در تمام چشم‌انداز هوش مصنوعی یکسان نبود. جهت و شدت نوسان کاملاً به مدلی بستگی داشت که استفاده می‌شد:

  • Gemini: در این مدل، پرسش بازنویسی شده (کاربر-محور) در واقع باعث افزایش دیده شدن Hiver شد و تعداد دفعات ذکر آن از ۶ به ۹ رسید. در همین حال، Missive وضعیت نسبتاً پایداری داشت و از ۹ به ۸ رسید.
  • Claude: در این مدل، هر دو برند Hiver (از ۸ به ۵) و Missive (از ۱۰ به ۸) هنگام استفاده از عبارت‌بندی خریدار-محور، دچار افت شدند.

این تفاوت‌ها نشان می‌دهد که یک مشکل بنیادین در نحوه توصیف «ارزش» توسط شرکت‌ها وجود دارد. برندگان این رقابت — یعنی Front و Help Scout — از هیچ «ترفند» یا تاکتیک‌های بازی با سیستم استفاده نکردند. در عوض، صفحات آن‌ها دقیقاً همان «کاری» (Job) را توصیف می‌کند که خریدار سعی در انجام آن دارد، آن هم با کلماتی که خودِ خریدار به کار می‌برد. به همین دلیل، مدل می‌تواند آن‌ها را در هر سناریوی پرسش و پاسخی پیدا کند.

پیامدها برای فروشندگان نرم‌افزار

این یک مشکل خوانایی است. مسئله این است که آیا وب‌سایت شما آنچه را که انجام می‌دهید، با کلمات خود خریدار به‌قدری شفاف بیان می‌کند که مدل شما را در هر سبک از پرسش توصیه کند یا خیر. برای فروشندگان نرم‌افزار، «برچسب دسته‌بندی» که در ذهن خود برای رتبه گرفتن دارند، دیگر معیار اصلی نیست. آنچه تصمیم می‌گیرد هوش مصنوعی نام شما را بیاورد یا خیر، نسخه نامرئی «گردش کار» (Workflow) در پرسش کاربر است.

تکیه بر یک بار تست در یک مدل، یک اشتباه است؛ زیرا یک بار اسکن به شما دروغ می‌گوید. اگر کاربری یک‌بار از ChatGPT سوال کند و نام Missive را نبیند، ممکن است تصور کند این شرکت مشکل عمیقی در بهینه‌سازی برای هوش مصنوعی دارد، در حالی که در واقعیت، با یک عبارت‌بندی دیگر ۱۰/۱۰ توصیه می‌شود. دیده شدن واقعی تنها در تکرارهای متعدد و عبارت‌بندی‌های متنوع آشکار می‌شود.

برای تست دیده شدن خود، ابتدا دسته‌بندی محصولتان را شناسایی کنید و سپس هم یک برچسب رسمی و هم یک بیان مشکل مشتری-محور بنویسید. هر دو را چندین بار در مدل‌های زبانی بزرگ (LLM) اجرا کنید تا ببینید کدام یک از رقبای شما وقتی زبانest انسانی می‌شود، ناپدید می‌شوند.

گام بعدی شما

  • فهرست دسته‌بندی‌های محصول خود را استخراج کنید.
  • برای هر دسته‌بندی، سه عبارت «طرح مشکل» بنویسید که یک مشتری واقعی در چت‌بات تایپ می‌کند.
  • این هر دو نسخه را ۱۰ بار در ChatGPT و Claude اجرا کنید تا شکاف خوانایی برند خود را بیابید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این داده‌ها اعتبار استراتژی‌های محتوایی فعلی را به چالش می‌کشد و نشان می‌دهد که دیده شدن در عصر AI، بیش از آنکه به رتبه-بندی وابسته باشد، به تطابق زبانی با کاربر بستگی دارد. شرکت‌هایی که صرفاً روی کلمات کلیدی تخصصی سرمایه‌گذاری کرده‌اند، در معرض حذف کامل از توصیه‌های هوش مصنوعی هستند.

تأثیر برای ایران

برای استارتاپ‌های ایرانی که در حال توسعه وب‌سایت‌های انگلیسی‌زبان جهت ورود به بازارهای جهانی هستند، این یک هشدار است: محتوای سایت نباید صرفاً تخصصی باشد، بلکه باید دقیقاً با نحوه پرسش خریداران خارجی در مدل‌های AI تطبیق یابد.

·نگاه ما
تحریریه دات‌هوش

تغییر پارادایم از SEO (بهینه‌سازی برای موتور جست‌وجو) به LEO (بهینه‌سازی برای موتورهای پاسخ‌گو) اکنون در مرحله‌ای است که «معناشناسی» جایگزین «کلمات کلیدی» شده است. برنده این بازی، کسی است که بتواند فاصله بین اصطلاحات صنعتی و زبان عامیانه مشتری را در محتوای وب‌سایتش پر کند. این یافته ثابت می‌کند که مدل‌های زبانی هنوز در پل زدن بین مفاهیم انتزاعی و کاربردهای عملی دچار لغزش هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.