اگر برای شناسایی رقبای خود به توصیههای هوش مصنوعی تکیه میکنید، احتمالاً دارید دادههای تصادفی را تحلیل میکنید. یک پرسش ساده با هدف خرید (Buyer-intent) از مدل gemini-flash-latest میتواند در فاصلهٔ تنها ۲۰ دقیقه، لیستی بهطور قابلاندازهگیری متفاوت از تامینکنندگان را ارائه دهد.
این یافته که در ۲۲ اوت ۲۰۲۶ توسط تیم Thicket AI منتشر شد، هشدار میدهد بسیاری از شرکتهایی که ادعای «تغییر در جایگاه بازار» را در دیدهشدن توسط هوش مصنوعی دارند، در واقع دارند «نویز نمونهبرداری» را گزارش میکنند. برای کسبوکاری که هزینهٔ هنگفتی برای مانیتورینگ دیدهشدن (Visibility) در AI میپردازد، این یک تفاوت حیاتی است. اکثر ابزارهای نظارتی ادعا میکنند که جابهجایی یک مجموعه رقابتی را در بازههای چند هفتهای یا چند ماهه رصد میکنند؛ اما اگر «کفِ نویز» مدل بالاتر از تغییرات واقعی بازار باشد، این دادهها برای تحلیل روند عملاً بیفایده هستند.
تصور کنید رتبهٔ خود را در یک جدول امتیازات چک میکنید و میبینید با هر بار رفرش کردن صفحه، جایگاهتان تغییر میکند، در حالی که هیچکس واقعاً جابهجا نشده است. این دقیقاً وضعیت فعلی توصیههای تامینکنندگان در هوش مصنوعی است. همانطور که در تحلیلهای قبلی ما دربارهی پایداری خروجیهای مدلهای زبانی اشاره کردیم، تکرارپذیری یکی از بزرگترین چالشهای استقرار تجاری این فناوری است.
مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — در اینجا رفتاری غیرقابلپیشبینی دارد. این عدم قطعیت در خروجیها با چالشهای گستردهتری در تولید محتوای فنی همسو است؛ چنانکه بررسیهای اخیر نشان میدهد بخش بزرگی از مقالات فنی تولیدشده توسط AI حاوی ادعاهای ساختگی هستند. برای اثبات این موضوع، Thicket یک آزمایش کنترلشده روی ۱۳ پرسش با هدف خرید در سه شرکت فعال در بخشهای تحلیل داده (Analytics) و زیرساخت ابری (Cloud Infrastructure) اجرا کرد. آنها دو بازه زمانی متفاوت را با هم مقایسه کردند:
- بازه زمانی (The Interval): خوانشهایی که با فاصلهٔ ۱۷ تا ۲۰ روز از یکدیگر گرفته شده بودند.
- گروه کنترل (The Control): خوانشهایی که در یک صبح و با فاصلهٔ تقریبی ۲۰ دقیقه از هم انجام شدند.
فرآیند Thicket شامل اجرای هر پرسش سه بار در هر نوبت خوانش بود. تیم در ابتدا متوجه جابهجاییهای قابلتوجهی در فاصله سه هفتهای شد. برای تنها یک شرکت، نه نام در چهار پرسش مختلف تغییر کرده بود. در دستهبندی «تحلیلهای حریمخصوصی»، نامهای Plausible و Fathom حذف شده و Umami وارد شده بود. در دستهبندی «برنامههای بعداً بخوان» (Read-later)، نامهای Pocket، Cubox و Mailbrew جای خود را به KTool و Upnext داده بودند.
این در ابتدا شبیه به یک روایت جذاب بود: گویی دستهبندیها هر ماه در حال بازسازی هستند و مشتریان خارج از این چرخه قرار دارند. این یافتهای هشداردهنده بود که استدلالی قوی برای خرید اشتراکهای مانیتورینگ ماهانه بهجای یک ممیزی (Audit) یکباره فراهم میکرد. با این حال، تیم متوجه شد که این ادعا پیش از آنکه در ایمیلی ارسال شود، نیاز به یک آزمایش کنترل دارد.
طبق گزارش Thicket، نتایج در نهایت تقریباً یکسان بود. میانگین تفاوت متقارن (Mean Symmetric Difference) — یعنی تعداد نامهایی که در یک خوانش حضور داشتند اما در دیگری نبودند — برای بازهٔ سه هفتهای ۳.۵۰ نام و برای بازهٔ ۲۰ دقیقهای ۳.۶۷ نام بود.

یک آزمون علامت دوطرفه (Two-sided sign test) منجر به p = 1.000 شد؛ این یعنی هیچ اثر قابلتشخیصی از گذشت زمان در تغییر لیستها دیده نشد. در ۵ پرسش، گروه کنترل جابهجایی بیشتری داشت، در ۶ پرسش بازه سه هفتهای جابهجایی بیشتری داشت و یک مورد مساوی بود. جابهجاییهایی که تیم در ابتدا فکر میکرد روند بازار است، کاملاً در لحظه و بدون گذشت زمان تکرار میشد.
جزئیات تفکیکی جابهجاییها
برای درک بهتر کفِ نویز، Thicket انواع خاصی از پرسوجوها را ردیابی کرد. یک پرسوجوی تعریفی از لیست نهایی ۱۲ مورد حذف شد، زیرا «نامهای» استخراج شده از آن، عبارتهای مربوط به ویژگیها بودند نه نام تامینکنندگان، که این امر میتوانست نتایج را بهطور کاذب بهبود ببخشد.
دادههای نوسان پرسوجوها:
پرسوجوهای با نوسان بالا:
- «جایگزینهای NotebookLM برای مقالات پژوهشی»: ۷ نام در ۳ هفته تغییر کرد؛ ۶ نام در ۲۰ دقیقه تغییر کرد.
- «برنامههای بعداً بخوان که به شما در تمام کردن مطالب کمک کنند»: ۴ نام در ۳ هفته تغییر کرد؛ ۵ نام در ۲۰ دقیقه تغییر کرد.
- «تبدیل یوتیوب و پادکستها به یادداشت»: ۳ نام در ۳ هفته تغییر کرد؛ ۶ نام در ۲۰ دقیقه تغییر کرد.
پرسوجوهای با نوسان پایین:
- «ابزارهای بازپخش جلسه (Session Replay) متنباز»: ۰ نام در ۳ هفته تغییر کرد؛ ۱ نام در ۲۰ دقیقه تغییر کرد.
- «تحلیلهای محصول سبک و دوستدار حریمخصوصی»: ۰ نام در ۳ هفته تغییر کرد؛ ۴ نام در ۲۰ دقیقه تغییر کرد.
پرسوجوهای با نوسان متوسط:
- «سازماندهی و اتصال یادداشتهای پژوهشی با AI»: ۶ نام در ۳ هفته تغییر کرد؛ ۲ نام در ۲۰ دقیقه تغییر کرد.
- «ضبط و بازپخش جلسات اپلیکیشن موبایل»: ۲ نام در ۳ هفته تغییر کرد؛ ۳ نام در ۲۰ دقیقه تغییر کرد.
- «ابرهای AI-native که دیتابیس و استنتاج را یکجا ارائه میدهند»: ۴ نام در ۳ هفته تغییر کرد؛ ۲ نام در ۲۰ دقیقه تغییر کرد.
- «استنتاج و دیتابیس روی یک ابر واحد»: ۰ نام در ۳ هفته تغییر کرد؛ ۵ نام در ۲۰ دقیقه تغییر کرد.
- «جایگزینهای Vercel و Supabase»: ۴ نام در ۳ هفته تغییر کرد؛ ۴ نام در ۲۰ دقیقه تغییر کرد.
- «توابع + Postgres + یک نقطه اتصال LLM»: ۱ نام در ۳ هفته تغییر کرد؛ ۲۴ نام در ۲۰ دقیقه تغییر کرد.
خطای استخراج دادهها
تیم همچنین متوجه نقص در ابزار اندازهگیری خود شد. آنها در ابتدا نرخ پایداری ۵۳ درصدی را تحت عنوان «نیمی از نامهای تامینکنندگان... در اجرای دوم باقی نمیمانند» گزارش کردند. با این حال، یک اسکریپت بررسی ادعاها بعداً فاش کرد که استخراجکننده نام آنها، تامینکنندگانی را که در واقع در متن خام مدل حضور داشتند، حذف میکرد.
پس از اندازهگیری مجدد بر اساس متن خام، Thicket دریافت که ۲۷ درصد از جابهجاییهای گزارششده ناشی از نرمافزار خودشان بود، نه مدل AI. این یک داستان هشداردهنده است: شما باید پیش از اعتماد به دادهها، ابزار اندازهگیری خود را اندازه بگیرید. تیم تصمیم گرفت بهجای ویرایش بیسروصدای اعداد، یک اصلاحیه منتشر کند تا اهمیت اندازهگیری ابزار را برجسته سازد.
آنچه پایدار میماند
با وجود نویز در «دم» (Tail) لیست، برخی دادهها همچنان قابلاعتماد هستند. این مطالعه نشان داد که «عدم حضور» (Absence) کاملاً تکرارپذیر است.
- سه شرکت مورد آزمایش در ۰ مورد از ۷۸ اجرای انجام شده در دو برداشت مستقل در یک صبح، نام برده نشدند.
- یک شرکت در ۴۵ اجرا در سه نوبت خوانش در دو تاریخ مختلف با فاصله یک هفته، غایب باقی ماند.
در هیچ موردی شرکتی که به عنوان «غایب» شناسایی شده بود، بهطور ناگهانی در یک اجرای مجدد در پاسخ ظاهر نشد. در واقع، اینکه شرکتی در لیست هست یا نیست یک ویژگی پایدار است؛ اما اینکه چه نامهای دیگری در کنار او در لیست هستند، پایدار نیست.
تفکیک سر در مقابل دم (Head-versus-Tail)
پایداری بهطور قابلتوجهی بر اساس جایگاه نام در پاسخ AI متفاوت است. Thicket متوجه شکاف واضحی بین «سر» و «دم» لیست تامینکنندگان شد:
- سر (The Head): دو یا سه نام اول معمولاً پایدار هستند. برای یک پرسش زیرساختی، CoreWeave در هر سه خوانش نام برده شد و RunPod در دو مورد از سه خوانش.
- دم (The Tail): نامهایی که در پایینتر از لیست قرار دارند بهشدت ناپایدارند. Together AI، Crusoe، Modal و Lambda هر کدام دقیقاً یک بار نام برده شدند.
نقلقول از دو نام اول یک لیست قابل دفاع است، اما نقلقول از مورد پنجم، به گفته پژوهشگران، شبیه به «نقلقول از پرتاب یک سکه» است.
پارادوکس مانیتورینگ
این وضعیت یک پارادوکس برای محصولات مانیتورینگ دیدهشدن در AI ایجاد میکند. مانیتورینگ به معنای تشخیص تغییر است، اما تشخیص تغییر مستلزم تفکیک سیگنال از نویز است.
اگر یک گزارش ماهانه ادعا کند سه تامینکننده وارد یک دستهبندی شدهاند و دو مورد خارج شدهاند، احتمالاً دارد همان تصادفی بودن را توصیف میکند که در یک پنجره ۲۰ دقیقهای رخ میدهد. برای Thicket، این بدان معنا بود که پیشنهاد اصلی محصولشان — یعنی تشخیص جابهجایی در دستهبندیها — توسط دادههای خودشان رد شد. آنها محصول را با یک هشدار در مستندات عرضه کرده بودند که خروجی مدل متغیر است، اما در عین حال هر خروجی سه-مرتبهای را به عنوان حقیقتی درباره جهان تحلیل میکردند.
محدودیتهای فنی و متدولوژی
این نتایج بهطور خاص برای مدل gemini-flash-latest در حال پاسخگویی از طریق دانش آموزشی (Training Knowledge) است. متدولوژی شامل موارد زیر بود:
- مدل: gemini-flash-latest (بدون جستوجوی زنده وب).
- نمونه: ۱۳ پرسش در سه شرکت در حوزههای تحلیل داده، ابزارهای پژوهشی و زیرساخت ابری.
- حجم: سه اجرا برای هر پرسش، با خوانشهایی در ۲ تا ۱۵ اوت و دو دسته مستقل در ۲۲ اوت ۲۰۲۶.
تیم اشاره کرد که پاسخهای مبتنی بر بازیابی (RAG) یا جستوجوهای زنده وب احتمالاً پایدارتر خواهند بود، زیرا فرآیند بازیابی، پاسخ را به منابع خاصی گره میزند (Anchor میکند).
استانداردهای جدید برای اندازهگیری AI
برای جلوگیری از گزارش نویز بهجای جابهجایی، این تیم اکنون یک «کنترل همزمان» (Same-session control) را اجباری کرده است. قانون ساده است: هر ادعای تغییر مستلزم یک اجرای مقایسهای در همان لحظه است. اگر کنترل همزمان به اندازه بازه زمانی جابهجا شد، هیچ تغییر واقعی برای گزارش وجود ندارد. این کار هزینه یک دسته اجرای اضافی را دارد، اما تفاوت بین یک «اندازهگیری» و یک «داستانسرایی» است.
این تغییر، ارزش دیدهشدن در AI را از «ردیابی روند» به یک اندازهگیری باینری تبدیل میکند: آیا نام شما برده شده است یا خیر؟ Thicket پیگیریهای مشتریان خود را بهروزرسانی کرد تا خطوط روند را حذف کرده و در عوض عددی را ارائه دهد که ثابت ماند: مشتریان در هر خوانشی غایب بودند و حتی یک بار هم نامشان برده نشد.
برای کسانی که در حال ساخت ابزارهای هوش تجاری (Market Intelligence) مبتنی بر AI هستند، درس روشن است: هر ادعای تغییر نیاورمند یک کنترل همزمان است، در غیر این صورت شما صرفاً در حال داستانسرایی با نویز هستید.
گام بعدی شما
- اگر از ابزارهای مانیتورینگ AI استفاده میکنید، از آنها بخواهید متدولوژی «کنترل همزمان» (Same-session control) را برای تفکیک نویز از سیگنال ارائه دهند.
- در تحلیلهای رقابتی، فقط به ۲ یا ۳ مورد اول لیستهای AI اعتماد کنید و موارد انتهایی را نادیده بگیرید.
- برای افزایش پایداری پاسخها در محصولات خود، از معماری RAG بهجای تکیه بر دانش داخلی مدل استفاده کنید.
اما داستان سختافزاری این نوسانات و تأثیر Temperature بر استنتاج حتی پیچیدهتر است — به تحلیل ما دربارهی بهینهسازی هزینههای GPU مراجعه کنید.




گفتگو