پرش به محتوای اصلی
پرش به محتوای مقاله

چرا تشخیص تغییرات واقعی در بازار تامین‌کنندگان LLM دشوار شده است؟

·۲۱ شهریور ۱۴۰۵۹ دقیقه مطالعه۱ بازدید
بررسی دیداری هوش مصنوعی نیازمند اجرای کنترلی است، وگرنه نویز را به‌جای حرکت گزارش می‌کنید
بررسی دیداری هوش مصنوعی نیازمند اجرای کنترلی است، وگرنه نویز را به‌جای حرکت گزارش می‌کنید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات آماری اینکه نوسانات کوتاه‌مدت (۲۰ دقیقه‌ای) در توصیه‌های LLM با نوسانات بلندمدت (۳ هفته‌ای) تفاوتی ندارد و اکثر «روندهای بازار» در AI در واقع نویز نمونه‌برداری هستند.

اگر برای شناسایی رقبای خود به توصیه‌های هوش مصنوعی تکیه می‌کنید، احتمالاً دارید داده‌های تصادفی را تحلیل می‌کنید. یک پرسش ساده با هدف خرید (Buyer-intent) از مدل gemini-flash-latest می‌تواند در فاصلهٔ تنها ۲۰ دقیقه، لیستی به‌طور قابل‌اندازه‌گیری متفاوت از تامین‌کنندگان را ارائه دهد.

این یافته که در ۲۲ اوت ۲۰۲۶ توسط تیم Thicket AI منتشر شد، هشدار می‌دهد بسیاری از شرکت‌هایی که ادعای «تغییر در جایگاه بازار» را در دیده‌شدن توسط هوش مصنوعی دارند، در واقع دارند «نویز نمونه‌برداری» را گزارش می‌کنند. برای کسب‌وکاری که هزینهٔ هنگفتی برای مانیتورینگ دیده‌شدن (Visibility) در AI می‌پردازد، این یک تفاوت حیاتی است. اکثر ابزارهای نظارتی ادعا می‌کنند که جابه‌جایی یک مجموعه رقابتی را در بازه‌های چند هفته‌ای یا چند ماهه رصد می‌کنند؛ اما اگر «کفِ نویز» مدل بالاتر از تغییرات واقعی بازار باشد، این داده‌ها برای تحلیل روند عملاً بی‌فایده هستند.

تصور کنید رتبهٔ خود را در یک جدول امتیازات چک می‌کنید و می‌بینید با هر بار رفرش کردن صفحه، جایگاهتان تغییر می‌کند، در حالی که هیچ‌کس واقعاً جابه‌جا نشده است. این دقیقاً وضعیت فعلی توصیه‌های تامین‌کنندگان در هوش مصنوعی است. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی پایداری خروجی‌های مدل‌های زبانی اشاره کردیم، تکرارپذیری یکی از بزرگ‌ترین چالش‌های استقرار تجاری این فناوری است.

مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — در اینجا رفتاری غیرقابل‌پیش‌بینی دارد. این عدم قطعیت در خروجی‌ها با چالش‌های گسترده‌تری در تولید محتوای فنی همسو است؛ چنان‌که بررسی‌های اخیر نشان می‌دهد بخش بزرگی از مقالات فنی تولیدشده توسط AI حاوی ادعاهای ساختگی هستند. برای اثبات این موضوع، Thicket یک آزمایش کنترل‌شده روی ۱۳ پرسش با هدف خرید در سه شرکت فعال در بخش‌های تحلیل داده (Analytics) و زیرساخت ابری (Cloud Infrastructure) اجرا کرد. آن‌ها دو بازه زمانی متفاوت را با هم مقایسه کردند:

  • بازه زمانی (The Interval): خوانش‌هایی که با فاصلهٔ ۱۷ تا ۲۰ روز از یکدیگر گرفته شده بودند.
  • گروه کنترل (The Control): خوانش‌هایی که در یک صبح و با فاصلهٔ تقریبی ۲۰ دقیقه از هم انجام شدند.

فرآیند Thicket شامل اجرای هر پرسش سه بار در هر نوبت خوانش بود. تیم در ابتدا متوجه جابه‌جایی‌های قابل‌توجهی در فاصله سه هفته‌ای شد. برای تنها یک شرکت، نه نام در چهار پرسش مختلف تغییر کرده بود. در دسته‌بندی «تحلیل‌های حریم‌خصوصی»، نام‌های Plausible و Fathom حذف شده و Umami وارد شده بود. در دسته‌بندی «برنامه‌های بعداً بخوان» (Read-later)، نام‌های Pocket، Cubox و Mailbrew جای خود را به KTool و Upnext داده بودند.

این در ابتدا شبیه به یک روایت جذاب بود: گویی دسته‌بندی‌ها هر ماه در حال بازسازی هستند و مشتریان خارج از این چرخه قرار دارند. این یافته‌ای هشداردهنده بود که استدلالی قوی برای خرید اشتراک‌های مانیتورینگ ماهانه به‌جای یک ممیزی (Audit) یک‌باره فراهم می‌کرد. با این حال، تیم متوجه شد که این ادعا پیش از آنکه در ایمیلی ارسال شود، نیاز به یک آزمایش کنترل دارد.

طبق گزارش Thicket، نتایج در نهایت تقریباً یکسان بود. میانگین تفاوت متقارن (Mean Symmetric Difference) — یعنی تعداد نام‌هایی که در یک خوانش حضور داشتند اما در دیگری نبودند — برای بازهٔ سه هفته‌ای ۳.۵۰ نام و برای بازهٔ ۲۰ دقیقه‌ای ۳.۶۷ نام بود.

بررسی دیداری هوش مصنوعی نیازمند اجرای کنترلی است، در غیر این صورت نویز را به‌جای حرکت گزارش می‌دهید.

یک آزمون علامت دوطرفه (Two-sided sign test) منجر به p = 1.000 شد؛ این یعنی هیچ اثر قابل‌تشخیصی از گذشت زمان در تغییر لیست‌ها دیده نشد. در ۵ پرسش، گروه کنترل جابه‌جایی بیشتری داشت، در ۶ پرسش بازه سه هفته‌ای جابه‌جایی بیشتری داشت و یک مورد مساوی بود. جابه‌جایی‌هایی که تیم در ابتدا فکر می‌کرد روند بازار است، کاملاً در لحظه و بدون گذشت زمان تکرار می‌شد.

جزئیات تفکیکی جابه‌جایی‌ها

برای درک بهتر کفِ نویز، Thicket انواع خاصی از پرس‌وجوها را ردیابی کرد. یک پرس‌وجوی تعریفی از لیست نهایی ۱۲ مورد حذف شد، زیرا «نام‌های» استخراج شده از آن، عبارت‌های مربوط به ویژگی‌ها بودند نه نام تامین‌کنندگان، که این امر می‌توانست نتایج را به‌طور کاذب بهبود ببخشد.

داده‌های نوسان پرس‌وجوها:

  • پرس‌وجوهای با نوسان بالا:

    • «جایگزین‌های NotebookLM برای مقالات پژوهشی»: ۷ نام در ۳ هفته تغییر کرد؛ ۶ نام در ۲۰ دقیقه تغییر کرد.
    • «برنامه‌های بعداً بخوان که به شما در تمام کردن مطالب کمک کنند»: ۴ نام در ۳ هفته تغییر کرد؛ ۵ نام در ۲۰ دقیقه تغییر کرد.
    • «تبدیل یوتیوب و پادکست‌ها به یادداشت»: ۳ نام در ۳ هفته تغییر کرد؛ ۶ نام در ۲۰ دقیقه تغییر کرد.
  • پرس‌وجوهای با نوسان پایین:

    • «ابزارهای بازپخش جلسه (Session Replay) متن‌باز»: ۰ نام در ۳ هفته تغییر کرد؛ ۱ نام در ۲۰ دقیقه تغییر کرد.
    • «تحلیل‌های محصول سبک و دوست‌دار حریم‌خصوصی»: ۰ نام در ۳ هفته تغییر کرد؛ ۴ نام در ۲۰ دقیقه تغییر کرد.
  • پرس‌وجوهای با نوسان متوسط:

    • «سازماندهی و اتصال یادداشت‌های پژوهشی با AI»: ۶ نام در ۳ هفته تغییر کرد؛ ۲ نام در ۲۰ دقیقه تغییر کرد.
    • «ضبط و بازپخش جلسات اپلیکیشن موبایل»: ۲ نام در ۳ هفته تغییر کرد؛ ۳ نام در ۲۰ دقیقه تغییر کرد.
    • «ابر‌های AI-native که دیتابیس و استنتاج را یکجا ارائه می‌دهند»: ۴ نام در ۳ هفته تغییر کرد؛ ۲ نام در ۲۰ دقیقه تغییر کرد.
    • «استنتاج و دیتابیس روی یک ابر واحد»: ۰ نام در ۳ هفته تغییر کرد؛ ۵ نام در ۲۰ دقیقه تغییر کرد.
    • «جایگزین‌های Vercel و Supabase»: ۴ نام در ۳ هفته تغییر کرد؛ ۴ نام در ۲۰ دقیقه تغییر کرد.
    • «توابع + Postgres + یک نقطه اتصال LLM»: ۱ نام در ۳ هفته تغییر کرد؛ ۲۴ نام در ۲۰ دقیقه تغییر کرد.

خطای استخراج داده‌ها

تیم همچنین متوجه نقص در ابزار اندازه‌گیری خود شد. آن‌ها در ابتدا نرخ پایداری ۵۳ درصدی را تحت عنوان «نیمی از نام‌های تامین‌کنندگان... در اجرای دوم باقی نمی‌مانند» گزارش کردند. با این حال، یک اسکریپت بررسی ادعاها بعداً فاش کرد که استخراج‌کننده نام آن‌ها، تامین‌کنندگانی را که در واقع در متن خام مدل حضور داشتند، حذف می‌کرد.

پس از اندازه‌گیری مجدد بر اساس متن خام، Thicket دریافت که ۲۷ درصد از جابه‌جایی‌های گزارش‌شده ناشی از نرم‌افزار خودشان بود، نه مدل AI. این یک داستان هشداردهنده است: شما باید پیش از اعتماد به داده‌ها، ابزار اندازه‌گیری خود را اندازه بگیرید. تیم تصمیم گرفت به‌جای ویرایش بی‌سروصدای اعداد، یک اصلاحیه منتشر کند تا اهمیت اندازه‌گیری ابزار را برجسته سازد.

آنچه پایدار می‌ماند

با وجود نویز در «دم» (Tail) لیست، برخی داده‌ها همچنان قابل‌اعتماد هستند. این مطالعه نشان داد که «عدم حضور» (Absence) کاملاً تکرارپذیر است.

  • سه شرکت مورد آزمایش در ۰ مورد از ۷۸ اجرای انجام شده در دو برداشت مستقل در یک صبح، نام برده نشدند.
  • یک شرکت در ۴۵ اجرا در سه نوبت خوانش در دو تاریخ مختلف با فاصله یک هفته، غایب باقی ماند.

در هیچ موردی شرکتی که به عنوان «غایب» شناسایی شده بود، به‌طور ناگهانی در یک اجرای مجدد در پاسخ ظاهر نشد. در واقع، اینکه شرکتی در لیست هست یا نیست یک ویژگی پایدار است؛ اما اینکه چه نام‌های دیگری در کنار او در لیست هستند، پایدار نیست.

تفکیک سر در مقابل دم (Head-versus-Tail)

پایداری به‌طور قابل‌توجهی بر اساس جایگاه نام در پاسخ AI متفاوت است. Thicket متوجه شکاف واضحی بین «سر» و «دم» لیست تامین‌کنندگان شد:

  • سر (The Head): دو یا سه نام اول معمولاً پایدار هستند. برای یک پرسش زیرساختی، CoreWeave در هر سه خوانش نام برده شد و RunPod در دو مورد از سه خوانش.
  • دم (The Tail): نام‌هایی که در پایین‌تر از لیست قرار دارند به‌شدت ناپایدارند. Together AI، Crusoe، Modal و Lambda هر کدام دقیقاً یک بار نام برده شدند.

نقل‌قول از دو نام اول یک لیست قابل دفاع است، اما نقل‌قول از مورد پنجم، به گفته پژوهشگران، شبیه به «نقل‌قول از پرتاب یک سکه» است.

پارادوکس مانیتورینگ

این وضعیت یک پارادوکس برای محصولات مانیتورینگ دیده‌شدن در AI ایجاد می‌کند. مانیتورینگ به معنای تشخیص تغییر است، اما تشخیص تغییر مستلزم تفکیک سیگنال از نویز است.

اگر یک گزارش ماهانه ادعا کند سه تامین‌کننده وارد یک دسته‌بندی شده‌اند و دو مورد خارج شده‌اند، احتمالاً دارد همان تصادفی بودن را توصیف می‌کند که در یک پنجره ۲۰ دقیقه‌ای رخ می‌دهد. برای Thicket، این بدان معنا بود که پیشنهاد اصلی محصولشان — یعنی تشخیص جابه‌جایی در دسته‌بندی‌ها — توسط داده‌های خودشان رد شد. آن‌ها محصول را با یک هشدار در مستندات عرضه کرده بودند که خروجی مدل متغیر است، اما در عین حال هر خروجی سه-مرتبه‌ای را به عنوان حقیقتی درباره جهان تحلیل می‌کردند.

محدودیت‌های فنی و متدولوژی

این نتایج به‌طور خاص برای مدل gemini-flash-latest در حال پاسخگویی از طریق دانش آموزشی (Training Knowledge) است. متدولوژی شامل موارد زیر بود:

  • مدل: gemini-flash-latest (بدون جست‌وجوی زنده وب).
  • نمونه: ۱۳ پرسش در سه شرکت در حوزه‌های تحلیل داده، ابزارهای پژوهشی و زیرساخت ابری.
  • حجم: سه اجرا برای هر پرسش، با خوانش‌هایی در ۲ تا ۱۵ اوت و دو دسته مستقل در ۲۲ اوت ۲۰۲۶.

تیم اشاره کرد که پاسخ‌های مبتنی بر بازیابی (RAG) یا جست‌وجوهای زنده وب احتمالاً پایدارتر خواهند بود، زیرا فرآیند بازیابی، پاسخ را به منابع خاصی گره می‌زند (Anchor می‌کند).

استانداردهای جدید برای اندازه‌گیری AI

برای جلوگیری از گزارش نویز به‌جای جابه‌جایی، این تیم اکنون یک «کنترل هم‌زمان» (Same-session control) را اجباری کرده است. قانون ساده است: هر ادعای تغییر مستلزم یک اجرای مقایسه‌ای در همان لحظه است. اگر کنترل هم‌زمان به اندازه بازه زمانی جابه‌جا شد، هیچ تغییر واقعی برای گزارش وجود ندارد. این کار هزینه یک دسته اجرای اضافی را دارد، اما تفاوت بین یک «اندازه‌گیری» و یک «داستان‌سرایی» است.

این تغییر، ارزش دیده‌شدن در AI را از «ردیابی روند» به یک اندازه‌گیری باینری تبدیل می‌کند: آیا نام شما برده شده است یا خیر؟ Thicket پیگیری‌های مشتریان خود را به‌روزرسانی کرد تا خطوط روند را حذف کرده و در عوض عددی را ارائه دهد که ثابت ماند: مشتریان در هر خوانشی غایب بودند و حتی یک بار هم نامشان برده نشد.

برای کسانی که در حال ساخت ابزارهای هوش تجاری (Market Intelligence) مبتنی بر AI هستند، درس روشن است: هر ادعای تغییر نیاورمند یک کنترل هم‌زمان است، در غیر این صورت شما صرفاً در حال داستان‌سرایی با نویز هستید.

گام بعدی شما

  • اگر از ابزارهای مانیتورینگ AI استفاده می‌کنید، از آن‌ها بخواهید متدولوژی «کنترل هم‌زمان» (Same-session control) را برای تفکیک نویز از سیگنال ارائه دهند.
  • در تحلیل‌های رقابتی، فقط به ۲ یا ۳ مورد اول لیست‌های AI اعتماد کنید و موارد انتهایی را نادیده بگیرید.
  • برای افزایش پایداری پاسخ‌ها در محصولات خود، از معماری RAG به‌جای تکیه بر دانش داخلی مدل استفاده کنید.

اما داستان سخت‌افزاری این نوسانات و تأثیر Temperature بر استنتاج حتی پیچیده‌تر است — به تحلیل ما درباره‌ی بهینه‌سازی هزینه‌های GPU مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر متدولوژی آماری دقیق، اعتبار بسیاری از ابزارهای تحلیل بازار AI را زیر سؤال می‌برد. در واقع، تخصص در اندازه‌گیری خروجی‌های احتمالی مدل‌ها اکنون از خودِ مدل‌ها مهم‌تر شده است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال ساخت ابزارهای تحلیل بازار مبتنی بر AI هستند، این خبر هشدار می‌دهد که بدون پیاده‌سازی کنترل‌های آماری، داده‌های تولیدی آن‌ها فاقد ارزش تجاری خواهد بود.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها مفهوم «سئو برای هوش مصنوعی» (GEO) را به چالش می‌کشد. وقتی خروجی‌های مدل در بازه‌های زمانی کوتاه این‌قدر نوسان دارد، تلاش برای رتبه‌بندی در جایگاه‌های پایین لیست عملاً بی‌معنی است و تمام تمرکز باید روی ورود به «سر لیست» یا تضمین حضور دوتایی (Binary Presence) باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.