پرش به محتوای اصلی
پرش به محتوای مقاله

«خرید داده‌های ناپخته»؛ استراتژی جدید آزمایشگاه‌های هوش مصنوعی برای بهبود مدل‌ها

·۵ مهر ۱۴۰۵۴ دقیقه مطالعه
پرداخت به کسب‌وکارهای کوچک در اقتصاد داده‌های هوش مصنوعی آغاز شد
پرداخت به کسب‌وکارهای کوچک در اقتصاد داده‌های هوش مصنوعی آغاز شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر هدف از خرید آرشیوهای تمیز (مثل خبرگزاری‌ها) به خرید لاگ‌های «ناپخته» و عملیاتی از کسب‌وکارهای کوچک برای یادگیری منطق تصمیم‌گیری انسانی.

تصور کنید صاحب یک کسب‌وکار کوچک با درآمد سالانه ۳ میلیون دلار هستید و ناگهان پیشنهادی برای دریافت ۱۰۰ هزار دلار نقد دریافت می‌کنید؛ آن هم فقط در ازای دسترسی به گزارش‌های داخلی شرکتتان. این مبلغ، قیمت اولیه است که یک آزمایشگاه هوش مصنوعی برای خرید داده‌های عملیاتی یک شرکت کوچک پرداخت کرده است.

به نقل از گزارش dev.to در ۲۷ سپتامبر ۲۰۲۶، این تراکنش نشان‌دهنده یک چرخش راهبردی در نحوه جمع‌آوری داده‌های آموزشی توسط غول‌های فناوری است. برای سال‌ها، اقتصاد داده بر ناشران بزرگ متمرکز بود. شرکت‌هایی مثل Reddit، Shutterstock و Associated Press قراردادهای مجوزهای گران‌قیمتی امضا کردند تا آرشیوهای تمیز و ساختاریافته خود را در اختیار مدل‌ها قرار دهند. در این موارد، شرکت‌هایی که آرشیوهای عظیمی داشتند، نسخه‌هایی از محتوای خود را به صورت غیرانحصاری برای استفاده در آموزش مدل‌ها اجاره می‌دادند. اما اکنون صنعت با یک دیوار مواجه شده است؛ بخش بزرگی از وب عمومی یا پشت دیوارهای پرداخت (Paywall) قرار گرفته و یا درگیر دعاوی حقوقی است. به همین دلیل، آزمایشگاه‌ها تشنه داده‌هایی هستند که شبیه به مقالات صیقل‌خورده نباشند.

چرخش به سمت داده‌های عملیاتی

همان‌طور که در تحلیل قبلی ما درباره‌ی ابزارهای تخصصی مثل reladraw و رفع شکاف‌های عامل‌های هوش مصنوعی اشاره کردیم، صنعت اکنون به دنبال «بخش انسانی» منطق کسب‌وکار است. توسعه‌دهندگان دیگر به متن‌های عمومی نیاز ندارند؛ آن‌ها می‌خواهند ببینند یک دیسپچر (هماهنگ‌کننده) چگونه یک تماس خدماتی را مدیریت می‌کند یا یک کارشناس فروش چطور با یک مورد استثنایی و عجیب مشتری برخورد می‌کند.

آن‌ها به دنبال نمونه‌هایی از تصمیم‌گیری‌های واقعی هستند؛ همان لحظاتی که یک تیم عملیاتی مشکلی را حل می‌کند که هیچ سند رسمی یا دستورالعمل اداری پیش‌بینی نکرده بود. این داده‌های «ناپخته» در مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — جایگاهی ندارند، بلکه در CRMها و لاگ‌های شرکت‌های متوسط زندگی می‌کنند. این‌ها در واقع ثبتِ «قضاوت‌های انسانی» در دنیای واقعی هستند که مدل‌ها می‌توانند از آن‌ها یاد بگیرند. این رویکرد در راستای تلاش شرکت‌ها برای بهینه‌سازی خروجی‌های مدل‌هاست، مشابه آنچه در پژوهش‌های داخلی آنتروپیک با هدایت مدل Claude برای ارتقای کارایی مدل‌ها مشاهده شده است.

شواهد بازار و ساختار قراردادها

بر اساس این گزارش، دو قرارداد اخیر این بازار جدید را تایید می‌کنند. هر دو معامله توسط یک شریک مجوزده داده ترتیب داده شده است، نه توسط Nova Solutions، که به عنوان مدرکی قابل تایید عمل می‌کند که این دسته‌بندی از داده‌ها وجود دارد و با سرعت زیادی حرکت می‌کند:

  • کسب‌وکار کوچک A: درآمد سالانه حدود ۳ میلیون دلار؛ دریافت ۱۰۰ هزار دلار پیش‌پرداخت برای یک مجوز غیرانحصاری و بدون شناسیت.
  • تولیدکننده B: کمتر از ۱۰۰ کارمند؛ دریافت شرایط مشابه برای استخراج داده‌های مشابه.

هر دو قرارداد تنها در سه روز کاری بسته شدند. این سرعت بالا به این دلیل است که شرایط قراردادها محدود است و نیازی به مهاجرت سیستم‌های زنده یا تغییرات عملیاتی مداوم در سازمان فروشنده ندارد.

درک مکانیزم‌های قرارداد

برای اینکه بفهمیم چرا این معاملات سریع پیش می‌روند، باید دو مفهوم کلیدی و مکانیزم‌های خاص مورد استفاده را تعریف کنیم:

  • غیرانحصاری (Non-exclusive): فروشنده به یک خریدار محدود نمی‌شود. آن‌ها می‌توانند همان داده‌های زیربنایی را بعداً به خریدار دیگری نیز اجاره دهند.
  • بدون شناسیت (De-identified): خریدار نسخه‌ای پردازش‌شده دریافت می‌کند. نام‌ها، شماره حساب‌ها و سایر جزئیات شناسایی قبل از اینکه داده‌ها از سیستم‌های فروشنده خارج شوند، حذف یا ماسک می‌شوند.

از آنجا که سیستم‌های اصلی و نسخه‌های اورجینال شرکت دست‌نخورده می‌مانند، کسب‌وکار دقیقاً مانند قبل به کار خود ادامه می‌دهد. علاوه بر این، فروشنده باید هم قیمت و هم خریدار را قبل از هرگونه انتقال داده تایید کند؛ هیچ اجباری برای پذیرش هر پیشنهادی وجود ندارد.

چرا اکنون؟

این تغییر به دلیل وقوع هم‌زمان دو اتفاق رخ داده است. اول اینکه عرضه متن‌های باکیفیت و رایگان در وب عمومی کمتر از گذشته شده است. آزمایشگاه‌هایی که بدون مجوز داده‌ها را استخراج (Scrape) می‌کردند، اکنون با شکایت‌های حقوقی مواجه‌اند. دوم اینکه قابلیت‌های زبانی عمومی به سقف خود رسیده‌اند. جهش بعدی در عملکرد هوش مصنوعی نه از متن‌های عمومی، بلکه از نمونه‌های تخصصی هر حوزه (Domain-specific) حاصل می‌شود.

سوابق عملیاتی معمولی — همان‌هایی که در لاگ‌های اعزام یا CRMها ثبت شده‌اند و هرگز برای خوانده شدن توسط مخاطب نوشته نشده‌اند — دقیقاً همان نمونه‌هایی هستند که آزمایشگاه‌ها اکنون به آن نیاز دارند. این یک پیشنهاد واقعی است، نه ادعاهای مبهم «داده‌های شما ارزشمند است» که کسب‌وکارها یک دهه است می‌شنوند. اکنون یک خریدار ساختاریافته برای بخش کوچکی از داده‌ها با قیمت و سرعتی وجود دارد که توجه هر صاحب کسب‌وکاری را جلب می‌کند. این تغییر در مدل‌های درآمدی داده، در کنار تغییرات در استراتژی‌های قیمت‌گذاری مبتنی بر نتیجه در OpenAI، نشان‌دهنده بازنگری کلی در نحوه تعامل مالی بین تامین‌کنندگان داده و ارائه‌دهندگان هوش مصنوعی است.

دسته‌های با ارزش بالا

برای یک صاحب کسب‌وکار، این اتفاق داده‌ها را از یک «هزینه ذخیره‌سازی» به یک «دارایی نقد» تبدیل می‌کند. حوزه‌هایی که در حال حاضر بیشترین احتمال داشتن ارزش قابل مجوزده را دارند عبارتند از:

  • تولید و توزیع
  • حمل‌ونقل و لجستیک
  • حسابداری و امور مالی
  • بیمه و خدمات حرفه‌ای
  • ساخت‌وساز و خرده‌فروشی

در حال حاضر، سوابق پزشکی و حقوقی به دلیل انتظار برای تاییدیه قانونی خریداران در مورد اطلاعات حفاظت‌شده، کاملاً از این دسته‌بندی خارج هستند.

این وضعیت بازار ثانویه‌ای برای شرکای مجوزده داده ایجاد می‌کند که می‌توانند نمونه‌های بدون شناسیت را آماده کرده و با آزمایشگاه‌ها تطبیق دهند. اگر کسب‌وکاری در یکی از دسته‌های «مجاز» فعالیت کند، مانع ورود به این بازار بسیار کم است.

در آینده، منتظر ظهور ممیزی‌های استاندارد «آمادگی داده» (Data-readiness) برای کسب‌وکارهای کوچک باشید. همان‌طور که آزمایشگاه‌ها برای دسترسی به منطق عملیاتی تخصصی با هم رقابت می‌کنند، قیمت لاگ‌های باکیفیت و خاص هر حوزه ممکن است بر اساس کمیابی تخصص صنعتی که نمایندگی می‌کنند، نوسان داشته باشد.

گام بعدی شما

  • اگر در حوزه‌های لجستیک یا تولید فعالیت می‌کنید، ساختار لاگ‌های CRM خود را بررسی کنید تا ببینید آیا داده‌های «تصمیم‌گیری» در آن‌ها ثبت شده است یا خیر.
  • با شرکت‌های واسط مجوزده داده (Data Licensing Partners) ارتباط بگیرید تا ارزش تقریبی داده‌های عملیاتی خود را بسنجید.
  • برای هرگونه فروش داده، حتماً از یک لایه «حذف شناسیت» (De-identification) سخت‌گیرانه استفاده کنید تا حریم خصوصی مشتریان به خطر نیفتد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این روند باعث تبدیل داده‌های داخلی شرکت‌های کوچک به دارایی‌های مالی قابل معامله می‌شود. همچنین تکیه بر داده‌های عملیاتی، احتمال توهم مدل‌ها را در محیط‌های کاری واقعی کاهش می‌دهد چون مدل بر اساس تجربه واقعی آموزش می‌بیند، نه متن‌های تئوریک.

تأثیر برای ایران

در حال حاضر اثر مستقیمی بر کاربران ایرانی ندارد، اما برای شرکت‌های لجستیکی و تولیدی ایرانی که داده‌های ساختاریافته دارند، می‌تواند در آینده مسیری برای درآمدزایی ارزی از طریق شرکای بین‌المللی باشد.

·نگاه ما
تحریریه دات‌هوش

این جابجایی نشان می‌دهد که عصر «بیشتر داشتن داده» به پایان رسیده و عصر «داده‌های با کیفیت و خاص» آغاز شده است. مدل‌ها دیگر با خواندن کل اینترنت باهوش نمی‌شوند، بلکه باید یاد بگیرند انسان‌ها در شرایط بحرانی و غیررسمی چگونه تصمیم می‌گیرند. این یعنی ارزش اقتصادی از دست ناشران محتوا به دست مدیران عملیاتی منتقل می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.