تصور کنید صاحب یک کسبوکار کوچک با درآمد سالانه ۳ میلیون دلار هستید و ناگهان پیشنهادی برای دریافت ۱۰۰ هزار دلار نقد دریافت میکنید؛ آن هم فقط در ازای دسترسی به گزارشهای داخلی شرکتتان. این مبلغ، قیمت اولیه است که یک آزمایشگاه هوش مصنوعی برای خرید دادههای عملیاتی یک شرکت کوچک پرداخت کرده است.
به نقل از گزارش dev.to در ۲۷ سپتامبر ۲۰۲۶، این تراکنش نشاندهنده یک چرخش راهبردی در نحوه جمعآوری دادههای آموزشی توسط غولهای فناوری است. برای سالها، اقتصاد داده بر ناشران بزرگ متمرکز بود. شرکتهایی مثل Reddit، Shutterstock و Associated Press قراردادهای مجوزهای گرانقیمتی امضا کردند تا آرشیوهای تمیز و ساختاریافته خود را در اختیار مدلها قرار دهند. در این موارد، شرکتهایی که آرشیوهای عظیمی داشتند، نسخههایی از محتوای خود را به صورت غیرانحصاری برای استفاده در آموزش مدلها اجاره میدادند. اما اکنون صنعت با یک دیوار مواجه شده است؛ بخش بزرگی از وب عمومی یا پشت دیوارهای پرداخت (Paywall) قرار گرفته و یا درگیر دعاوی حقوقی است. به همین دلیل، آزمایشگاهها تشنه دادههایی هستند که شبیه به مقالات صیقلخورده نباشند.
چرخش به سمت دادههای عملیاتی
همانطور که در تحلیل قبلی ما دربارهی ابزارهای تخصصی مثل reladraw و رفع شکافهای عاملهای هوش مصنوعی اشاره کردیم، صنعت اکنون به دنبال «بخش انسانی» منطق کسبوکار است. توسعهدهندگان دیگر به متنهای عمومی نیاز ندارند؛ آنها میخواهند ببینند یک دیسپچر (هماهنگکننده) چگونه یک تماس خدماتی را مدیریت میکند یا یک کارشناس فروش چطور با یک مورد استثنایی و عجیب مشتری برخورد میکند.
آنها به دنبال نمونههایی از تصمیمگیریهای واقعی هستند؛ همان لحظاتی که یک تیم عملیاتی مشکلی را حل میکند که هیچ سند رسمی یا دستورالعمل اداری پیشبینی نکرده بود. این دادههای «ناپخته» در مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — جایگاهی ندارند، بلکه در CRMها و لاگهای شرکتهای متوسط زندگی میکنند. اینها در واقع ثبتِ «قضاوتهای انسانی» در دنیای واقعی هستند که مدلها میتوانند از آنها یاد بگیرند. این رویکرد در راستای تلاش شرکتها برای بهینهسازی خروجیهای مدلهاست، مشابه آنچه در پژوهشهای داخلی آنتروپیک با هدایت مدل Claude برای ارتقای کارایی مدلها مشاهده شده است.
شواهد بازار و ساختار قراردادها
بر اساس این گزارش، دو قرارداد اخیر این بازار جدید را تایید میکنند. هر دو معامله توسط یک شریک مجوزده داده ترتیب داده شده است، نه توسط Nova Solutions، که به عنوان مدرکی قابل تایید عمل میکند که این دستهبندی از دادهها وجود دارد و با سرعت زیادی حرکت میکند:
- کسبوکار کوچک A: درآمد سالانه حدود ۳ میلیون دلار؛ دریافت ۱۰۰ هزار دلار پیشپرداخت برای یک مجوز غیرانحصاری و بدون شناسیت.
- تولیدکننده B: کمتر از ۱۰۰ کارمند؛ دریافت شرایط مشابه برای استخراج دادههای مشابه.
هر دو قرارداد تنها در سه روز کاری بسته شدند. این سرعت بالا به این دلیل است که شرایط قراردادها محدود است و نیازی به مهاجرت سیستمهای زنده یا تغییرات عملیاتی مداوم در سازمان فروشنده ندارد.
درک مکانیزمهای قرارداد
برای اینکه بفهمیم چرا این معاملات سریع پیش میروند، باید دو مفهوم کلیدی و مکانیزمهای خاص مورد استفاده را تعریف کنیم:
- غیرانحصاری (Non-exclusive): فروشنده به یک خریدار محدود نمیشود. آنها میتوانند همان دادههای زیربنایی را بعداً به خریدار دیگری نیز اجاره دهند.
- بدون شناسیت (De-identified): خریدار نسخهای پردازششده دریافت میکند. نامها، شماره حسابها و سایر جزئیات شناسایی قبل از اینکه دادهها از سیستمهای فروشنده خارج شوند، حذف یا ماسک میشوند.
از آنجا که سیستمهای اصلی و نسخههای اورجینال شرکت دستنخورده میمانند، کسبوکار دقیقاً مانند قبل به کار خود ادامه میدهد. علاوه بر این، فروشنده باید هم قیمت و هم خریدار را قبل از هرگونه انتقال داده تایید کند؛ هیچ اجباری برای پذیرش هر پیشنهادی وجود ندارد.
چرا اکنون؟
این تغییر به دلیل وقوع همزمان دو اتفاق رخ داده است. اول اینکه عرضه متنهای باکیفیت و رایگان در وب عمومی کمتر از گذشته شده است. آزمایشگاههایی که بدون مجوز دادهها را استخراج (Scrape) میکردند، اکنون با شکایتهای حقوقی مواجهاند. دوم اینکه قابلیتهای زبانی عمومی به سقف خود رسیدهاند. جهش بعدی در عملکرد هوش مصنوعی نه از متنهای عمومی، بلکه از نمونههای تخصصی هر حوزه (Domain-specific) حاصل میشود.
سوابق عملیاتی معمولی — همانهایی که در لاگهای اعزام یا CRMها ثبت شدهاند و هرگز برای خوانده شدن توسط مخاطب نوشته نشدهاند — دقیقاً همان نمونههایی هستند که آزمایشگاهها اکنون به آن نیاز دارند. این یک پیشنهاد واقعی است، نه ادعاهای مبهم «دادههای شما ارزشمند است» که کسبوکارها یک دهه است میشنوند. اکنون یک خریدار ساختاریافته برای بخش کوچکی از دادهها با قیمت و سرعتی وجود دارد که توجه هر صاحب کسبوکاری را جلب میکند. این تغییر در مدلهای درآمدی داده، در کنار تغییرات در استراتژیهای قیمتگذاری مبتنی بر نتیجه در OpenAI، نشاندهنده بازنگری کلی در نحوه تعامل مالی بین تامینکنندگان داده و ارائهدهندگان هوش مصنوعی است.
دستههای با ارزش بالا
برای یک صاحب کسبوکار، این اتفاق دادهها را از یک «هزینه ذخیرهسازی» به یک «دارایی نقد» تبدیل میکند. حوزههایی که در حال حاضر بیشترین احتمال داشتن ارزش قابل مجوزده را دارند عبارتند از:
- تولید و توزیع
- حملونقل و لجستیک
- حسابداری و امور مالی
- بیمه و خدمات حرفهای
- ساختوساز و خردهفروشی
در حال حاضر، سوابق پزشکی و حقوقی به دلیل انتظار برای تاییدیه قانونی خریداران در مورد اطلاعات حفاظتشده، کاملاً از این دستهبندی خارج هستند.
این وضعیت بازار ثانویهای برای شرکای مجوزده داده ایجاد میکند که میتوانند نمونههای بدون شناسیت را آماده کرده و با آزمایشگاهها تطبیق دهند. اگر کسبوکاری در یکی از دستههای «مجاز» فعالیت کند، مانع ورود به این بازار بسیار کم است.
در آینده، منتظر ظهور ممیزیهای استاندارد «آمادگی داده» (Data-readiness) برای کسبوکارهای کوچک باشید. همانطور که آزمایشگاهها برای دسترسی به منطق عملیاتی تخصصی با هم رقابت میکنند، قیمت لاگهای باکیفیت و خاص هر حوزه ممکن است بر اساس کمیابی تخصص صنعتی که نمایندگی میکنند، نوسان داشته باشد.
گام بعدی شما
- اگر در حوزههای لجستیک یا تولید فعالیت میکنید، ساختار لاگهای CRM خود را بررسی کنید تا ببینید آیا دادههای «تصمیمگیری» در آنها ثبت شده است یا خیر.
- با شرکتهای واسط مجوزده داده (Data Licensing Partners) ارتباط بگیرید تا ارزش تقریبی دادههای عملیاتی خود را بسنجید.
- برای هرگونه فروش داده، حتماً از یک لایه «حذف شناسیت» (De-identification) سختگیرانه استفاده کنید تا حریم خصوصی مشتریان به خطر نیفتد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو