پرش به محتوای اصلی
پرش به محتوای مقاله

مدیریت داده در برابر زیرساخت ذخیره‌سازی؛ اولویت جدید سازمان‌ها

·۵ شهریور ۱۴۰۵۱۱ دقیقه مطالعه۲ بازدید
ایان لایسن، مدیرعامل و هم‌بنیان‌گذار دیتادوبی - مصاحبه اختصاصی
ایان لایسن، مدیرعامل و هم‌بنیان‌گذار دیتادوبی - مصاحبه اختصاصی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر تعریف داده‌های «بدون ساختار» از یک هزینه عملیاتی (Storage Cost) به یک ریسک امنیتی فعال (Security Liability) به دلیل توانایی عامل‌های AI در دسترسی سریع به داده‌های گمنام.

تصور کنید یک مدیر فناوری اطلاعات هستید که میلیاردها فایل قدیمی در سرورهای شرکت دارد؛ حالا یک عامل هوش مصنوعی با دسترسی گسترده، تمام اسرار مگو و فایل‌های حساس سال‌های پیش را در یک ثانیه به هر کارمندی که سؤال درست بپرسد، تحویل می‌دهد. این کابوس، نتیجه‌ی مستقیم تغذیه‌ی مدل‌های قدرتمند با داده‌های منقضی‌شده یا دسترسی‌های نادرست است که تنها باعث می‌شود پاسخ‌های غلط با سرعت بیشتری تولید شوند.

ایان لایسن (Ian Leysen)، مدیرعامل و هم‌بنیان‌گذار شرکت Datadobi، استدلال می‌کند که وسواس فعلی سازمان‌ها روی خرید GPUها و قدرت محاسباتی، یک نقص بنیادین را نادیده می‌گیرد: خودِ داده‌ها در بسیاری از موارد به یک «بدهی» یا ریسک تبدیل شده‌اند. لایسن با بیش از سه دهه تجربه در مهندسی نرم‌افزار، تضمین کیفیت و مدیریت داده‌های سازمانی، دیدگاهی عمیق به این چالش دارد. او پیش از تأسیس Datadobi در سال ۲۰۰۹، هشت سال را در شرکت EMC به عنوان مدیر ارشد تضمین کیفیت گذراند و پیش از آن نقش‌های رهبری در Wave Research و Mediagenix داشت. او در طول مسیر شغلی خود، تخصص ویژه‌ای در ساخت سازمان‌های مهندسی نرم‌افزار با کیفیت بالا کسب کرد و سه تیم تضمین کیفیت را از پایه بنا نهاد.

زمینه و بستر ذخیره‌سازی سازمانی

برای دهه‌ها، سازمان‌های بزرگ با ذخیره‌سازی مانند خرید یک کالای مصرفی برخورد کردند. طبق گفته‌های لایسن، او در دوران حضورش در EMC مشاهده کرد که شرکت‌ها میلیاردها دلار روی زیرساخت‌های ذخیره‌سازی هزینه کردند اما تقریباً هیچ دیدی نداشتند که واقعاً چه چیزی روی این دیسک‌ها قرار دارد. آن‌ها در کمک به مشتریان برای ذخیره و حفاظت از داده‌ها عالی بودند، اما هرگز سؤالات سخت‌تر را نپرسیدند: این داده‌ها دقیقاً چیستند؟ مالک آن‌ها کیست؟ آیا هنوز کسی به آن‌ها نیاز دارد؟ و ارزش واقعی آن‌ها چقدر است؟

این شکاف میان قابلیت‌های زیرساختی و درک داده‌ها سال‌ها وجود داشته است، اما هوش مصنوعی زاینده ناگهان هزینه نادیده گرفتن آن را فوری و ملموس کرد. تصور کنید شرکتی با میلیاردها فایل دارد که در سرورهای محلی (On-premises)، ابرهای مختلف و مخازن SaaS پراکنده شده‌اند. در گذشته، فایلی با دسترسی‌های بیش از حد، یک ریسک تئوریک بود؛ زیرا یک انسان باید ابتدا می‌دانست چنین فایلی وجود دارد و سپس به دنبال آن می‌گشت.

امروز، یک عامل هوش مصنوعی با دسترسی گسترده می‌تواند همان فایل حساس را برای هر کاربری که سؤال درستی بپرسد، بیرون بکشد و در لحظه لایه‌ی «حفاظت از طریق گمنامی» را از بین ببرد. لایسن اشاره می‌کند که پانزده سال پیش، یک اشتراک فایل مدیریت‌نشده عمدتاً یک مشکل هزینه و انطباق قانونی بود. اما اکنون، همان اشتراک فایل در لحظه‌ای که یک مدل یا عامل هوش مصنوعی به آن متصل شود، به یک بدهی و ریسک امنیتی تبدیل می‌شود.

تکامل مشکل داده‌ها

لایسن تأکید می‌کند که چشم‌انداز اولیه Datadobi — یعنی کمک به سازمان‌ها برای جابه‌جایی و مدیریت هوشمند داده‌های بدون ساختار به جای انتقال ساده آن‌ها از یک آرایه به آرایه دیگر — همچنان پابرجاست، اما مخاطرات تغییر کرده است. فوریت این موضوع افزایش یافته زیرا داده‌های بدون ساختار از چیزی که سازمان‌ها صرفاً ذخیره می‌کردند، به عامل اصلی تعیین‌کننده در موفقیت یا شکست ابتکارات هوش مصنوعی تبدیل شده‌اند.

او استدلال می‌کند که هوش مصنوعی زاینده مشکل داده‌های سازمانی را ایجاد نکرد، بلکه مشکلاتی را که برای دهه‌ها وجود داشتند، افشا و تسریع کرد. زمانی که داده‌ها به‌طور آرام در یک اشتراک فایل یا آرشیو می‌ماندند، هیچ‌کس مجبور نبود پاسخ دهد که درون آن‌ها چیست. اما لحظه‌ای که شما یک مدل زبانی بزرگ (LLM) یا یک خط لوله RAG را به سمت آن‌ها هدایت می‌کنید، هر نقطه ضعفی نمایان و اثرگذار می‌شود.

تغییر رویکرد از ذخیره‌سازی به مدیریت داده

به نقل از مصاحبه لایسن با unite.ai، هوش مصنوعی صرفاً مکان‌هایی را که مشکلات داده در آن پنهان شده بود، حذف کرد. او چندین نقطه ضعف بحرانی را شناسایی کرده است که اکنون توسط AI افشا می‌شوند:

  • مالکیت تکه‌تکه: داده‌ها در سیستم‌های محلی، ابرهای متعدد و مخازن SaaS انباشته شده‌اند و هیچ‌کس تصویر کلی و یکپارچه از آن‌ها را در اختیار ندارد.
  • داده‌های ROT: داده‌های تکراری، منقضی‌شده و بی‌اهمیت (Redundant, Obsolete, Trivial) نویزی ایجاد می‌کنند که عملکرد مدل را کاهش داده و مسائل انطباق قانونی را به شدت افزایش می‌دهد.
  • شکاف‌های دسترسی: حقوق دسترسی قدیمی و منقضی‌شده اجازه می‌دهد هوش مصنوعی اطلاعات حساس یا تنظیم‌شده‌ای را که باید محدود می‌بودند، به کاربران غیرمجاز لو دهد.
  • فقدان اعتبارسنجی: سازمان‌ها داده دارند، اما اعتبارسنجی نکرده‌اند که آیا این داده‌ها دقیق و به‌روز هستند یا صرفاً نویز محض‌اند.
  • اتکای بیش از حد به زیرساخت: تمرکز بیش از حد روی مدل‌های قدرتمندتر و GPUها؛ در حالی که این سخت‌افزارها تصمیمات را اجرا می‌کنند اما آن‌ها را نمی‌سازند.

برای مقابله با این وضعیت، Datadobi پلتفرم StorageMAP را توسعه داده است؛ ابزاری مستقل از فروشنده که دید و کنترل بر مجموعه‌های پیچیده داده‌های بدون ساختار را فراهم می‌کند. این پلتفرم می‌تواند میلیاردها فایل را اسکن کند تا داده‌های منقضی‌شده، نسخه‌های تکراری و شکاف‌های مالکیت را شناسایی کند. سپس متاداده‌ها و برچسب‌های طبقه‌بندی را اعمال می‌کند که از حاکمیت داده و سیاست‌های خودکار برای آرشیو، حذف و نگهداری پشتیبانی می‌کنند.

تعمیق هوش داده‌ای

StorageMAP به‌گونه‌ای طراحی شده است که سازمان‌ها را از جابه‌جایی ساده داده‌ها بین آرایه‌ها فراتر ببرد. این ابزار یک نمای واحد از ذخیره‌سازهای محلی، ابری و SaaS ارائه می‌دهد و به تیم‌ها اجازه می‌دهد بفهمند چه چیزی واقعاً ارزشمند است و چه چیزی تکراری است.

فراتر از آمادگی برای هوش مصنوعی، این پلتفرم بینش‌های حیاتی درباره هزینه‌های ذخیره‌سازی و اثرات کربنی مجموعه داده‌ها ارائه می‌دهد. این قابلیت به سازمان‌ها اجازه می‌دهد تصمیمات آگاهانه‌ای بگیرند که چه داده‌هایی را نگه دارند و در کجا قرار دهند تا هزینه‌های مالی و اثرات زیست‌محیطی به حداقل برسد.

مکانیسم‌های فنی آمادگی داده‌ها

Datadobi به سازمان‌ها کمک می‌کند تا با اجرای یک گردش‌کار فنی مشخص، کنترل حجم رو به رشد داده‌های بدون ساختار را به دست آورند. نرم‌افزار ابتدا داده‌های منقضی‌شده و شکاف‌های مالکیت را شناسایی کرده و برچسب‌های طبقه‌بندی را اعمال می‌کند. این امر به سازمان‌ها اجازه می‌دهد مجموعه‌داده‌های بالقوه ارزشمند را شناسایی کرده و آن‌ها را برای استفاده‌های پایین‌دستی سازمان‌دهی کنند.

سپس اطلاعات منتخب می‌توانند به دریاچه‌های داده (Data Lakes) یا Lakehouseها منتقل شوند. نکته حیاتی این است که این فرآیند، قابلیت ردیابی و حاکمیت را حفظ می‌کند و تضمین می‌کند که داده‌ها در طول انتقال به محیط آماده برای هوش مصنوعی، زمینه (Context) یا پارامترهای امنیتی خود را از دست ندهند.

تعریف داده‌های «آماده برای هوش مصنوعی»

لایسن تأکید می‌کند که داده‌های «آماده برای هوش مصنوعی» یک چک‌لیست ساده نیستند، بلکه یک نظم و دیسیپلین مستمرند. او داده‌های آماده را داده‌هایی می‌داند که سازمان آن‌ها را اعتبارسنجی کرده است، نه صرفاً داده‌هایی که در اختیار دارد. برای اینکه داده‌ها برای یک خط لوله آموزش یا RAG (تولید بازیابی‌افزا) — شبیه به دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — آماده باشند، سازمان باید با اطمینان به ۵ سؤال پاسخ دهد:

۱. آیا داده‌ها دقیق و به‌روز هستند یا سال‌ها دست‌نخورده مانده‌اند؟
۲. آیا تکراری هستند و به گونه‌ای وجود دارند که نتایج را منحرف کرده یا متناقض کنند؟
۳. آیا حاوی اطلاعات حساس، تنظیم‌شده یا شخصی هستند که نباید افشا شوند؟
۴. چه کسی اجازه دسترسی دارد و آیا این دسترسی هنوز منعکس‌کننده افرادی است که باید دسترسی داشته باشند؟
۵. آیا واقعاً برای این موردِ استفاده ارزش تجاری دارند یا صرفاً نویز هستند؟

بدون پاسخ به این سؤالات، شرکت‌ها صرفاً مشکلات حاکمیتی خود را به سیستم‌هایی منتقل می‌کنند که در نمایش خطاها بسیار کارآمدتر از پوشه‌های سنتی هستند. آمادگی برای هوش مصنوعی یک دیسیپلین هوش داده‌ای است، نه یک پروژه یک‌باره.

امنیت، حاکمیت و ریسک‌های رگولاتوری

امنیت و حاکمیت در اینجا حیاتی هستند زیرا هوش مصنوعی «حفاظت از طریق گمنامی» را از بین می‌برد. پیش از قرار دادن داده‌ها در معرض AI، سازمان‌ها باید چندین عامل ریسک را ارزیابی کنند:

  • بازبینی دسترسی: داشتن تصویری شفاف از اینکه چه کسی دسترسی دارد و آیا این دسترسی هنوز منطقی است.
  • تحلیل محتوا: شناسایی اطلاعات حساس یا تنظیم‌شده در داخل فایل‌ها.
  • مسئولیت‌پذیری: تعیین اینکه چه کسی مالک داده است و مسئولیت آن را بر عهده دارد.
  • تعهدات قانونی: نقشه‌برداری از الزامات اقامت داده‌ها (Data Residency)، نگهداری و حریم خصوصی.

لایسن تأکید می‌کند که این ارزیابی نمی‌تواند یک حسابرسی یک‌باره باشد. از آنجایی که داده‌های سازمانی به‌طور مداوم تغییر می‌کنند، دسترسی‌ها و ریسک‌ها باید به‌طور مستمر بازبینی شوند تا از ظهور آسیب‌پذیری‌های جدید پس از فعال شدن پروژه هوش مصنوعی جلوگیری شود.

ریسک عامل‌های خودمختار هوش مصنوعی

مخاطرات با استقرار عامل‌های (Agents) هوش مصنوعی که قادر به انجام اقدامات خودمختار هستند، به‌شدت افزایش می‌یابد. برخلاف یک چت‌بات که به یک پرامپت پاسخ می‌دهد و محدود به سؤال یک شخص است، یک عامل می‌تواند بخش‌های بسیار بیشتری از محیط سازمان را نسبت به هر کارمند انسانی جست‌وجو کند. این چالش‌ها نشان می‌دهند که چرا حاکمیت بل‌لحظه پیش‌شرط مقیاس‌پذیری عامل‌های هوشمند است، زیرا بدون نظارت لحظه‌ای، ریسک‌های عملیاتی به شدت افزایش می‌یابد.

یک عامل می‌تواند در سیستم‌های مختلف جست‌وجو کرده و اقدامات خودمختاری مانند جابه‌جایی، به اشتراک‌گذاری یا استفاده از داده‌ها را بدون بازبینی هر مرحله توسط انسان انجام دهد. اگر یک عامل به فایل‌های با دسترسی اشتباه، سوابق حساس منقضی‌شده یا اطلاعاتی که باید سال‌ها پیش حذف می‌شدند دسترسی داشته باشد، می‌تواند با سرعت ماشین و در مقیاس وسیع بر اساس آن داده‌ها عمل کند. این وضعیت، یک ریسک اکتشافی را به یک ریسک عملیاتی تبدیل می‌کند، جایی که عامل به‌طور وفادارانه هر شکافی را در هوش داده‌ای سازمان استثمار می‌کند.

گام‌های عملی برای کنترل داده‌ها

برای رهبرانی که با دهه‌ها داده انباشته‌شده روبرو هستند، لایسن توزیع زیر را پیشنهاد می‌کند تا از اشتباهِ رفتن مستقیم به مرحله اجرا اجتناب کنند:

  • ایجاد دید: ساخت یک تصویر واحد، دقیق و در سطح سازمان از تمام داده‌های موجود در محیط‌های محلی، ابری و SaaS. شما نمی‌توانید درباره داده‌هایی که نمی‌بینید تصمیم بگیرید.
  • طبقه‌بندی و درک: استفاده از هوش داده‌ای برای جداسازی دارایی‌های ارزشمند از داده‌های ROT. این شامل درک معنای داده‌ها و شناسایی مسئول آن‌هاست.
  • اجرای تصمیمات: مهاجرت، آرشیو یا حذف مستمر داده‌ها از طریق گردش‌کارهای سیاست‌محور که به‌جای یک پروژه یک‌باره، به‌صورت مداوم عمل می‌کنند.

او هشدار می‌دهد که پاک‌سازی یک‌باره مانند این است که یک بار قفل‌های ساختمان را عوض کنید و هرگز دوباره درها را چک نکنید. مدیریت داده باید به یک قابلیت عملیاتی تکرارشونده تبدیل شود زیرا فایل‌های جدید ایجاد می‌شوند، دسترسی‌ها تغییر می‌کنند، کارمندان می‌آیند و می‌روند و قوانین تکامل می‌یابند.

واقعیت‌های بودجه‌ای و سازمانی

از منظر بودجه‌ای، لایسن اشاره می‌کند که اکثر مدیران فناوری اطلاعات (CIOs) بودجه‌های نامحدود برای هوش مصنوعی دریافت نمی‌کنند. آن‌ها با منابع مالی محدودی کار می‌کنند که در آن AI با سایر عملکردهای ضروری کسب‌وکار رقابت می‌کند.

او هشدار می‌دهد که کاهش سرمایه‌گذاری در زیرساخت‌های موجود برای تأمین بودجه AI یک اشتباه است، زیرا همان زیرساخت‌ها — ذخیره‌سازی، خط لوله‌های داده و حاکمیت — دقیقاً همان چیزهایی هستند که AI برای موفقیت به آن‌ها وابسته است. در عوض، او پیشنهاد می‌کند از بهینه‌سازی داده‌ها برای کاهش اتلاف فضای ذخیره‌سازی استفاده کنند، که این امر فضای مالی لازم را در زیرساخت موجود برای حمایت از ابتکارات AI بدون قربانی کردن ظرفیت ایجاد می‌کند.

این گذار، پویایی قدرت در شرکت‌ها را تغییر می‌دهد. مدیریت داده دیگر یک وظیفه پشتیبانی در IT نیست، بلکه یک نظم عملیاتی مشترک است که در آن مدیران IT، رهبران امنیت و واحدهای تجاری بر اساس یک هوش مشترک درباره ارزش واقعی داده‌ها برای کسب‌وکار تصمیم می‌گیرند. گفتگو از «ظرفیت، لایه‌بندی و آپ‌تایم» به «نتایج: کاهش هزینه، کاهش ریسک، انطباق قانونی و توانمندسازی هوش مصنوعی» تغییر می‌کند.

تحلیل: گلوگاه جدید داده‌ها

این تغییر نشان می‌دهد که گلوگاه اصلی برای هوش مصنوعی سازمانی از محاسبات (GPUها) به «کیوریتوریشن» یا پالایش داده‌ها منتقل شده است. صنعت در حال درک این مطلب است که یک مجموعه‌داده کوچک و پالایش‌شده، بی‌نهایت ارزشمندتر از یک مجموعه عظیم و نویزی است. برای یک رهبر کسب‌وکار، این بدان معناست که «استراتژی هوش مصنوعی» در واقع یک «استراتژی بهداشت داده‌ها» در لباس مبدل است.

کسانی که آمادگی برای AI را یک پروژه یک‌باره می‌بینند، احتمالاً با نقض‌های امنیتی مکرر یا توهمات مدل (Hallucinations) روبرو خواهند شد. مزیت رقابتی به سازمان‌هایی منتقل می‌شود که یک حلقه مستمر از اکتشاف، طبقه‌بندی و اجرا را پیاده کنند و با داده‌های بدون ساختار خود به جای یک بارِ ذخیره‌سازی، به عنوان یک دارایی مدیریت‌شده برخورد کنند.

برای شروع حسابرسی مجموعه داده‌های خود، می‌توانید با نقشه‌برداری از حیاتی‌ترین جریان‌های داده‌ای و شناسایی نقاط تجمع «داده‌های تاریک» (Dark Data) — اطلاعاتی که جمع‌آوری شده اما استفاده نمی‌شوند — آغاز کنید تا بفهمید کجا ممکن است خروجی‌های AI شما مسموم شوند.

گام بعدی شما

  • نقشه‌برداری از جریان‌های داده‌ای بحرانی سازمان خود را آغاز کنید تا نقاط تجمع «داده‌های تاریک» را بیابید.
  • دسترسی‌های قدیمی به پوشه‌های مشترک را بازبینی کنید تا از نشت اطلاعات توسط عامل‌های AI جلوگیری شود.
  • استراتژی ذخیره‌سازی خود را از «حجم‌محور» به «ارزش‌محور» تغییر دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و مدیریت حافظه در مقیاس وسیع مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد بر اساس تجربه عملی در مدیریت داده‌های مقیاس‌بزرگ نشان می‌دهد که بدون حاکمیت داده، مدل‌های AI تبدیل به ابزاری برای افشای سریع‌تر اسرار سازمانی می‌شوند. اعتبار این ادعا در تغییر پارادایم از زیرساخت‌محوری به داده‌محوری است که اکنون برای هر سازمان در حال استقرار AI حیاتی است.

تأثیر برای ایران

برای شرکت‌های ایرانی که در حال استقرار مدل‌های محلی یا استفاده از RAG هستند، این هشدار در مورد پاک‌سازی داده‌های قدیمی پیش از اتصال به مدل، برای جلوگیری از توهمات و نشت اطلاعات داخلی بسیار حیاتی است.

·نگاه ما
تحریریه دات‌هوش

گلوگاه اصلی هوش مصنوعی سازمانی در حال جابه‌جایی از قدرت محاسباتی (GPU) به سمت «تصفیه و سازمان‌دهی» (Curation) است. سازمان‌هایی که آمادگی AI را یک پروژه یک‌باره می‌بینند و نه یک نظم عملیاتی، به‌زودی با توهمات مدل یا نشت‌های امنیتی فاجعه‌بار روبرو خواهند شد. برنده واقعی این رقابت، کسانی هستند که داده‌های بدون ساختار را نه به عنوان بار ذخیره‌سازی، بلکه به عنوان یک دارایی مدیریت‌شده می‌بینند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.