پرش به محتوای اصلی
پرش به محتوای مقاله

زیرساخت هوش مصنوعی به یک مسئلهٔ لجستیکی در مقیاس گیگاوات تبدیل شد

·۲۷ شهریور ۱۴۰۵۱۱ دقیقه مطالعه۱ بازدید
کریس بیورز، مدیرعامل و هم‌بنیان‌گذار نت‌باکس لبز، در مصاحبه‌ای اختصاصی
کریس بیورز، مدیرعامل و هم‌بنیان‌گذار نت‌باکس لبز، در مصاحبه‌ای اختصاصی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر تعریف گلوگاه هوش مصنوعی از کمبود GPU به بحران لجستیکی برق و زمین؛ تبدیل زیرساخت AI به یک مسئله‌ی مهندسی تأسیسات در مقیاس صنعتی.

تصور کنید می‌خواهید شهری را از صفر بسازید، اما متوجه می‌شوید که تمام برق منطقه تنها کفاف چند محله را می‌دهد. این دقیقاً همان وضعیتی است که امروز صنعت زیرساخت هوش مصنوعی با آن دست‌وپنجه نرم می‌کند.

کریس بیورز (Kris Beevers)، مدیرعامل و هم‌بنیان‌گذار NetBox Labs، معتقد است ما وارد عصر «مقیاس گیگاوات» شده‌ایم؛ مرحله‌ای که در آن دیگر نرم‌افزار تعیین‌کننده نیست، بلکه محدودیت‌های فیزیکی زمین، برق و فیبر نوری هستند که سرعت پیشرفت را دیکته می‌کنند. به گفته او، ساخت زیرساخت هوش مصنوعی در این مقیاس، از یک چالش نرم‌افزاری به یک مسئله عظیم «ارضای محدودیت» (Constraint-Satisfaction Problem) تبدیل شده است که در آن دسترسی به زمین، توان الکتریکی و کابل‌های فیبر نوری، متغیرهای اصلی هستند.

بیورز یک کارآفرین فناوری و متخصص باسابقه در نرم‌افزارهای زیرساختی است که بیش از دو دهه تجربه در ساخت شرکت‌ها و پلتفرم‌های متمرکز بر شبکه، زیرساخت‌های ابری و اتوماسیون دارد. او پیش از NetBox Labs، در سال ۲۰۱۳ شرکت NS1 را تأسیس کرد و برای نزدیک به یک دهه به عنوان مدیرعامل آن فعالیت نمود. بیورز توانست NS1 را به یکی از ارائه‌دهندگان برجسته اتوماسیون شبکه و مدیریت ترافیک اپلیکیشن تبدیل کند تا اینکه در سال ۲۰۲۳ توسط شرکت IBM خریداری شد. در جریان این معامله، NetBox Labs به عنوان یک شرکت مستقل از دل NS1 بیرون آمد و IBM به عنوان یکی از سرمایه‌گذاران آن باقی ماند. سوابق شغلی او پیش از آن شامل نقش‌های ارشد مهندسی و معماری در Voxel و Internap Network Services و همچنین هم‌بنیان‌گذاری SolidJoint Research است.

تکامل از NS1 به NetBox Labs

انتقال بیورز به NetBox Labs حاصل یک درس کلیدی از دوران حضورش در NS1 بود: مشکلات زیرساختی به‌ندرت در یک محیط بسته و مجزا باقی می‌مانند. در حالی که تمرکز NS1 بر روی DNS بود، بیورز مشاهده کرد که مشتریان در محیط‌های پیچیده‌ای فعالیت می‌کنند که در آن شبکه‌ها، مراکز داده، اپلیکیشن‌ها و سیستم‌های اتوماسیون به‌شدت به یکدیگر وابسته‌اند. او دریافت که درک جامع از خودِ زیرساخت، مشکلی بسیار بزرگ‌تر و بنیادی‌تر از مدیریت تنها یک بخش از این پشته (Stack) است.

این درک او را به سمت NetBox کشاند. او فرصتی دید تا بر پایه یک پروژه متن‌باز موجود و گسترده، و جامعه‌ای از مهندسان که پیش از این از آن برای مدل‌سازی دارایی‌ها، اتصالات و وضعیت‌های مطلوب (Intended States) خود استفاده می‌کردند، سیستمی جامع بسازد. در عصر هوش مصنوعی، مشکل اصلی همچنان همان است، اما سرعت و مقیاس آن شتاب گرفته است. تیم‌های زیرساختی اکنون باید محیط‌های عظیمی را با سرعتی باورنکردنی بسازند، در حالی که تکنولوژی زیربنایی با همان سرعت در حال تکامل است.

با به‌کارگیری هوش مصنوعی در زیرساخت‌ها، تیم‌های IT متوجه شده‌اند که برای اجرای اتوماسیون، باید داده‌های دقیق و لحظه‌ای (Real-time) از زیرساخت خود داشته باشند. آن‌ها باید بدانند «وضعیت مطلوب» دقیقاً چگونه است تا هوش مصنوعی بتواند به آن‌ها کمک کند تا لحظه‌ای که زیرساخت عملیاتی از برنامه اولیه منحفت می‌شود (Drift)، آن را شناسایی کنند. برای بیورز، درس NS1 همچنان صادق است: پیش از آنکه بتوانید زیرساخت را به‌خوبی خودکار کنید، باید آن را به‌درستی درک کنید. هوش مصنوعی صرفاً فوریت رسیدن به این درک را افزایش داده است.

برای یک دهه، رایانش ابری به مهندسان آموخت که با سخت‌افزار مثل یک انتزاع (Abstraction) بی‌نهایت برخورد کنند. شما درخواست توان پردازشی می‌دادید و آن توان بدون نیاز به فکر کردن به مکان سرور یا سیستم خنک‌کننده ظاهر می‌شد. اما هوش مصنوعی این توهم را شکست. به نقل از مصاحبه بیورز با unite.ai، لایه‌ی فیزیکی — شامل رک‌ها، کابل‌کشی و تراکم برق — اکنون گلوگاه اصلی نسل بعدی مراکز داده است. این تغییر رویکرد با استراتژی‌هایی هم‌سو است که در آن پردازش هوش مصنوعی برای بهره‌وری بیشتر از ابر به محیط‌های محلی و سخت‌افزارهای تخصصی منتقل می‌شود.

بازگشت به لایه‌ی فیزیکی

زیرساخت هوش مصنوعی نیازمند یک رویکرد بنیادین در برنامه‌ریزی فیزیکی است. بیورز اشاره می‌کند که شما نمی‌توانید بدون درک تراکم برق و خنک‌سازی، درباره استقرار رک‌ها تصمیم بگیرید. این محدودیت‌های فیزیکی مستقیماً بر لایه‌ی منطقی، از جمله آدرس‌های IP و پیکربندی‌های نرم‌افزاری اثر می‌گذارند.

هنگام ساخت این محیط‌ها، فرآیند با پرسش‌های فیزیکی بنیادین شروع می‌شود:

  • چه مقدار زمین در دسترس است؟
  • چه مقدار برق می‌توان تأمین کرد؟
  • چه نوع سیستم خنک‌کننده‌ای پشتیبانی می‌شود؟

تنها پس از پاسخ به این‌هاست که تیم‌ها می‌توانند به سراغ رک‌ها، سرورهای GPU (واحد پردازش گرافیکی) — که مثل موتورهای قدرتمند یک ماشین، محاسبات سنگین را انجام می‌دهند — سوئیچ‌ها و کابل‌های فیبر نوری بروند. این عناصر به هم وابسته‌اند؛ برای مثال، نمی‌توان GPUها را مستقل از شبکه‌ای که آن‌ها را به هم وصل می‌کند برنامه‌ریزی کرد. این وضعیت باعث شده رشته‌هایی که سال‌ها سعی کردند از لایه‌ی فیزیکی فاصله بگیرند، دوباره با آن درگیر شوند. انتزاع از بین نرفته است، اما محدودیت‌های فیزیکی زیر آن ناگهان اهمیت بسیار بیشتری پیدا کرده‌اند.

این تغییر مسیر، مهندسان DevOps و SRE (مهندسان قابلیت اطمینان سایت) را مجبور می‌کند دوباره با سخت‌افزار درگیر شوند. در برخی موارد، فوریت چنان زیاد است که شرکت‌ها توربین‌های برق را خریداری کرده و در پارکینگ‌های خود نصب می‌کنند، زیرا شبکه برق شهری نمی‌تواند با سرعت تقاضای آن‌ها پیش بیاید.

لجستیک در مقیاس گیگاوات

عملیات در این مقیاس، چالش‌های هماهنگی نجومی ایجاد می‌کند. راه‌اندازی یک مرکز داده ۳۰۰ مگاواتی نیازمند همگام‌سازی دقیق خرید زمین، تحویل برق و نصب سخت‌افزار از چندین تأمین‌کننده مختلف است. این تأمین‌کنندگان اغلب روش‌های کاملاً متفاوتی برای معرفی و نمایش محصولاتشان دارند که این امر بر پیچیدگی کل پروژه می‌افزاید.

مکانیسم‌های استقرار

فرآیند استقرار شامل یک خط لوله (Pipeline) سخت‌گیرانه است که در آن تجهیزات باید مراحل زیر را طی کنند:

  • دریافت و نصب در رک (Racked).
  • کابل‌کشی و پیکربندی.
  • تست و اعتبارسنجی.
  • تحویل برای آموزش (Training) یا استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی، نه دوره‌ی آموزش آشپز.

اما مشکل اینجاست که زمین زیر پای مهندسان در حال حرکت است. معماری GPUها، استانداردهای شبکه و الزامات خنک‌سازی به‌سرعت تغییر می‌کنند. قطعاتی که شش ماه دیگر در دسترس باشند، ممکن است با طراحی امروز مرکز داده همخوانی نداشته باشند. این یعنی طراحی اغلب یک «هدف متحرک» است.

در این مقیاس، کوچک‌ترین ناکارآمدی‌ها به ضررهای کلان تبدیل می‌شوند. بیورز به یک تولیدکننده جهانی کابل فیبر نوری اشاره می‌کند که با نرخ بازگشت بالای کابل‌ها دست‌وپنجه نرم می‌کند، چون مشتریان طول کابل را اشتباه سفارش می‌دهند. وقتی صحبت از سفارش صدها هزار کابل باشد، این خطاهای ساده به بحران‌های تجاری قابل توجهی تبدیل می‌شوند. در این سطح، عملیات زیرساختی به یک مسئله لجستیکی عظیم تبدیل می‌شود که در آن موفق‌ترین شرکت‌ها کسانی هستند که می‌توانند داده‌های دقیق طراحی را تا مراحل خرید و استقرار حفظ کنند.

شکاف استعداد در زیرساخت هوش مصنوعی

در حال حاضر هیچ دستورالعمل (Playbook) تثبیت‌شده یا زنجیره استعداد برای این مقیاس از عملیات وجود ندارد. بیورز تخمین می‌زند که تنها چند صد نفر در سطح جهان واقعاً می‌دانند چگونه این محیط‌ها را با سرعت مورد نیاز بسازند و اکثر آن‌ها نیز در حال حاضر درگیر پروژه‌های فعال هستند.

  • مهارت‌های ترکیبی: صنعت به مهندسانی نیاز دارد که بتوانند فاصله بین شبکه، محاسبات و طراحی تأسیسات را پر کنند. مدیریت توان، خنک‌سازی و زنجیره تأمین اکنون بخشی از همان گفتمانی هستند که نرم‌افزار در آن جای دارد.
  • دانش فرامرزی: تخصص در عملیات میدانی (Field Operations) اکنون به اندازه اتوماسیون نرم‌افزاری ارزشمند است. ارزشمندترین متخصصان کسانی خواهند بود که درک کنند یک تصمیم در یک حوزه (مثل برق) چگونه بر بقیه زیرساخت اثر می‌گذارد.
  • یادگیری آنی: چون تکنولوژی هر شش ماه تغییر می‌کند، درس‌های امروز ممکن است هنگام تکمیل یک مرکز داده منسوخ شده باشند. هیچ بدنه دانش بالغی برای مطالعه وجود ندارد؛ مدل استعدادها هم‌زمان با ساخت زیرساخت در حال شکل‌گیری است.

عامل‌های هوش مصنوعی و نیاز به زمینه (Context)

با تبدیل عامل‌های هوش مصنوعی (AI Agents) — برنامه‌هایی که می‌توانند به‌طور مستقل تصمیم بگیرند و ابزارها را اجرا کنند — از حالت «توصیه‌گر» به «اجراکننده»، ریسک شکست افزایش می‌یابد. یک تغییر اشتباه در شبکه فیزیکی را نمی‌توان مثل یک خط کد به‌سادگی «برگرداند» (Revert)؛ این کار می‌تواند کل عملیات را متوقف کند. این موضوع باعث می‌شود که هم «زمینه» (Context) و هم «کنترل» ضروری باشند. این چالش‌ها نشان می‌دهد که چرا بسیاری از عامل‌های هوش مصنوعی در مقیاس سازمانی و محیط‌های واقعی با شکست مواجه می‌شوند.

NetBox Labs مدیریت تجاری NetBox را بر عهده دارد؛ یک سامانه ثبت (System of Record) متن‌باز که توسط بیش از ۱۰,۰۰۰ سازمان استفاده می‌شود. این پلتفرم یک گراف زیرساختی و «منبع حقیقت» (Source of Truth) را با هوش عملیاتی و ارکستراسیون به کمک هوش مصنوعی ترکیب می‌کند. این سیستم با ابزارهایی مثل Terraform، Ansible، Nornir و خط لوله‌های CI/CD ادغام می‌شود و از استقرارهای ترکیبی (Hybrid)، خود-مدیریتی و محیط‌های ایزوله (Air-gapped) پشتیبانی می‌کند.

بیورز استدلال می‌کند که برای اینکه یک عامل هوش مصنوعی بتواند به‌طور ایمن یک مشکل اتصال را عیب‌یابی کند، به چیزی بیش از یک عکس لحظه‌ای از وضعیت فعلی نیاز دارد. او به یک مدل معتبر از محیط، شامل مسیر کابل‌ها و وابستگی‌ها نیاز دارد. یک عامل باید بتواند مسیر کابل را ردیابی کند و تعیین کند که چه چیزهای دیگری ممکن است تحت تأثیر قرار گیرند، پیش از آنکه راهکاری را پیشنهاد دهد. این امر نیازمند ترکیبی از داده‌ها و حاکمیت (Governance) سخت‌گیرانه است تا مشخص شود عامل چه کارهایی را به‌طور خودکار انجام دهد و کجا باید از انسان اجازه بگیرد.

هوش مصنوعی احتمالاً کارهای تکراری را در جایی که ورودی‌ها و مرزها روشن هستند به دست می‌گیرد، مانند:

  • تولید پیکربندی‌ها (Configurations).
  • عیب‌یابی مشکلات رایج.
  • بررسی اینکه آیا زیرساخت با طراحی اولیه مطابقت دارد یا خیر.
  • رفع مشکلات در زمانی که اعتماد به پاسخ سیستم بالا است.

اما تخصص انسانی برای شکست‌های «عجیب»، مثل قطع شدن یک کابل فیبر نوری یا رفتار غیرمنتظره دستگاهی که با طراحی تضاد دارد، حیاتی باقی می‌ماند. مهندسان زمان کمتری را صرف عیب‌یابی تکراری می‌کنند و بیشتر روی تعریف «قصد» (Intent) و تعیین مرزهای اتوماسیون تمرکز می‌کنند. این تغییر باعث می‌شود تخصص عمیق ارزشمندتر شود، زیرا مهندسی که می‌داند سیستم چرا کار می‌کند، زمانی که اتوماسیون پاسخی واضح ندارد، ضروری است. در واقع، جایگزینی ابزارهای تک‌بعدی با جریان‌های کاری هوشمند کلید حل این مسائل عملیاتی پیچیده است.

رویکرد مدیرعامل به استراتژی هوش مصنوعی

بیورز توصیه می‌کند رهبران شرکت‌ها به‌جای واگذاری استراتژی هوش مصنوعی به دیگران، شخصاً در آن دست ببرند. او خودش با ابزارهایی مثل Claude Code نمونه‌های اولیه می‌سازد تا محصولات کاملی خلق کند. این تجربه به او آموخته است که تفاوت زیادی بین یک دموی خیره‌کننده و سیستمی که بتوان برای کارهای واقعی و مفید به آن اعتماد کرد، وجود دارد.

او با ساخت مستقیم متوجه شده است چیزهایی که شش ماه پیش اتوماسیون آن‌ها دشوار به نظر می‌رسید، اکنون ساده شده‌اند، در حالی که شکاف‌ها در زمینه (Context) و قضاوت همچنان باقی است. این موضوع دیدگاه او را شکل داده است که اگرچه کارهای عملیاتی را می‌توان به‌شدت خودکار کرد، اما «خودمختاری کامل» (Pure Autonomy) هنوز یک هدف دوردست است. معیار اصلی برای پذیرش هوش مصنوعی باید این باشد که آیا کمک می‌کند زیرساخت‌ها سریع‌تر، قابل‌اعتمادتر یا مؤثرتر اداره شوند یا خیر.

آینده‌ی محاسبات آگاه از انرژی

مهندسی زیرساخت در حال تبدیل شدن به هماهنگی حجم کاری (Workloads) با ظرفیت انرژی است. این امر منجر به «پاسخ به تقاضا» (Demand-side Response) می‌شود؛ جایی که اپراتورها بارهای کاری هوش مصنوعی را بر اساس نوسانات شبکه برق جابه‌جا می‌کنند.

همه وظایف هوش مصنوعی یکسان نیستند. استنتاج‌های حساس به تأخیر (Latency-sensitive) باید آنلاین بمانند، اما آموزش مدل‌ها یا کارهای دسته‌ای (Batch) را می‌توان هنگام محدودیت برق متوقف کرد. این یعنی محاسبات، برق و ظرفیت فیزیکی به یک مسئله عملیاتی واحد تبدیل شده‌اند. عبارت «توربین‌ها در پارکینگ» نشان‌دهنده اقدامات افراطی تیم‌ها برای دور زدن محدودیت‌های شبکه برق است، زمانی که شبکه شهری نمی‌تواند با سرعت استقرار پیش بیاید.

گلوگاه متحرک

بیورز این ایده را که یک گلوگاه دائمی برای مقیاس‌بندی هوش مصنوعی وجود دارد، رد می‌کند. ساخت این زیرساخت یک مسئله «ارضای محدودیت» است که در آن گلوگاه اصلی مدام جابه‌جا می‌شود.

در حالی که صنعت برای مدتی روی GPUها تمرکز کرده بود، اکنون محدودیت‌ها به این موارد منتقل شده است:

  • در دسترس بودن برق و ظرفیت شبکه.
  • تأمین تجهیزات شبکه و فیبر نوری.
  • زمین و ساخت‌وساز.
  • سیستم‌های خنک‌کننده.
  • مهندسان ماهری که بتوانند این سیستم‌ها را یکپارچه کنند.

به محض اینکه یک محدودیت حل شود، محدودیت دیگری نمایان می‌شود. شرکت‌های برنده کسانی خواهند بود که بتوانند با جابه‌جایی این گلوگاه‌ها سازگار شوند. در این واقعیت عملیاتی، تخصص مهندسی ارزشمندتر می‌شود، نه کمتر؛ چون تنها مهندسی که می‌داند زیرساخت چرا کار می‌کند، تنها کسی است که می‌تواند زمانی که اتوماسیون پاسخی واضح ندارد، مداخله کند.

گام بعدی شما

  • اگر مدیر زیرساخت هستید، مدل‌سازی دارایی‌های فیزیکی را از اتوماسیون نرم‌افزاری مقدم بدانید؛ بدون داده‌های دقیق فیزیکی، اتوماسیون شما روی شن بنا شده است.
  • برای تیم‌های مهندسی، یادگیری مفاهیم مدیریت توان (Power Management) و خنک‌سازی را به اندازه یادگیری زبان‌های برنامه‌نویسی جدید در اولویت قرار دهید.
  • در استقرار عامل‌های هوش مصنوعی، ابتدا «حفاظ‌ها» (Guardrails) و مدل‌های وابستگی فیزیکی را تعریف کنید و سپس اجازه دسترسی به تغییرات شبکه را بدهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر پارادایم نشان می‌دهد که رشد هوش مصنوعی دیگر به تعداد پارامترها، بلکه به دسترسی به گیگاوات‌ها برق وابسته است. تخصص در لایه‌ی فیزیکی اکنون به یک مزیت رقابتی استراتژیک برای شرکت‌های فناوری تبدیل شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های شدید در تأمین سخت‌افزارهای به‌روز و زیرساخت‌های برق صنعتی، ایران در حال حاضر بیشتر در لایه‌ی مصرف‌کننده و بهینه‌سازی نرم‌افزاری جای دارد تا ساخت مراکز داده در این مقیاس.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «بهینه‌سازی مدل» به «بهینه‌سازی محیط» تغییر کرده است. این نشان می‌دهد که هوش مصنوعی دیگر یک محصول نرم‌افزاری نیست، بلکه یک صنعت سنگین است که با قوانین ترمودینامیک و لجستیک شهری گره خورده است. در این فضای جدید، مهندسی سخت‌افزار از نقش پشتیبان به نقش تعیین‌کننده در استراتژی کسب‌وکار تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.