پرش به محتوای اصلی
پرش به محتوای مقاله

آیا بهینه‌سازی زیرساخت جایگزینی برای گسترش مراکز داده لینکدین است؟

·۸ مرداد ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
تصویری از یک مرکز داده با سرورهای ردیف‌شده و چراغ‌های نشانگر فعالیت
تصویری از یک مرکز داده با سرورهای ردیف‌شده و چراغ‌های نشانگر فعالیت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

توقف کامل گسترش مراکز داده در یک شرکت تراز اول در اوج تب خرید GPU؛ عبور از استراتژی «خرید برای مقیاس» به «بهینه‌سازی برای مقیاس».

اگر مدیر محصول یا مهندسی هستید که بودجه‌های کلان برای خرید تراشه‌های جدید درخواست می‌کنید، استراتژی جدید لینکدین دیدگاه شما را تغییر می‌دهد. این شبکه اجتماعی تصمیم گرفته در سال مالی جاری که ماه گذشته آغاز شد و تا ژوئن ۲۰۲۶ ادامه دارد، هیچ بودجه‌ای برای گسترش تهاجمی مراکز داده اختصاص ندهد.

در حالی که غول‌هایی مثل متا و گوگل میلیاردها دلار هزینه می‌کنند، لینکدین (LinkedIn) مسیر متفاوتی را برگزیده است. این شرکت در حالی چنین تصمیمی گرفته است که اکثر آزمایشگاه‌های هوش مصنوعی، از جمله OpenAI، در حال حاضر برای تأمین بودجه دست و پا می‌زنند و شراکت‌های غیرمعمولی را شکل می‌دهند تا صرفاً بتوانند جدیدترین تراشه‌ها را برای ساخت، تجهیز و اداره مراکز داده عظیم به دست آورند. در دنیایی که تصور می‌شود تنها راه پیروزی، خرید تمام GPUهای موجود در بازار است، لینکدین روی این شرط‌بندی پیش رفته که مهندسی هوشمندانه بر چک‌های سفید اثرگذارتر است.

طبق گزارش Wired، مدیران این شرکت مدعی‌اند که می‌توانند ویژگی‌های «پرتراکم از نظر محاسباتی» (compute-hungry) را عرضه کنند، در حالی که اثر آن‌ها بر مجموع محاسبات و فضای ذخیره‌سازی ثابت بماند. این استراتژی بر پایه جهشی عظیم در بهره‌وری است که طی ۶ ماه گذشته رخ داده و باعث شده شرکت راه‌هایی برای استفاده از GPUهای موجود با کارایی دو برابر پیدا کند.

لینکدین با بیش از ۱.۳ میلیارد کاربر، احتمالاً بزرگ‌ترین کسب‌وکاری است که با به چالش کشیدن «تب توسعه» و نادیده گرفتن موج ساخت مراکز داده جدید، نگرانی‌های مربوط به هزینه‌های سرسامی هوش مصنوعی را مدیریت کرده است. در حالی که کمبود نیروی کار و قطعات، بسیاری از پروژه‌های صنعتی را متوقف کرده و برخی کسب‌وکارها را مجبور کرده تا دسترسی مشتریان به ابزارهای AI را محدود کنند، لینکدین مسیری متفاوت را طی می‌کند.

این استراتژی به عنوان یک سیگنال برای کل صنعت فناوری دیده می‌شود. سونگی یون، عضو هیئت مدیره سازنده سرور HP و شریک مدیریت در Principal Venture Partners، معتقد است این حرکت نشان‌دهنده انتقال هوش مصنوعی از فاز «آزمایش و خطا» به «انضباط تولید» (production discipline) است. او خاطرنشان می‌کند که برنده‌های نهایی لزوماً شرکت‌هایی نخواهند بود که بیشترین هزینه را برای زیرساخت می‌کنند.

نقشه راه بهینه‌سازی لینکدین از سال‌ها پیش آغاز شد و بر کل خط‌لوله‌ی AI، از آموزش اولیه مدل‌ها تا پاسخ نهایی ارسالی به کاربر، تمرکز دارد. مسیر فعلی شرکت با یک تصمیم کلیدی در سال‌ها پیش شکل گرفت. پس از خرید توسط مایکروسافت در سال ۲۰۱۶، لینکدین تلاش کرد تا به سرویس ابری Azure منتقل شود. با این حال، زمانی که هر دو پلتفرم Azure و لینکدین رشد انفجاری را تجربه می‌کردند، گنجاندن این شبکه اجتماعی در مراکز داده با کاربرد عمومی از نظر اقتصادی توجیه نداشت.

به همین دلیل، لینکدین در سال ۲۰۲۲ به‌طور کامل روی مراکز داده اختصاصی خود در اورگان، تگزاس و ویرجینیا سرمایه‌گذاری کرد. این مالکیت به شرکت اجازه داد تا کنترل قابل‌توجهی بر هر جزئی از فناوری خود داشته باشد؛ کنترلی که هنگام توسعه دستیارهای مبتنی بر AI برای جذب کاندیداها، یافتن شغل و نوشتن پیام‌ها، حیاتی proved شد. این رویکرد در مدیریت زیرساخت، شباهت زیادی به استراتژی‌های کاهش تأخیر در پاسخ‌دهی لحظه‌ای عامل‌های هوش مصنوعی دارد که بر بهینه‌سازی لایه‌های سخت‌افزاری برای افزایش سرعت پاسخ‌دهی تمرکز می‌کنند.

برای رسیدن به وضعیت فعلیِ توقف هزینه‌ها، تیم فنی تغییرات تخصصی زیر را اجرا کرد:

  • بهره‌وری GPU: تیم زیرساخت ابزارهای اندازه‌گیری دقیقی ساخت تا رصد کند هر یک از تیم‌ها دقیقاً چه مقدار از توان محاسباتی و فضای ذخیره‌سازی را مصرف می‌کنند. با بهبود کارایی تخصیص منابع به گونه‌ای که کامپیوترها کمتر در حالت بیکار بمانند، آن‌ها بهره‌وری GPU در بخش آموزش را به بالای ۹۵٪ رساندند؛ سطحی که راگو هیرماگالور آن را بهترین رکورد مشاهده‌شده می‌نامد.
  • تقطیر مدل (Distillation): — شبیه وقتی که یک استاد Experienced خلاصه‌ای بسیار کاربردی از یک کتاب هزار صفحه‌ای را برای شاگردش می‌نویسد تا سریع‌تر یاد بگیرد — مهندسان از تکنیک تقطیر برای آموزش مدل‌های کوچک‌تر و ارزان‌تر بر اساس مدل‌های بزرگ‌تر استفاده کردند. برای مثال، در سیستم توصیه‌ی شغلی، یک مدل کوچک از دو مدل بزرگ‌تر یاد گرفت تا فرصت‌های شغلی مرتبط را شناسایی و کلیک کاربران را پیش‌بینی کند، بدون اینکه کیفیت کاهش یابد. اران برگر اشاره می‌کند که این کار باعث شده کاربران مشاغلی را پیدا کنند که پیش از این نمی‌دیدند، زیرا مدل اکنون خواسته‌های آن‌ها را بهتر درک می‌کند.
  • توازن بار کاری: شرکت روند آموزش مدل را بهینه کرد، اطلاعات حاصل از توصیه‌های قبلی را مجدداً به کار گرفت و تعادل بهتری بین CPUها و GPUها برقرار کرد. آن‌ها به‌طور خاص مدل گران‌قیمتی را که برای انتخاب پست‌های فید خبری استفاده می‌شد، هدف قرار دادند تا به روشی «به‌صرفه» اجرا شود.
  • بازنویسی نرم‌افزاری: توسعه‌دهندگان نرم‌افزارهای پایه روی پردازنده‌های Nvidia را بازنویسی کردند تا بتوانند تسک‌هایی بزرگ‌تر از آنچه برای آن طراحی شده بودند را مدیریت کنند. همچنین نرم‌افزارهای دیگر را تغییر دادند تا برخی وظایف را به جای GPUهای انویدیا (که گران‌تر هستند، تهیه آن‌ها دشوارتر است و برق بیشتری مصرف می‌کنند)، روی CPUها اجرا کنند.

این بهینه‌سازی‌ها از روی ضرورت متولد شدند. راگو هیرماگالور، مدیر ارشد زیرساخت لینکدین، اشاره کرد که هزینه هر کوئری ارسالی به سایت به مرور زمان افزایش یافته بود و حجم داده‌های ذخیره شده سالانه دو برابر می‌شد؛ مسیری که به باور او «پایدار نبود».

از نظر مالی، لینکدین تخمین می‌زند که این بهینه‌سازی‌ها طی ۱۲ ماه گذشته حدود ۲۴ میلیون دلار صرفه‌جویی ایجاد کرده است. در مقیاس سخت‌افزاری، این مبلغ معادل هزینه اجرای حدود ۱۱۰۰ عدد GPU به‌صورت شبانه‌روزی برای یک سال کامل است.

اگرچه ۲۴ میلیون دلار در برابر فروش ۱۸ میلیارد دلاری سالانه شرکت رقم کوچکی است، اما رهبری لینکدین آن را یک پیروزی در «چابکی» می‌بیند. اران برگر، مدیر ارشد مهندسی، استدلال می‌کند که این «هنر مهندسی» به توسعه‌دهندگان اجازه می‌دهد قابلیت‌های جدید هوش مصنوعی زاینده (Generative AI) را سریع‌تر ادغام کرده و پروژه‌های جدید را بدون انتظار برای رسیدن سخت‌افزارهای جدید آغاز کنند. او معتقد است این بهره‌وری در طول زمان اثرات تراکمی خواهد داشت و وقتی بودجه‌های گسترش مراکز داده دوباره افزایش یابد، شرکت می‌تواند بازدهی بیشتری از آن سخت‌افزارها بگیرد.

نگهداری از یک اثر ثابت (flat footprint) به این معنا نیست که سخت‌افزارها متوقف شده‌اند. لینکدین همچنان برای جایگزینی تجهیزات قدیمی یا خراب که در ماه‌های آینده از رده خارج می‌شوند، سرورهای جدید می‌خرد. با این حال، این بازار بسیار پرنوسان شده است.

هیرماگالور اشاره کرد که قیمت برخی سرورها تنها در چند ماه اخیر سه برابر شده است و این جهش‌های قیمتی را «دیوانه‌وار» توصیف کرد. شرکت با خرید پیش‌دستانه (قبل از این جهش‌ها) و پیش‌بینی افزایش قیمت تراشه‌های حافظه، موفق شد علی‌رغم توقف کلی هزینه‌ها، در خریدها صرفه‌جویی کند.

این رویکرد در واقع بخشی از ترند گسترده‌تری در صنعت است به نام «توکنومیکس» (Tokenomics)؛ جایی که شرکت‌ها به‌طور عمیق هزینه واقعی استفاده از ابزارهای هوش مصنوعی زاینده را تحلیل می‌کنند. شیراگ دکاته از مؤسسه Gartner می‌گوید سازمان‌ها از عصر «بیشتر بخر» (buy-more era) به عصر «بیشتر تولید کن» (do-more era) رسیده‌اند. او خاطرنشان می‌کند که شعار قبلی «بیشتر بخر تا بیشتر صرفه‌جویی کنی» در عمل تنها باعث افزایش هزینه‌ها شده است.

دکاته پیشنهاد می‌کند که کسب‌وکارهای کوچک‌تر که کنترل زیرساختی لینکدین را ندارند، راه‌های خودشان را برای کاهش هزینه‌ها یافته‌اند، از جمله:

  • پاک‌سازی نرم‌افزارهای بدون استفاده.
  • کاهش تعداد کارکنان.
  • خرید فضای مرکز داده از «نئوکلاودها» (neoclouds) که ارزان‌تر از ارائه‌دهنده‌های سنتی هستند.
  • به‌کارگیری ارزان‌ترین مدل‌های AI ممکن برای هر پروژه خاص.

با این حال، این انضباط مالی ریسک‌های خود را دارد. تحلیلگران هشدار می‌دهند که اگر محدودیت‌های مالی بیش از حد سخت‌گیرانه شود، شرکت‌ها ممکن است در نهایت به دیواری برخورد کنند، زیرا نیاز به توان محاسباتی و فضای ذخیره‌سازی بیشتر اجتناب‌ناپذیر است. دکاته هشدار می‌دهد که شرکت‌ها ممکن است در نهایت مجبور شوند بین جاه‌طلبی‌های AI خود یا دستورات مربوط به توقف هزینه‌های IT یکی را قربانی کنند.

لینکدین ادعا نمی‌کند که هرگز دوباره رشد نخواهد کرد. در عوض، آن‌ها «حدس‌های خام» (wild ass guesses) درباره نیازهای منابع را کنار گذاشته‌اند. به گفته برگر، شرکت تصمیم گرفته «هرج‌ومرج را بپذیرد» و زیرساخت‌ها را به‌صورت فصل‌به‌فصل مدیریت کند، در حالی که چشم خود را به بازگشت سرمایه‌گذاری (ROI) بلندمدت باز نگه داشته است.

گام بعدی شما

  • اگر در حال توسعه مدل هستید، به جای افزایش اندازه مدل، استراتژی تقطیر مدل (Distillation) را برای کاهش هزینه استنتاج بررسی کنید.
  • متریک‌های بهره‌وری GPU خود را رصد کنید؛ اگر نرخ استفاده شما زیر ۸۰٪ است، مشکل در لایه مهندسی زیرساخت دارید، نه کمبود سخت‌افزار.
  • بررسی کنید کدام بخش از خط‌لوله شما می‌تواند از GPU به CPU منتقل شود تا هزینه‌های عملیاتی ماهانه کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و اثر آن‌ها بر هزینه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام بر اساس تجربه عملی در مقیاس ۱.۳ میلیارد کاربر نشان می‌دهد که انضباط در مهندسی زیرساخت می‌تواند وابستگی مطلق به سخت‌افزارهای جدید را کاهش دهد. این موضوع اعتبار ادعاهای مربوط به «مدل‌های کوچک‌تر و بهینه‌تر» را در محیط‌های تجاری واقعی افزایش می‌دهد.

تأثیر برای ایران

برای استارتاپ‌های ایرانی که با محدودیت شدید بودجه و تحریم در خرید GPU مواجه‌اند، مدل بهینه‌سازی لینکدین و استفاده از تقطیر مدل (Distillation) یک نقشه راه عملی برای بقا و رشد بدون نیاز به سخت‌افزار جدید است.

·نگاه ما
تحریریه دات‌هوش

لینکدین با این حرکت، پارادایم «مقیاس‌بندی سخت‌افزاری» را به چالش می‌کشد و نشان می‌دهد که در سطح داده‌های عظیم، بهره‌وری (Efficiency) می‌تواند جایگزین سرمایه‌گذاری‌های میلیاردی شود. این یک چرخش استراتژیک از رشد کمّی به رشد کیفی است که احتمالاً الگوی بسیاری از شرکت‌های متوسطی خواهد بود که دسترسی محدودی به GPUهای جدید دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.