پرش به محتوای اصلی
پرش به محتوای مقاله

دیوار حافظه: دلیل شکست عامل‌های هوش مصنوعی در مقیاس تجاری

·۱۹ شهریور ۱۴۰۵۱۳ دقیقه مطالعه۲ بازدید
تحلیل
وال برکوویچی، مدیر ارشد هوش مصنوعی در شرکت ویکا، در حال مصاحبه با سری مصاحبه‌های تخصصی.
وال برکوویچی، مدیر ارشد هوش مصنوعی در شرکت ویکا، در حال مصاحبه با سری مصاحبه‌های تخصصی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «بهینه‌سازی مدل» به «بهینه‌سازی لایه‌ی داده» برای تبدیل ذخیره‌سازی به حافظه با سرعت DRAM جهت پشتیبانی از عامل‌های خودمختار.

تصور کنید یک عامل امنیتی را مدیریت می‌کنید که باید حملاتی پیچیده و چندمرحله‌ای را رصد کند؛ حملاتی که زمانی هفته‌ها به طول می‌انجامید اما اکنون با سرعت ماشین عمل می‌کنند. حالا تصور کنید هر چند دقیقه یک‌بار تمام حافظه کاری این عامل پاک می‌شود و او باید تمام زمینه (Context) را از ابتدا محاسبه کند. در این وضعیت، عامل شما رشته‌ی اتفاقات یک حادثه جاری را گم می‌کند، در حالی که مهاجمانی که از عامل‌های بهینه‌شده در مصرف توکن استفاده می‌کنند، به‌طور مستمر نقاط ضعف شما را شناسایی و تعقیب می‌کنند. این تضاد، نیازی حیاتی به «حفظ مستمر زمینه» در مقابل استنتاج‌های لحظه‌ای و مقطعی ایجاد می‌کند.

وال برکوویسی (Val Bercovici)، مدیر ارشد هوش مصنوعی شرکت WEKA، معتقد است بزرگ‌ترین اتلاف منابع در زیرساخت‌های فعلی، GPUهای گران‌قیمتی هستند که به دلیل کندی دسترسی به داده‌ها، در حالت بیکار می‌مانند. به نقل از برکوویسی، هر کسی که بتواند این گلوگاه داده را برطرف کند، مالک مرحله بعدی تکامل هوش مصنوعی خواهد بود.

برکوویسی که در ژانویه ۲۰۲۵ به WEKA پیوست، سابقه‌ای طولانی در شناسایی نقاط کور زیرساختی دارد. مسیر شغلی او با شناسایی تغییرات گلوگاه‌ها تعریف شده است؛ از تدوین استراتژی‌های اولیه ابری در NetApp تا عضویت در هیئت مؤسس و حاکمیتی Kubernetes. او شاهد بود که صنعت چگونه از انعطاف‌پذیری محاسباتی به سمت نقاط خفگی در ارکستراسیون حرکت کرد. این گذار نشان می‌دهد که چرا در مقیاس سازمانی، لایه ارکستراسیون اهمیت بیشتری نسبت به مدل‌های بنیادی پیدا کرده است. او در NetApp، جایی که پس از تصاحب SolidFire به عنوان CTO خدمت کرد، سرعت را به معنای میلی‌ثانیه‌های پایین برای خواندن تصادفی اولین بایت در بارهای کاری تولیدی می‌دید. با این حال، مقیاس هوش مصنوعی نیازمند جهشی در عملکرد بود که ذخیره‌سازی‌های سنتی قادر به ارائه آن نبودند.

فراتر از نقشش در WEKA، برکوویسی به عنوان مشاور هوش مصنوعی برای Home Dock و مشاور استراتژیک برای FermiHDI و The Hive فعالیت می‌کند و ریاست PencilDATA را بر عهده دارد. تمرکز حرفه‌ای او بر حوزه‌های هوش مصنوعی، امنیت سایبری، بلاک‌چین، رایانش ابری و زیرساخت‌های داده متمرکز است که همگی با هدف پشتیبانی از سیستم‌های هوش مصنوعیِ به‌شدت داده‌محور طراحی شده‌اند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی زیرساخت‌های مدل‌های زبانی اشاره کردیم، تمرکز صنعت از قدرت پردازش خام به سمت مدیریت بهینه داده‌ها تغییر کرده است. در حال حاضر، بسیاری از سازمان‌ها با استنتاج (Inference) — که شبیه به لحظه‌ی واقعی آشپزی است، نه دوره‌ی آموزش آشپز — به عنوان یک ابزار ارزان و عمومی برخورد می‌کنند. اما با گذار از چت‌بات‌های ساده به سمت عامل‌های خودمختار (Autonomous Agents)، شرکت‌ها با دیواری از صورت‌حساب‌های ناپایدار و کمرشکن API مواجه شده‌اند. این تحول تأیید می‌کند که در محیط‌های تجاری، اولویت باید با طراحی جریان‌های کاری جامع باشد تا ابزارهای تک‌منظوره.

این تغییر رویکرد، منجر به ظهور مفهومی به نام AI FinOps شده است؛ جایی که بهره‌وری توکن‌ها دیگر یک موضوع فنی یا یک فکر ثانویه نیست، بلکه به یک انضباط مالی سخت‌گیرانه تبدیل می‌شود. AI FinOps با «توکنومیکس» آغاز می‌شود: یعنی بهینه‌سازی هر لایه سخت‌افزاری و نرم‌افزاری در پشته‌ی استنتاج برای کاهش هزینه واحد به ازای هر توکن.

دیوار حافظه و اقتصاد توکن‌ها

برکوویسی به دلیل یک عدد فنی خاص به WEKA پیوست: سرعت خواندن تصادفی اولین بایت بدون حافظه پنهان (Uncached) برابر با ۷۰ میکروثانیه. این یک عدد معمولی برای کلاس ذخیره‌سازی نیست؛ این سرعتی است که اجازه می‌دهد لایه‌ی ذخیره‌سازی شبیه به حافظه DRAM عمل کند. این قابلیت برای کاربردهایی در کلاس حافظه مانند Redis و حافظه‌های KV Cache حیاتی است.

شرکت WEKA یک پلتفرم داده‌ای نرم‌افزار-محور و بومی برای هوش مصنوعی ارائه می‌دهد که برای یادگیری ماشین، رایانش با عملکرد بالا (HPC) و بارهای کاری شتاب‌یافته طراحی شده است. معماری یکپارچه‌ی آن در محیط‌های درون‌سازمانی، ابری، ترکیبی (Hybrid) و لبه (Edge) عمل می‌کند تا گلوگاه‌های ذخیره‌سازی را حذف و بهره‌وری GPUها را بهبود بخشد. این شرکت به‌طور فزاینده‌ای بر اقتصاد نوظهور استنتاج و هوش مصنوعی عامل‌محور تمرکز کرده تا دسترسی با پهنای باند بالا و تأخیر کم به داده‌ها را در مقیاس عظیم فراهم کند.

او استدلال می‌کند که صنعت در حال حرکت از عصر «آموزش» به سمت اقتصاد «استنتاج» است. در این چشم‌انداز جدید، محدودیت اصلی دیگر FLOPS (قدرت محاسباتی) نیست، بلکه «دیوار حافظه» است.

نکات کلیدی این بحران عبارتند از:

  • گلوگاه: GPUها و شتاب‌دهنده‌های جدید بهینه‌شده برای رمزگشایی (ASIC+SRAM) اغلب در مرحله «رمزگشایی» (Decode) بیکار می‌مانند، زیرا منتظر حافظه و داده‌ها هستند، نه منتظر قدرت محاسباتی (Prefill).
  • راهکار: زیرساختی که اجازه دهد لایه‌ی داده مانند یک ذخیره‌ساز مشترک عمل کند اما با سرعت‌های واقعی نزدیک به HBM (حافظه پهنای‌باند بالا) اجرا شود. این امر برای اینکه راهکارهای فعلی تخلیه حافظه KV Cache از نظر اقتصادی توجیه‌پذیر باشند، ضروری است. اگر خواندن زمینه ذخیره‌شده کندتر از محاسبه مجدد آن باشد، حافظه پنهان (Cache) در معادله تجاری بی‌‌ارزش است.
  • هدف: استخراج حداکثری ارزش از هر توکن، هر بایت و هر وات برق. با بهینه‌سازی این بخش، سازمان‌ها می‌توانند ۳ تا ۴ برابر ارزش بیشتری از همان زیرساخت استخراج کنند یا فضای اشغال‌شده در رک‌های سرور را تا ۷۵٪ کاهش دهند.

زیرساخت‌های ایمنی و قوانین جدید

الزامات رگولاتوری، مانند قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) که همین ماه اجرایی شد، سازمان‌ها را مجبور به بازنگری در زیرساخت‌های هوش مصنوعی می‌کند. این قانون، اکثر ارکستراسیون‌های عامل‌محور را در دسته «پرخطر» طبقه‌بندی می‌کند. برکوویسی هشدار می‌دهد که منتظر ماندن برای یک چک‌لیست نهایی دولتی از سوی کاخ سفید یا نهادهای دیگر، یک اشتباه است؛ زیرا افزودن قابلیت پاسخگویی به سیستم‌هایی که از ابتدا برای توضیح دادن رفتار خود طراحی نشده‌اند، همیشه گران‌تر از ساختن آن‌ها در ابتدای مسیر است.

تست‌های ایمنی اساساً با آموزش مدل متفاوت است. در حالی که آموزش شبیه به یک «شلنگ آتش‌نشانی» از داده‌هاست که با الگویی پایدار به مدل تزریق می‌شود، تست ایمنی دقیقاً برعکس است: تکانشی (Bursty)، متکی بر خواندن‌های زیاد و مقایسه‌ای است. این فرآیند شامل هزاران سناریوی ارزیابی، کاوش‌های مکرر، مقایسه‌های رفتاری نسخه به نسخه و تیم‌های قرمز (Red-teaming) خصمانه و بی‌پایان است.

برای مدل‌های پیشرفته یا مدل‌هایی با قابلیت‌های سایبری، پروفایل بار کاری به‌جای episodic (مقطعی)، به‌صورت ۲۴ ساعته و مستمر است. این بارهای کاری شامل دسته‌هایی از عامل‌ها (Agent Swarms) هستند که به‌طور مداوم در محیط تولید برای دسترسی به محاسبات، حافظه و پهنای باند داده با یکدیگر رقابت می‌کنند. برای بهینه‌سازی این رقابت، استفاده از موتورهای استنتاجی پیشرفته می‌تواند تأخیرهای کرنل GPU را به‌شدت کاهش دهد. برای آمادگی در این شرایط، سازمان‌ها باید زیرساخت‌هایی بسازند که از موارد زیر پشتیبانی کند:

  • تبار داده (Data Lineage): ردیابی دقیق اینکه مدل در یک نقطه زمانی خاص با چه داده‌ای برخورد کرده و چگونه رفتار کرده است.
  • مشاهده‌پذیری (Observability): توانایی بازسازی وضعیت مدل در لحظه برای نمایش و اثبات اقدامات مدل.
  • مدل‌های حفاظتی (Guardrail Models): پیاده‌سازی لایه‌های دفاع semantic پیش از ارسال خروجی‌ها. این مدل‌های ناهمگون و لایه‌بندی شده باید در چارچوب بودجه‌های سخت‌گیرانه تأخیر و توکن عمل کنند.
  • تکرارپذیری: اطمینان از اینکه وضعیت‌های مدل را می‌توان ثبت کرد و برای مقاصد حسابرسی مجدداً اجرا نمود.

توهم بنچمارک‌های «اسباب‌بازی»

برکوویسی بنچمارک‌های فعلی هوش مصنوعی را «مصنوعی» می‌نامد. اکثر تست‌ها با ۸۰۰۰ توکن یا کمتر و تنها با یک پرامپت و یک پاسخ اجرا می‌شوند. او استدلال می‌کند که این‌ها بنچمارک‌های مصنوعی برای یک هوش مصنوعی مصنوعی هستند.

در مقابل، انتظار می‌رود بارهای کاری واقعی عامل‌ها در اواسط سال ۲۰۲۶، بین ۱۰۰,۰۰۰ تا ۴۰۰,۰۰۰ توکن زمینه را در هزاران نوبت گفتگو مدیریت کنند. اگر گواهینامه‌های ایمنی بر اساس بنچمارک‌های اسباب‌بازی صادر شوند، سیستم‌هایی تأیید می‌شوند که برای دنیایی که وجود ندارد طراحی شده‌اند. رگولاتورها در حال تلاش برای اصلاح این موضوع هستند؛ برای مثال، NIST ابزارهای ارزیابی امنیت عامل‌ها را به‌صورت متن‌باز منتشر کرده است. نتایج اولیه این ابزارها نشان می‌دهد که حملات جدید «ربودن عامل» (Agent-hijack) با نرخی چندین برابر بیشتر از خطوط پایه شناخته‌شده موفق می‌شوند، که این خود نیازی حیاتی به تست‌های مداوم و گران‌قیمت را ثابت می‌کند.

مدل‌های وزن‌باز در برابر مدل‌های بسته

شکاف عمیقی میان مدل‌های پیشرو بسته و مدل‌های وزن‌باز (Open Weights) — که شبیه به انتشار دستور پخت غذاست تا فقط ارائه غذای آماده — ایجاد شده است. در حالی که کنترل‌های صادراتی امسال بر جدیدترین مدل‌های بسته اعمال شد، مدل‌های وزن‌باز به‌راحتی از مرزها عبور کرده و اکنون در صدر جدول‌های توانمندی عمومی قرار گرفته‌اند.

برکوویسی معتقد است برخورد متفاوت با این دو دسته، شکافی ایجاد می‌کند که ریسک‌ها در آن جای می‌گیرند. یک مدل وزن‌باز می‌تواند در محیط‌هایی بازتنظیم (Fine-tune) و مستقر شود که ارائه‌دهنده اصلی هیچ دیدی نسبت به آن‌ها ندارد. بنابراین، حاکمیت نمی‌تواند فقط به خود مدل ختم شود، بلکه نیازمند دید به این است که مدل‌ها کجا اجرا می‌شوند، به چه داده‌هایی دسترسی دارند و چگونه تغییر یافته‌اند. این امر مستلزم به‌روزرسانی‌های جدید در استانداردهای ISO27001 و SOC2 خواهد بود.

راهکار او «اعتماد اما تأیید» است. با استفاده از زیرساخت‌هایی که ظرفیت توکن کافی را فراهم می‌کنند، سازمان‌ها می‌توانند لایه‌های حفاظتی ناهمگونی را روی هر مدلی — چه داخلی یا خارجی، باز یا بسته — پیش از ارسال خروجی اجرا کنند. تأیید عینی بر اعتماد یا بی‌اعتمادی مطلق پیروز می‌شود.

حافظه مستمر به عنوان مدرک قانونی

در عامل‌های خودمختار، حافظه KV Cache — که اغلب به عنوان فضای موقت و قابل دورریز تلقی می‌شود — در واقع تنها رکورد ماندگار از دلیل تصمیم یک عامل در مورد یک موضوع خاص است. یک چت‌بات صرفاً یک پرامپت و یک پاسخ است، اما یک عامل خودمختار یک فرآیند در حال اجراست که در طول ساعت‌ها یا روزها وضعیت (State) خود را انباشته می‌کند. این عامل با ده‌ها سیستم تعامل دارد، اطلاعات را بازیابی می‌کند و تصمیمات میانی می‌گیرد.

اگر یک عامل در طول چندین روز فعالیت کند، خروجی نهایی هیچ توضیحی درباره استدلال‌های او نمی‌دهد. توضیح واقعی در وضعیت انباشته شده نهفته است. دور ریختن این حافظه معادل نابود کردن مدارک در یک بازرسی جنایی است. این تغییر، نظارت (Monitoring) را از یک ویژگی ساده لاگ‌گیری به یک workload درجه اول تبدیل می‌کند که بودجه منابع اختصاصی خود را دارد.

برای تأمین امنیت این داده‌ها، برکوویسی پیشنهاد می‌کند از لاگ‌های شفافیت ساده یا زنجیره‌های هش (Hash Chains) که در برابر دسته‌های هماهنگ عامل‌های مخرب آسیب‌پذیر هستند، فراتر برویم. او از معماری‌های بلاک‌چین عمومی و به‌شدت غیرمتمرکز برای تضمین مقدار «یکپارچگی» (Integrity) در مثلث امنیت سایبری (C-I-A) دفاع می‌کند. این کار مانع از آن می‌شود که عامل‌های مخرب لاگ‌ها و آثار جرم دیجیتال را دستکاری کنند و یک رکورد تغییرناپذیر برای رگولاتورها یا دادگاه‌ها فراهم می‌کند. چالش در اینجا فقط ذخیره‌سازی نیست، بلکه نگه داشتن این اطلاعات به‌گونه‌ای است که قابل اعتماد، ایندکس‌شده و با سرعتی کافی برای کاربرد در ضرب‌الاجل‌های قانونی، قابل بازیابی باشد.

جنگ فرسایشی توکن‌ها

امنیت هوش مصنوعی در حال تبدیل شدن به یک «جنگ فرسایشی توکن‌ها» است. مدافعان باید «سربازان آبی» (عامل‌های دفاعی) را در برابر «سربازان قرمز» (عامل‌های مهاجم) به میدان بفرستند. این موضوع در تابستان امسال به واقعیت تبدیل شد، زمانی که حمله یک دسته عامل قرمز به یک مخزن مدل‌های بزرگ، منجر به تشکیل یک اتحاد امنیتی اختصاصی برای هوش مصنوعی شد.

از آنجا که مدل‌های حفاظتی رایگان نیستند، آن‌ها بخشی از پنجره تأخیر ثابت برای هر پاسخ را مصرف می‌کنند. طرفی که بتواند توکن‌های بیشتری را به ازای هر دلار و هر وات برق تولید کند، در نهایت برنده نبرد امنیتی خواهد بود. این موضوع به‌ویژه زمانی اهمیت می‌یابد که حجم پردازش توکن‌ها در صنعت از تریلیون‌ها به کوادریلیون‌ها می‌رسد.

این تغییر به این معناست که ایمنی و انطباق (Compliance) دیگر نمی‌توانند مانند امنیت سایبری سنتی، یک لایه «الحاقی» (Bolt-on) باشند که منجر به بودجه‌های جداگانه و تیم‌هایی می‌شود که مشکلات را پس از وقوع کشف می‌کنند. در عوض، نظارت، ارزیابی، قابلیت حسابرسی و حفظ داده‌های تغییرناپذیر باید از همان ابتدا در هسته زیرساخت هوش مصنوعی طراحی شوند. هوش مصنوعی ایمن نیازمند هوش مصنوعی بیشتری است که به‌طور هدفمند به کار گرفته شود، جایی که ایمنی به عنوان یک ورودی طراحی تلقی شود، نه یک مالیات اضافی.

گام بعدی شما

  • بررسی استراتژی AI FinOps برای کاهش هزینه‌های API در پروژه‌های عامل‌محور.
  • ارزیابی زیرساخت‌های ذخیره‌سازی برای کاهش تأخیر در دسترسی به KV Cache.
  • پیاده‌سازی لایه‌های حفاظتی (Guardrails) مستقل از مدل اصلی برای افزایش امنیت.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع نشان می‌دهد که گلوگاه هوش مصنوعی از قدرت پردازش (Compute) به مدیریت حافظه و داده منتقل شده است. بر اساس تخصص برکوویسی در زیرساخت‌ها، سازمان‌هایی که AI FinOps را نادیده بگیرند، با هزینه‌های عملیاتی ناپایدار مواجه خواهند شد.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به GPUهای پیشرفته و زیرساخت‌های ابری سطح بالا، توسعه‌دهندگان ایرانی باید بیشتر بر مدل‌های وزن‌باز و تکنیک‌های بهینه‌سازی حافظه در محیط‌های محدود تمرکز کنند.

·نگاه ما
تحریریه دات‌هوش

بزرگ‌ترین ریسک فعلی برای سازمان‌ها، تکیه بر بنچمارک‌های کوتاه است که عملکرد مدل را در محیط‌های استریل می‌سنجند. وقتی عامل‌ها وارد دنیای واقعی می‌شوند، «فراموشی» یا هزینه استنتاج در پنجره‌های متنی بزرگ، مدل را از یک ابزار بهره‌ور به یک مرکز هزینه تبدیل می‌کند. برنده این رقابت، لزوماً کسی نیست که مدل 똑똑‌تری دارد، بلکه کسی است که لایه‌ی داده را به سرعت حافظه رم نزدیک کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.