پرش به محتوای اصلی
پرش به محتوای مقاله

درون کارخانه توکن؛ مدیریت حافظه در سیستم‌های استنتاج مدرن

·۲۳ مرداد ۱۴۰۵۱ دقیقه مطالعه۳ بازدید
راهنما
نمودار فرآیند استنتاج هوش مصنوعی: از دریافت پرامپت تا تولید توکن خروجی
نمودار فرآیند استنتاج هوش مصنوعی: از دریافت پرامپت تا تولید توکن خروجی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر دیدگاه از مدل به عنوان یک «تابع ریاضی» به مدل به عنوان یک «سرویس مدیریت شده توسط سیستم‌عامل»؛ جایی که مدیریت حافظه KV Cache اهمیت بیشتری از خودِ پارامترهای مدل پیدا کرده است.

تصور کنید برای یک درخواست ساده از GPT-4 پول می‌پردازید، اما در پشت صحنه، یک ارکستراسیون پیچیده از سخت‌افزار و نرم‌افزار در حال اجراست تا پاسخ شما تولید شود. طبق گزارش ۱۴ اوت ۲۰۲۶ از The Sequence، سیستم‌های استنتاج مدرن دیگر شبیه یک فراخوانی ساده از تابع نیستند، بلکه مانند یک سیستم‌عامل کوچک هستند که دور یک کارخانه تولید توکن پیچیده شده است.

این وضعیت شبیه یک فرودگاه شلوغ است که هواپیماها (درخواست‌ها) با اندازه‌ها و زمان‌های مختلف وارد می‌شوند؛ برخی کاربران یک جمله می‌خواهند و برخی یک رمان، اما همه انتظار دارند اولین کلمه را فوراً دریافت کنند. این ترافیک نامتقارن، چالش زمان‌بندی عظیمی برای خوشه‌های GPU (واحد پردازش گرافیکی) ایجاد می‌کند تا تعادلی میان حافظه و سرعت برای هزاران کاربر هم‌زمان برقرار کند.

نمایی هنری از جریان داده در هوش مصنوعی: از دریافت پرامپت تا تولید توکن خروجی

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی زیرساخت‌های مدل‌های زبانی اشاره کردیم، مدیریت منابع در مقیاس بالا، سخت‌تر از خودِ آموزش مدل است. برای پردازش یک درخواست معمولی — مثلاً پرامپتی با ۴۰۰۰ توکن که پاسخی ۳۰۰ توکنی می‌طلبد — سیستم مراحل زیر را طی می‌کند:

  • پیش‌پردازش: جمع‌آوری زمینه و توکن‌سازی (Tokenization) — شبیه بریدن یک کیک طولانی به تکه‌های کوچک برای اینکه مدل بتواند آن‌ها را بخورد.
  • مسیریابی و زمان‌بندی: هدایت درخواست به GPU مناسب و مدیریت صف انتظار.
  • اجرا: اجرای هسته‌های ترنسفورمر (Transformer) و مدیریت حافظه KV Cache. در این مرحله، بهینه‌سازی فعال‌سازی پارامترها برای کاهش فشار بر حافظه حیاتی است، مشابه آنچه در معماری مدل Inkling برای مدیریت ظرفیت یک تریلیون پارامتر مشاهده کردیم.
  • نمونه‌گیری و استریم: انتخاب توکن بعدی و ارسال آن به‌صورت لحظه‌ای برای کاربر.

به همین دلیل، واژه استنتاج (Inference) — که در واقع لحظه آشپزی مدل است و نه دوره آموزش آشپز — برای توصیف این پیچیدگی بسیار کوچک است. بر اساس بررسی منابع فنی، نبرد واقعی در هوش مصنوعی عملیاتی، نه بر سر وزن‌های مدل، بلکه بر سر این است که سیستم چقدر بهینه درخواست‌ها را مسیریابی کرده و حافظه GPU را مدیریت کند تا هزینه‌ها کاهش یابد. این تلاش برای بهینه‌سازی استنتاج، حتی در مدل‌های کوچک‌تر که از طریق تقطیر دانش و تقلید توالی‌ها ساخته شده‌اند، برای دستیابی به کارایی حداکثری دنبال می‌شود.

برای توسعه‌دهندگان و صاحبان کسب‌وکار، این تغییر به این معناست که بهینه‌سازی یک اپلیکیشن AI نیازمند نگاهی فراتر از مهندسی پرامپت است. گلوگاه اصلی اغلب زیرساخت یا همان «سیستم‌عامل» است، نه لزوماً هوشِ خودِ مدل.

گام بعدی شما

  • بررسی موتورهای استنتاج متن‌باز مانند vLLM یا TensorRT-LLM برای درک اثر Batching بر تأخیر.
  • تحلیل میزان مصرف VRAM در مقابل طول پنجره متنی برای تخمین دقیق‌تر هزینه‌ها.
  • مطالعه متدهای Paging در مدیریت حافظه برای کاهش نرخ خطای سیستم.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری نشان می‌دهد که بهره‌وری AI به شدت به تخصص در مهندسی سیستم‌ها وابسته است. اعتبار این رویکرد در کاهش چشمگیر هزینه‌های عملیاتی برای شرکت‌هایی است که در مقیاس میلیونی سرویس می‌دهند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت منابع GPU مواجه‌اند، استفاده از موتورهای بهینه مانند vLLM تنها راه کاهش هزینه‌های استنتاج و افزایش تعداد کاربران هم‌زمان است.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «بزرگ‌تر کردن مدل» به «بهینه‌سازی لایه سرویس‌دهی» تغییر کرده است. این یعنی برتری رقابتی دیگر تنها در اختیار کسانی نیست که مدل‌های قوی‌تری دارند، بلکه در دست کسانی است که می‌توانند توکن‌ها را با کمترین هزینه و تأخیر به کاربر برسانند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.