پرش به محتوای اصلی
پرش به محتوای مقاله

آیا استریم از SSD می‌تواند محدودیت رم در مدل‌های زبانی را بشکند؟

·۲۶ شهریور ۱۴۰۵۱۴ دقیقه مطالعه
مقایسه Gemma 4 26B محلی و API: راه‌اندازی ۲ گیگابایتی، سرعت و هزینه
مقایسه Gemma 4 26B محلی و API: راه‌اندازی ۲ گیگابایتی، سرعت و هزینه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از استریم بلادرنگ خبره‌ها از SSD برای کاهش مصرف رم از ۱۴ گیگابایت به ۲ گیگابایت در مدل‌های MoE؛ این اولین بار است که یک مدل ۲۶ میلیارد پارامتری روی سخت‌افزار پایه مک اجرا می‌شود.

اگر امروز یک مک‌بوک ایر مدل پایه دارید، تصور کنید بتوانید مدل‌های زبانی حجیم و حرفه‌ای را بدون ارتقای سخت‌افزاری روی آن اجرا کنید. محیط اجرای TurboFieldfare این رویای دست‌نیافتنی را به واقعیت تبدیل کرده و مدل Gemma 4 26B A4B را تنها با ۲ گیگابایت حافظه رم فعال می‌کند. این پیکربندی به کاربرانی که سخت‌افزارهای سطح ورودی دارند اجازه می‌دهد به مدلی با ۲۵ میلیارد پارامتر دسترسی پیدا کنند؛ مدلی که در حالت عادی به مقدار بسیار بیشتری رم نیاز دارد.

مقایسه Gemma 4 26B محلی و API: راه‌اندازی ۲ گیگابایتی، سرعت و هزینه

این دستاورد در حالی رخ می‌دهد که صنعت هوش مصنوعی برای تعادل میان کیفیت مدل و محدودیت‌های سخت‌افزاری در تکاپو است. طبق گزارش‌های فنی، اکثر محیط‌های اجرای محلی مانند Ollama، llama.cpp، LM Studio یا vLLM کاربر را مجبور می‌کنند کل مدل کوانتیده را پیش از شروع استنتاج (Inference) — که لحظه‌ای است مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره‌ی آموزش آشپز — در رم یا VRAM بارگذاری کنند. در همین راستا، تلاش‌هایی برای کاهش تأخیر استنتاج محلی از طریق بهینه‌سازی حافظه متاداده در اولاما صورت گرفته است تا سرعت پاسخ‌دهی مدل‌ها بهبود یابد. برای مدلی در این ابعاد، این یعنی نیاز به حداقل ۱۴ تا ۳۲ گیگابایت حافظه آزاد.

تصور کنید بخواهید یک هوش مصنوعی در سطح حرفه‌ای را روی یک مک‌بوک ایر مدل پایه اجرا کنید. تا پیش از این، این موضوع یک دیوار سخت‌افزاری سخت و غیرقابل عبور بود. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، عبور از سد سخت‌افزاری معمولاً به معنای کوچک کردن مدل است، اما TurboFieldfare مسیر متفاوتی را برگزیده است. این ابزار نه با کوچک کردن مدل، بلکه با تغییر نحوه خواندن داده‌ها از دیسک، دیوار سخت‌افزاری را می‌شکند.

زمینه: آشنایی با Gemma 4 26B A4B

مدل Gemma 4 در حدود آوریل ۲۰۲۶ توسط Google DeepMind تحت لایسنس Apache 2.0 منتشر شد. این خانواده شامل چندین مدل متراکم (Dense) در ابعاد E2B، E4B، 12B و 31B است. نسخه 26B A4B یک مدل تخصصی از نوع ترکیب خبره‌ها (Mixture of Experts یا MoE) است؛ ساختاری شبیه به تیمی از متخصصان که برای هر سؤال، فقط چند نفر از آن‌ها فراخوانده می‌شوند تا پاسخ دهند.

بر اساس مستندات رسمی، این مدل در مجموع ۲۵.۲ میلیارد پارامتر دارد، اما برای هر توکن (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — تنها حدود ۳.۸ میلیارد پارامتر را فعال می‌کند. این معماری اجازه می‌دهد کیفیت مدل‌های ۳۱ میلیارد پارامتری را با هزینه محاسباتی مدل‌های ۴ میلیارد پارامتری به دست آوریم.

طبق کارت مدل رسمی، نسخه 26B A4B از ۱۲۸ خبره مسیریابی‌شده (Routed Experts) استفاده می‌کند. برای هر توکن تولید شده، مدل هشت خبره مسیریابی‌شده به‌همراه یک خبره مشترک (Shared Expert) را فعال می‌کند. دقیقاً همین سازوکار مسیریابی است که بهینه‌سازی حافظه در TurboFieldfare را ممکن کرده است.

سازوکار: استریم خبره‌ها از SSD

ابزار TurboFieldfare از معماری MoE بهره می‌برد تا به‌جای بارگذاری کل ۲۵.۲ میلیارد پارامتر در حافظه، تنها یک هسته مشترک ۱.۳۵ گیگابایتی و KV Cache (حافظه موقت کلید-مقدار) با دقت FP16 را در رم نگه دارد. سپس خبره‌های مورد نیاز برای هر توکن را به‌صورت بلادرنگ و مستقیم از SSD استریم می‌کند.

این رویکرد مجموعه‌ای از الزامات و موازنات سخت‌افزاری خاص را ایجاد می‌کند:

  • حافظه مقیم: حدود ۲ گیگابایت برای وزن‌ها و یک KV Cache با ظرفیت ۴ هزار توکن.
  • فضای SSD: حدود ۱۴.۳ گیگابایت فضای مورد نیاز برای مدل بازپک‌شده (Repacked).
  • نصب: دانلود و بازپک‌سازی حدود ۱۵ گیگابایت داده در طول فرآیند نصب.
  • سخت‌افزار: بهینه‌شده به‌طور خاص برای تراشه‌های سری M اپل (Apple Silicon).
  • قابلیت‌ها: در حال حاضر فقط از استنتاج متنی پشتیبانی می‌کند؛ ورودی‌های تصویری، صوتی و ویدئویی پشتیبانی نمی‌شوند.

بنچمارک‌های عملکرد روی مک

به دلیل اتکا به سرعت دیسک برای دریافت وزن خبره‌ها، عملکرد مدل بسته به نسل تراشه و سرعت SSD به‌شدت تغییر می‌کند. اندازه‌گیری‌های جامعه کاربران تفاوت فاحشی را بین سخت‌افزارهای سطح ورودی و حرفه‌ای نشان می‌دهد:

  • مک‌بوک ایر M2 (۸ گیگابایت رم): سرعت رمزگشایی ۵.۱ تا ۶.۳ توکن در ثانیه.
  • M5 Pro (۲۴ گیگابایت رم): سرعت ۳۱ تا ۳۵ توکن در ثانیه.

این اعداد به این معناست که مدل روی M2 برای کارهای غیرهم‌زمان (Asynchronous) قابل استفاده است، اما برای بارهای کاری تولیدی با حجم بالا مناسب نیست. برای درک بهتر محدودیت‌های توان عملیاتی، خروجی تئوریک ۲۴ ساعته برای یک M2 با سرعت ۵.۱ توکن در ثانیه را در نظر بگیرید: این دستگاه ماهانه حدود ۱۳.۲ میلیون توکن تولید می‌کند که در صورت استفاده ۵۰ درصدی به ۶.۶ میلیون توکن می‌رسد.

در مقابل، یک M5 Pro با سرعت ۳۵ توکن در ثانیه می‌تواند تئوریکاً ۹۰.۷ میلیون توکن در ماه تولید کند (۴۵.۴ میلیون در صورت استفاده ۵۰ درصدی). تولید ۲۰ میلیون توکن خروجی روی یک دستگاه M2 تنها، به حدود ۴۵.۴ روز رمزگشایی بدون وقفه نیاز دارد، که چنین حجم کاری را در یک ماه استاندارد ۳۰ روزه غیرممکن می‌کند. این سطح از بهینه‌سازی در سخت‌افزارهای اپل، یادآور آن است که چگونه تراشه‌های M4 Pro در مک‌مینی با بهره‌گیری از مدل‌های MoE استقلال و حاکمیت محلی بر هوش مصنوعی را تسهیل کرده‌اند.

موازنه پنجره متنی

یک تفاوت حیاتی میان قابلیت نظری مدل و این پیکربندی ۲ گیگابایتی وجود دارد. در حالی که کارت مدل رسمی Gemma 4 از پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، مثل میز کاری که جا برای چند ورق دارد — عظیم ۲۵۶ هزار توکنی پشتیبانی می‌کند، نسخه TurboFieldfare به دلیل محدودیت رم، تنها از یک KV Cache محدود ۴ هزار توکنی استفاده می‌کند.

افزایش این پنجره به ۳۲، ۱۲۸ یا ۲۵۶ هزار توکن، مصرف حافظه را به‌شدت بالا برده و از مرز ۲ گیگابایت عبور می‌کند. حافظه KV-cache با افزایش طول پرامپت و پاسخ تولید شده، رشد می‌کند. بنابراین کاربرانی که تحلیل اسناد طولانی را هدف قرار داده‌اند، باید این رشد حافظه را در نظر بگیرند، زیرا عدد ۲ گیگابایت فقط برای تعاملات کوتاه صادق است.

مقایسه با استنتاج استاندارد

برای درک اهمیت عدد ۲ گیگابایت، آن را با نیازهای حافظه تقریبی رسمی گوگل برای استنتاج متداول (که شامل ۲۰٪ سربار بارگذاری است) مقایسه کنید:

  • دقت BF16: ۵۷.۷ گیگابایت
  • دقت SFP8: ۲۸.۸ گیگابایت
  • دقت Q4_0: ۱۴.۴ گیگابایت

TurboFieldfare با ترکیب وزن‌های ۴ بیتی، یک کش محدود خبره‌ها در حافظه و کرنل‌های سفارشی Swift و Metal به این عدد رسیده است. این یک ترفند مهندسی است که فقط در مدل‌های MoE جواب می‌دهد؛ مدل‌های متراکم (Dense) چون در هر مرحله به تمام وزن‌ها نیاز دارند، نمی‌توانند از این روش استفاده کنند.

اجرای محلی در برابر API گوگل

گوگل این مدل را از طریق Gemini API با شناسه gemma-4-26b-a4b-it ارائه می‌دهد. این API از ورودی‌های چندوجهی (متن و تصویر)، دستورات سیستمی، تفکر قابل تنظیم (Configurable Thinking) و فراخوانی تابع (Function Calling) پشتیبانی می‌کند. مقایسه این دو مسیر تفاوت‌های روشنی را نشان می‌دهد:

  • زیرساخت: API توسط گوگل مدیریت می‌شود، اما مسیر محلی توسط توسعه‌دهنده اداره شده و نیازمند برنامه‌ریزی ظرفیت و مدیریت جایگزینی (Failover) است.
  • حریم خصوصی: در لایه رایگان API، محتوا ممکن است برای بهبود محصولات گوگل استفاده شود، اما در اجرای محلی، تمام پرامپت‌ها برای حریم خصوصی کامل روی دستگاه می‌مانند.
  • قابلیت‌ها: API از تصاویر و فراخوانی ابزارها پشتیبانی می‌کند، در حالی که مسیر محلی فقط متنی است و اگرچه می‌تواند فراخوانی ابزار را تولید کند، اما کلاینت باید آن‌ها را به‌صورت دستی تأیید و اجرا کند.

در حال حاضر گوگل این API را در لایه رایگان ارائه می‌دهد که یک پارادوکس اقتصادی ایجاد می‌کند: استفاده از API از نظر مالی «ارزان‌تر» از میزبانی محلی است که هزینه‌های برق، استهلاک SSD و استهلاک سخت‌افزار را به همراه دارد.

تحلیل هزینه محلی

اگر تیمی یک دستگاه ۱۲۰۰ دلاری اپل بخرد و هزینه آن را در ۲۴ ماه مستهلک کند، هزینه ماهانه سخت‌افزار ۵۰ دلار خواهد بود. اگر این دستگاه ماهانه ۴ میلیون توکن تولید کند، هزینه استهلاک ۱۲.۵ دلار به ازای هر میلیون توکن می‌شود. اما یک مدل هزینه واقعی محلی باید شامل موارد زیر باشد:

  • برق و استهلاک/تعویض SSD.
  • زمان مهندسی برای نصب و نگهداری.
  • تولیدات ناموفق و تلاش‌های مجدد (Retries).
  • هزینه فرصت سخت‌افزار.

آمادگی برای تولید و سرور محلی

ابزار TurboFieldfare شامل یک سرور آزمایشی سازگار با OpenAI است که روی http://127.0.0.1:8080/v1 گوش می‌دهد. این سرور از استریم و بازاستفاده از پیشوند پرامپت (Prompt-prefix reuse) پشتیبانی می‌کند اما فاقد TLS یا احراز هویت راه دور است و باید فقط روی رابط loopback باقی بماند.

یک استقرار آماده برای تولید نیازمند لایه‌های اضافی برای موارد زیر است:

  • احراز هویت، مجوزدهی و TLS.
  • صف‌بندی درخواست‌ها و کنترل‌های هم‌زمانی.
  • نظارت بر فشار حافظه و کش خبره‌های SSD.
  • یک مسیر جایگزین (Fallback) برای شکست‌های محلی.

تحلیل: اولویت مهندسی بر معماری

دستیابی به عدد ۲ گیگابایت بیشتر یک ترفند مهندسی است تا تغییری بنیادین در معماری هوش مصنوعی. این موضوع ثابت می‌کند مدل‌های MoE برای استنتاج به سبک «حافظه مجازی» ایده‌آل هستند؛ چون فقط بخشی از وزن‌ها در هر توکن استفاده می‌شوند، SSD می‌تواند به‌عنوان یک افزونه کند برای رم عمل کند.

برای کاربر عادی، این یعنی «مالیات رم» برای اجرای هوش مصنوعی باکیفیت در حال کاهش است. دیگر برای اجرای مدل ۲۶ میلیارد پارامتری به ایستگاه کاری ۳ هزار دلاری نیاز ندارید، اما باید سرعت کمتر و پنجره متنی کوچک‌تر را بپذیرید.

این چرخش به نفع جنبش «هوش مصنوعی لبه» (Edge AI) است و به توسعه‌دهندگان اجازه می‌دهد پیش از مقیاس‌بندی در سرورهای گران‌قیمت یا APIهای میزبانی شده، گردش‌کارهای پیچیده MoE را روی لپ‌تاپ prototypه کنند. این فشار را بر سایر محیط‌های اجرا می‌آورد تا مکانیزم‌های استریم مشابهی برای معماری‌های MoE پیاده کنند. در همین راستا، ابزارهایی مانند PocketPal AI امکان اجرای رایگان مدل‌های زبانی را روی اندروید و iOS فراهم کرده‌اند تا دسترسی به هوش مصنوعی محلی را به دستگاه‌های موبایل گسترش دهند.

برای تصمیم‌گیری بین این دو مسیر، کاربران باید مسیر ساده‌ای را دنبال کنند: اگر بار کاری باید آفلاین یا روی دستگاه باشد، از محیط اجرای اپل سیلیکون استفاده کنید. اگر به پشتیبانی از تصویر، نصب سریع یا توافق‌نامه سطح خدمات (SLA) تولیدی نیاز دارید، از Gemini API استفاده کنید.

اگر در حال برنامه‌ریزی برای استقرار تولیدی هستید، باید هر دو مسیر را با یک مجموعه پرامپت یکسان ارزیابی کنید. به‌جای نگاه کردن صرف به قیمت توکن یا نیاز به رم، «هزینه به ازای هر تسک پذیرفته شده» — شامل بررسی انسانی و نرخ تلاش مجدد — را اندازه‌گیری کنید.

گام بعدی شما

  • اگر کاربر مک هستید، TurboFieldfare را نصب کنید تا تفاوت کیفیت مدل ۲۶ میلیارد پارامتری را با مدل‌های کوچک‌تر در محیط محلی بسنجید.
  • در صورت نیاز به تحلیل اسناد طولانی، از Gemini API استفاده کنید زیرا محدودیت ۴ هزار توکنی نسخه محلی مانع از پردازش متون حجیم می‌شود.
  • برای استقرار تجاری، هزینه استهلاک SSD را در مدل مالی خود لحاظ کنید، زیرا استریم مداوم داده‌ها عمر دیسک را کاهش می‌دهد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تکنیک با تکیه بر تخصص در مدیریت حافظه، دسترسی به مدل‌های باکیفیت را از انحصار سخت‌افزارهای گران‌قیمت خارج می‌کند. این تغییر باعث می‌شود توسعه‌دهندگان بتوانند بدون هزینه زیرساختی، مدل‌های حجیم را در محیط‌های محلی و خصوصی تست کنند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت بودجه برای خرید GPUهای گران‌قیمت یا دسترسی به APIهای پولی مواجه‌اند، این ابزار امکان اجرای محلی مدل‌های قدرتمند را روی مک‌بوک‌های موجود فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این دستاورد نشان می‌دهد که مدل‌های MoE می‌توانند شکاف میان سخت‌افزارهای مصرفی و مدل‌های پیشرفته را پر کنند. در واقع، SSD در اینجا نقش یک حافظه Swap هوشمند را ایفا می‌کند که فقط بخش‌های مورد نیاز مدل را فرا می‌خواند. این رویکرد احتمالاً باعث می‌شود در آینده شاهد مدل‌های حتی بزرگ‌تری باشیم که روی دستگاه‌های لبه اجرا می‌شوند، به شرطی که سرعت خواندن دیسک‌ها (NVMe) رشد کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.