پرش به محتوای اصلی
پرش به محتوای مقاله

تحلیل سخت‌افزاری: ۳۲ گیگابایت رم مرز عملیاتی برای مدل‌های محلی

·۱۶ مرداد ۱۴۰۵۸ دقیقه مطالعه
راهنما
شبکه عصبی بدون اینترنت در ۲۰۲۶: لپ‌تاپ و گوشی شما واقعاً چه کارهایی می‌توانند بکنند
شبکه عصبی بدون اینترنت در ۲۰۲۶: لپ‌تاپ و گوشی شما واقعاً چه کارهایی می‌توانند بکنند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تعیین دقیق «آستانه ۳۲ گیگابایت رم» به عنوان حداقل نیاز برای تجربه حرفه‌ای مدل‌های محلی، در مقابل ادعاهای بازاریابی شرکت‌های سخت‌افزاری که هر دستگاهی را AI-Ready می‌نامند.

تصور کنید برنامه‌نویسی هستید که می‌خواهد تمام کدهای محرمانه شرکتش را بدون خروج از محیط داخلی تحلیل کند، اما با دکمه‌ی اجرا، سیستمش به مدت یک دقیقه یخ می‌زند. این تضاد میان «امکان فنی» و «کاربردی بودن»، دقیقا همان جایی است که بسیاری از کاربران در مسیر استقرار مدل‌های محلی شکست می‌خورند.

بر اساس گزارش PCWorld در ۱۸ مارس ۲۰۲۵، یک لپ‌تاپ رده‌بالای HP Elitebook با ۶۴ گیگابایت رم می‌تواند مدل‌های ۷۰ میلیارد پارامتری را به‌صورت آفلاین اجرا کند، اما سرعت تولید متن در آن تنها ۱.۶۸ توکن در ثانیه است. این یعنی دسترسی به مدل، به معنای قابلیت استفاده از آن نیست؛ چرا که تأخیر تا اولین کاراکتر خروجی در این دستگاه، ۶۶.۶ ثانیه بود، حتی با وجود داشتن یک NPU اختصاصی.

امروزه هوش مصنوعی محلی از یک سرگرمی برای علاقه‌مندان به تکنولوژی به یک ضرورت امنیتی تبدیل شده است. کاربران میان راحتی ابری و میل به دور نگه داشتن سوابق پزشکی، قراردادهای حقوقی یا مکاتبات شخصی و صمیمانه از سرورهای شخص ثالث در نوسان‌اند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های وزن‌باز اشاره کردیم، این تقاضا شکافی ایجاد کرده میان کسانی که دنبال یک کلون یا کپی برابر اصل از ChatGPT یا Claude هستند و کسانی که اولویتشان یک محیط «حاکمیتی» است که در آن کاربر کنترل کامل روی وزن‌ها و لاگ‌ها دارد.

لپ‌تاپ شما را مثل یک میز کار تصور کنید: مدل ابزار است و رم، فضای سطح میز. اگر ابزار بزرگ‌تر از میز باشد، همه چیز کند می‌شود یا می‌ریززد. در حالی که سرویس‌های ابری فضای تقریباً نامحدود می‌دهند، استنتاج (Inference) — مثل خودِ آشپزی، نه دوره‌ی آموزش آشپز — در محیط محلی، بازی سخت ریاضیات حافظه است. وقتی کسی به دنبال «شبکه‌ی عصبی بدون اینترنت» می‌گردد، اغلب دو هدف متفاوت را با هم ترکیب می‌کند: حریم خصوصی داده‌ها و عملکردی برابر با ابر. هزینه‌ی خطا در این دو هدف کاملاً متفاوت است.

مالیات سخت‌افزاری

الزامات حافظه از یک قانون فیزیکی سخت پیروی می‌کنند: به نقل از MIT Technology Review، تقریباً برای هر میلیارد پارامتر به ۱ گیگابایت رم نیاز است. اما وزن‌های مدل تنها بخشی از هزینه هستند. طبق یافته‌های PCWorld، حتی یک مدل متوسط ۷-۸ میلیارد پارامتری برای وزن‌هایش به ۴.۵ تا ۵ گیگابایت حافظه نیاز دارد. بنابراین، ۳۲ گیگابایت رم حداقل واقعی برای یک تجربه حرفه‌ای و روان بدون لگ‌های مداوم سیستم است.

در دستگاه‌های موبایل، محدودیت‌ها شدیدترند. MIT Technology Review یک مدل ۱۴ میلیارد پارامتری را روی لپ‌تاپی با ۱۶ گیگابایت رم آزمایش کرد که تنها پس از بستن تقریباً تمام برنامه‌های دیگر برای آزاد کردن فضای کافی، فعال شد. در آیفون ۱۲ که فاقد موتور عصبی (Neural Engine) مدرن است، نتیجه به‌طور قابل توجهی بدتر بود: مدل مدام وارد «مسیرهای عجیب» می‌شد و دچار توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد، مثل دوستی که خاطره‌ای را اشتباه تعریف می‌کند — می‌گشت. البته باید ذکر کرد که آیفون ۱۲ دستگاهی قدیمی است و پرچمداران ۲۰۲۶ به دلیل تراشه‌های به‌روز و سیلیکون‌های جدید رفتار متفاوتی دارند.

کوانتش و موازنه کیفیت

توسعه‌دهندگان برای جای دادن این غول‌ها در سخت‌افزارهای مصرفی از کوانتش (Quantization) استفاده می‌کنند؛ یعنی فشرده‌سازی مدل با فدا کردن دقت. این در واقع معامله‌ای است که در آن دقت را با اندازه عوض می‌کنیم. داده‌های مخزن llama.cpp هزینه این معامله را برای یک مدل ۷ میلیارد پارامتری نشان می‌دهد:

  • کوانتش Q4_K_M: وزن‌ها به ۳.۸ گیگابایت می‌رسند، اما مدل- ۰.۰۵۳۵ در perplexity را از دست می‌دهد.
  • کوانتش Q8_0: وزن‌ها در ۶.۷ گیگابایت می‌مانند و افت کیفیت ناچیز (+۰.۰۰۰۴) است.

اگرچه فشرده‌سازی تهاجمی گیگابایت‌ها را ذخیره می‌کند و افت‌های فوری در کیفیت پیش‌بینی نسبتاً کوچک است، اما این تفاوت صفر نیست. در گفتگوهای طولانی و پیچیده، این افت‌های کوچک انباشته شده و منجر به کاهش محسوس انسجام متن می‌شود. در واقع شما عمق شناختی را فدای توانایی بوت شدن نرم‌افزار می‌کنید.

شبکه عصبی بدون اینترنت در ۲۰۲۶: لپ‌تاپ و گوشی شما واقعاً چه توانایی‌هایی خواهند داشت

عملکرد هوش مصنوعی موبایل

دستگاه‌های اندرویدی از ML Kit GenAI API برای اجرای Gemini Nano به‌صورت کاملاً آفلاین استفاده می‌کنند. این قابلیت مجموعه‌ای از ابزارهای داخلی را فراهم می‌کند: تولید متن، خلاصه‌سازی، اصلاح املایی، بازنویسی، توصیف تصویر و بازشناسی گفتار. این تلاش برای یکپارچگی عمیق در اندروید، یادآور تلاش‌های گوگل برای کاهش اصطکاک کاربری با افزودن دکمه‌های اختصاصی Gemini در مرورگر کروم است تا دسترسی به هوش مصنوعی سریع‌تر شود. با این حال، مستندات Android Developers به یک گلوگاه حیاتی اشاره دارند: حد ورودی رسمی برای خلاصه‌سازی آفلاین تقریباً ۴,۰۰۰ توکن (حدود ۳,۰۰۰ کلمه انگلیسی) است. این محدودیت به‌طور خاص برای این API است و لزوماً سقف مطلق تمام عملکردهای Gemini Nano را تعریف نمی‌کند، اما برای کسانی که صورت‌جلسات طولانی یا مقالات مفصل را پردازش می‌کنند، یک مانع اصلی است.

رویکرد اپل در iOS 27 نیز مشابه این تقلاهای حافظه است. به گزارش MacRumors، قدرتمندترین مدل آفلاین در این نسخه به حداقل ۱۲ گیگابایت حافظه یکپارچه (Unified Memory) نیاز دارد. چون آیفون ۱۷ استاندارد تنها ۸ گیگابایت رم دارد، نمی‌تواند مدل پرچمدار را به‌صورت کامل و آفلاین اجرا کند؛ این قابلیت مخصوص نسخه‌های Pro و iPhone Air است. این موضوع باعث نارضایتی مصرف‌کنندگان شد، زیرا بازاریابی «Apple Intelligence در این دستگاه» با توانایی اجرای «بزرگ‌ترین مدل آفلاین» روی همان دستگاه تفاوت داشت.

در مقابل، مدل‌های کوچک‌تر در حال رشد هستند. Simon Willison گزارش داد که Gemma 4 E2B با وزن ۲.۵۴ گیگابایت از طریق Google AI Edge Gallery روی آیفون «بسیار خوب» اجرا می‌شود و واقعاً کاربردی است. این تایید می‌کند که منطق فعلی AI موبایل این است: کلاس ۲ تا ۴ میلیارد پارامتر برای گوشی‌ها واقع‌بینانه است، اما ۲۷ میلیارد و بالاتر، نیست.

بنچمارک میان‌رده‌ها

برای کسانی که سخت‌افزار میان‌رده دارند، خانواده‌های خاصی از مدل‌ها می‌درخشند. تست Habr روی سیستمی با ۶۴ گیگابایت رم و RTX 3050 لایه‌های عملکردی متفاوتی را نشان داد: gemma3:4b در ۶ ثانیه پاسخ داد، در حالی که mistral:7b ۱۰ ثانیه زمان برد. برای کارهای تخصصی، qwen3-coder:30b بهترین نتایج را به‌طور خاص در تولید کد ارائه کرد.

دانشگاه ITMO به‌طور خاص خانواده Qwen را به عنوان انتخاب ترجیحی برای زبان روسی، کدنویسی و سناریوهای عامل‌محور (Agentic) در مقایسه با سایر مدل‌های کوچک توصیه می‌کند. برای سخت‌افزارهای فوق‌سنگین، Simon Willison اشاره کرد که Ornith-1.0 (یک مدل ۳۵ میلیارد پارامتری MoE در قالب GGUF با حجم ۲۰ گیگابایت) به سرعت خیره‌کننده‌ی ۱۰۳ توکن در ثانیه رسید و ابزارهای پیچیده با چندین فراخوانی (tool calls) را به‌راحتی مدیریت کرد، هرچند این عدد روی سخت‌افزار شخصی رده‌بالای او بود، نه یک لپ‌تاپ معمولی.

واقعیت اقتصادی

یک شکاف مالی شدید در جنبش AI محلی وجود دارد. Matthew Smith از PCWorld صریح می‌گوید: «فقط چون می‌توانید، به این معنا نیست که باید این کار را بکنید». کاربران Tildes با داده‌های پشتیبان استدلال می‌کنند که در سخت‌افزارهای معمولی، سرعت بین ۲ تا ۷ توکن در ثانیه است و پنجره متنی (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد — به ۵۰ تا ۶۰ هزار توکن محدود است، در حالی که سرویس‌های ابری ۲۰۰ هزار توکن می‌دهند. جالب است که در محیط‌های ابری نیز، تعریف دقیق محدودیت‌ها و متغیرهای ورودی بیشترین تأثیر را بر کیفیت خروجی مدل‌ها دارد و نشان می‌دهد مدیریت ورودی در هر دو محیط محلی و ابری حیاتی است. علاوه بر این، کوانتش Q4 می‌تواند کیفیت را تقریباً ۱۰٪ کاهش دهد.

از منظر هزینه خالص، اشتراک ۲۰ یورویی Claude Pro اغلب ارزان‌تر از ارتقای سخت‌افزاری لازم برای اجرای یک مدل محلی جدی است. این یک مسئله اقتصادی محض است: اگر هدف کیفیت حداکثری و پنجره متنی عظیم باشد، AI آفلاین هم در قیمت و هم در قابلیت شکست می‌خورد.

اما این اقتصاد، «پاداش حریم خصوصی» را نادیده می‌گیرد. همان‌طور که Elizabeth Seger از Demos به MIT Technology Review گفت: «اگر چیزی رایگان است، شما محصول هستید». برای کاربرانی که درباره علائم پزشکی بحث می‌کنند، پیش‌نویس قراردادهای حساس را می‌نویسند یا لاگ‌های خصوصی را مدیریت می‌کنند، هزینه سخت‌افزار یک پرداخت یک‌باره برای حاکمیت دیجیتال دائمی است. در این سیستم مختصاتی، ارزش حریم خصوصی بر راحتیِ ابر غلبه می‌کند.

راهنمای عملی پیاده‌سازی

برای اجتناب از تأخیرهای شدید مشاهده شده در تست‌های PCWorld، کاربران باید مدل‌ها را بر اساس بنچمارک‌های زیر با رم خود تطبیق دهند:

  • ۲-۴ میلیارد (Gemma E2B و مشابه آن): وزن حدود ۲.۵ تا ۳ گیگابایت. توصیه می‌شود Q4_K_M یا Q5 استفاده شود. روی گوشی‌ها و لپ‌تاپ‌های ضعیف برای کارهای کوتاه راحت اجرا می‌شود.
  • ۷-۸ میلیارد: ۴.۵ تا ۵ گیگابایت برای وزن‌ها. رم ۱۶ گیگابایت حداقل مطلق است (با بستن تمام برنامه‌های دیگر)؛ ۳۲ گیگابایت حداقل واقعی برای کار روزمره است. برای سرعت Q4_K_M (۳.۸ گیگابایت) و برای دقت Q8_0 (۶.۷ گیگابایت) را انتخاب کنید. عملکرد معمول: ۶ تا ۱۰ ثانیه برای درخواست‌های ساده و ۲ تا ۷ توکن بر ثانیه در گفتگو.
  • ۱۴ میلیارد: حدود ۱۴ گیگابایت. Q4_K_M روی ۱۶ گیگابایت رم تنها در صورتی کار می‌کند که سیستم تقریباً خالی باشد.
  • ۲۷ میلیارد: حدود ۱۶.۸ گیگابایت. Q4_K_M می‌تواند به ۲۵.۵۷ توکن در ثانیه برسد، اما فقط روی مک‌های رده‌بالا یا RTX 5090، نه لپ‌تاپ‌های معمولی.
  • ۳۰ میلیارد (qwen3-coder:30b): حدود ۱۸ گیگابایت در Q4. طبق گزارش Habr برای کدنویسی برتر است اما رم بالایی می‌خواهد.
  • ۳۵ میلیارد MoE (Ornith-1.0): ۲۰ گیگابایت (GGUF) با کوانتش Q4_K_M. قادر به تولید حدود ۱۰۳ توکن در ثانیه روی سخت‌افزار حرفه‌ای؛ عالی برای سناریوهای عامل‌محور.
  • ۷۰ میلیارد به بالا: وزن ۴۰ گیگابایت+. کوانتش Q4. تأخیر بسیار شدید (۱.۶۸ توکن در ثانیه)؛ در لپ‌تاپ‌ها به‌شدت اجتناب شود.

برای تایید پایداری، متدولوژی vc.ru پیشنهاد می‌کند ۲۰ تا ۵۰ نمونه مرجع بسازید و مدل را در چهار معیار: کیفیت خروجی، سرعت، مصرف منابع و پایداری بسنجید. این یک ساعت حسابرسی، شما را از خستگیِ داشتن دستیاری که فقط سلام می‌کند اما در کارهای فنی تخصصی که برای آن نصب شده بود شکست می‌خورد، نجات می‌دهد.

شبکه عصبی بدون اینترنت در ۲۰۲۶: لپ‌تاپ و گوشی شما واقعاً چه کارهایی می‌توانند بکنند

استراتژی ترکیبی

تقسیم وظایف بین مدل‌های محلی و ابری، بهین‌ترین مسیر است. از مدل‌های ۷ یا ۲۷ میلیارد پارامتری محلی برای مواردی که باید خصوصی بماند و نیاز به استدلال پیچیده ندارد استفاده کنید: مثلاً خلاصه‌سازی یک ایمیل خصوصی، نوشتن پیش‌نویس یک تابع یا ایده‌پردازی برای یک نامه حساس. برای تحلیل‌های با زمینه بالا (بالای ۶۰ هزار توکن) یا استدلال‌های عمیق، به ابر بازگردید و در عین حال از وابستگی کامل به یک فروشنده (Vendor Lock-in) دوری کنید.

برای کسانی که در مناطق دارای محدودیت پرداخت هستند، ابزارهایی مثل provod.ai دسترسی به GPT، Claude و Gemini را از طریق یک API واحد با پرداخت‌های ارز محلی (روبل، SBP یا فاکتور) فراهم می‌کنند تا نیاز به کارت‌های بانکی خارجی و VPN حذف شود. این موضوع اصطکاک اقتصادی ذکر شده در Tildes را برای بازار روسیه حل می‌کند، اما انتخاب بنیادی بین حریم خصوصی آفلاین و قدرت ابر را تغییر نمی‌دهد.

اگر آماده انتقال داده‌هایتان به محیط آفلاین هستید، ابتدا رم خود را حسابرسی کنید و یک مدل ۷ میلیاردی با کوانتش Q4_K_M را تست کنید تا ببینید آیا دستاوردهای حریم خصوصی، توجیه کاهش سرعت را می‌کند یا خیر.

گام بعدی شما

  • رم سیستم خود را بررسی کرده و بر اساس جدول بالا، مدل متناسب را انتخاب کنید.
  • مدل‌های ۷-۸ میلیارد پارامتری را با دو سطح کوانتش Q4 و Q8 مقایسه کنید تا نقطه تعادل سرعت و دقت خود را بیابید.
  • برای کارهای حساس، استراتژی ترکیبی (Local-First) را جایگزین تکیه کامل به ابری کنید.

اما داستان سخت‌افزاری این تحول در تراشه‌های نسل جدید حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی NPUهای جدید در پردازنده‌های ۲۰۲۶ مراجعه کنید.

چرا این موضوع مهم است؟

این تحلیل با تکیه بر داده‌های سخت‌افزاری نشان می‌دهد که برای دستیابی به استقلال دیجیتال، هزینه سخت‌افزار یک هزینه سرمایه‌ای است که جایگزین هزینه‌های جاری اشتراکی می‌شود. در واقع، تخصص در انتخاب مدل متناسب با مقدار VRAM، تعیین‌کننده بهره‌وری کاربر در عصر AI محلی است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های پرداخت دلاری و تحریم APIها دست‌ و پنجه نرم می‌کنند، استقرار مدل‌های محلی روی سخت‌افزارهای موجود، تنها راه دسترسی پایدار و بدون سانسور به مدل‌های پیشرفته است.

·نگاه ما
تحریریه دات‌هوش

اشتباه استراتژیک بسیاری از کاربران این است که مدل‌های محلی را به عنوان جایگزین کامل ابری می‌بینند، در حالی که واقعیت سخت‌افزاری، مدل‌های محلی را به «تخصصی برای حریم خصوصی» تبدیل کرده است. در حال حاضر، داشتن ۳۲ گیگابایت رم دیگر یک امتیاز لوکس نیست، بلکه «بهای ورود» برای هر کسی است که می‌خواهد هوش مصنوعی را بدون وابستگی به سرورهای خارجی به‌طور کاربردی به کار بگیرد. انتقال از مدل‌های عمومی به مدل‌های کوچک‌تر و تخصصی (SLM)، تنها راه نجات برای سخت‌افزارهای مصرفی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.