پرش به محتوای اصلی
پرش به محتوای مقاله

مک‌مینی M4 Pro با مدل‌های MoE حاکمیت محلی بر هوش مصنوعی را ممکن کرد

·۱۱ شهریور ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
راهنما
تنظیم مدل محلی روی مک مینی M4 Pro
تنظیم مدل محلی روی مک مینی M4 Pro
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده عملی از معماری MoE برای اجرای مدل‌های ۳۵ میلیارد پارامتری روی رم ۴۸ گیگابایتی مک‌مینی، بدون افت شدید کیفیت و با تأخیر نزدیک به صفر.

تصور کنید تمام قدرت پردازشی یک مرکز داده کوچک را در ابعادی کوچک روی میز کارتان داشته باشید که هیچ داده‌ای از آن خارج نمی‌شود. با یک مک‌مینی M4 Pro و ۴۸ گیگابایت حافظه یکپارچه، شما تنها در ۳۰ دقیقه یک هاب هوش مصنوعی خصوصی و قدرتمند برای تمام دستگاه‌های خانه یا دفترتان می‌سازید. با بهره‌گیری از مدل‌های ترکیب خبره‌ها (Mixture of Experts یا MoE)، این پیکربندی سخت‌افزاری اجازه می‌دهد کارهای پیچیده استدلالی و وظایف روتین بدون ارسال حتی یک توکن (Token) — تکه‌های کوچکی از متن شبیه برش‌های کیک — به ابرهای متمرکز شخص ثالث انجام شود.

بسیاری از کاربران اکنون با «زمین‌های اجاره‌ای» APIها دست‌وپنجه نرم می‌کنند؛ جایی که قیمت‌ها غیرقابل‌پیش‌بینی است، مدل‌ها ناگهان دچار افت کیفیت می‌شوند و ریسک دائمی محدودیت‌های استفاده وجود دارد. برای مثال، نویسنده این گزارش به‌طور منظم دو اشتراک مجزای ۲۰۰ دلاری در ماه را به حداکثر ظرفیت می‌رساند، اما متوجه شد که کیفیت مدل‌ها بدون اطلاع او تغییر می‌کند؛ گاهی عملکرد عالی داشتند و گاهی به‌طور محسوسی افت می‌کردند. این چالش‌ها یادآور اشتباهات رایج در گیت‌وی‌های هوش مصنوعی است که در آن کاهش هزینه بدون ارزیابی دقیق کیفیت منجر به افت تجربه کاربری می‌شود. برای متخصصانی که با داده‌های حساس مشتری، جریان‌های کاری اختصاصی یا کدهای محرمانه کار می‌کنند، ریسک امنیتی عملیاتی استفاده از APIهای شخص ثالث یک تصمیم بازگشت‌ناپذیر است؛ زیرا وقتی داده‌ها آپلود شوند، دیگر نمی‌توان آن‌ها را پس گرفت. شما هرگز نمی‌دانید که این شرکت‌ها چگونه داده‌های شما را می‌فروشند، افشا می‌کنند یا دسترسی به آن‌ها را محدود می‌کنند.

فراتر از حریم خصوصی، مسئله حاکمیت هوش مصنوعی (AI Sovereignty) مطرح است. محدودیت‌های دولتی بر عرضه مدل‌ها می‌تواند در یک لحظه اتفاق بیفتد و جریان‌های کاری وابسته به مدل‌های ابری را در وضعیت بحرانی قرار دهد. مالکیت سخت‌افزار به این معناست که هوش مصنوعی شما فارغ از اتصال به اینترنت یا تغییرات ژئوپلیتیکی کار می‌کند. این رویکرد مشابه تلاش شرکت پرتپلکسی برای محلی‌سازی استنتاج عامل‌ها از طریق سخت‌افزارهای قابل حمل است تا وابستگی به زیرساخت‌های ابری کاهش یابد. اگر مدل ابری که به آن وابسته هستید به هر دلیلی توسط یک دولت محدود شود، هیچ کنترلی روی آن ندارید، مگر اینکه سخت‌افزار خودتان را در اختیار داشته باشید.

زیرساخت سخت‌افزاری و نرم‌افزاری

قلب این سیستم، M4 Pro Mac mini است که سرور استنتاج oMLX را اجرا می‌کند؛ سروری که به‌طور خاص برای بهینه‌سازی روی تراشه‌های اپل سیلیکون طراحی شده است. این سرور با بهینه‌سازی‌های خاص خود توانسته است محدودیت‌های حافظه را در اجرای مدل‌های محلی اپل به چالش بکشد. برای اتصال اکوسیستم، از Tailscale برای ایجاد یک شبکه مش خصوصی (tailnet) استفاده شده است که مک‌مینی، یک آیفون و یک مک‌بوک را به هم متصل می‌کند. این ساختار تضمین می‌کند که هیچ بخشی از سیستم در معرض اینترنت عمومی قرار نگیرد، در حالی که تمام دستگاه‌ها می‌توانند به یک نقطه انتهایی (endpoint) واحد دسترسی داشته باشند.

استراتژی مدل‌ها در این سیستم به دو وزن (weights) خاص تقسیم شده است:

  • Qwen3.6-35B-A3B-OptiQ-4bit: مدل اصلی برای هر چیزی که نیاز به استدلال عمیق یا تحلیل‌های پیچیده دارد.
  • Gemma-4-E4B-it-OptiQ-4bit: یک مدل سبک و تنظیم‌شده برای دستورات (instruction-tuned) که برای چت‌های ساده، قالب‌بندی متون و کارهای روتین به کار می‌رود.

رابط کاربری و یکپارچه‌سازی

برای تعامل با مدل‌ها، بسته به نوع وظیفه، از کلاینت‌های مختلفی استفاده شده است:

  • Hermes: به‌عنوان بک‌اند عامل (agent backend) روی مک‌مینی اجرا می‌شود. مک‌بوک از کلاینت دسکتاپ آن (که مانند یک پوسته یا shell عمل می‌کند) استفاده می‌کند و آیفون از طریق تلگرام متصل می‌شود. این امر اجازه می‌دهد یک بک‌اند مشترک، تاریخچه گفتگوها و مجموعه‌ای از مهارت‌ها در تمام دستگاه‌ها به اشتراک گذاشته شود.
  • Apollo (iOS): برای چت‌های سریع و یک‌بار مصرف که مشابه تجربه Claude است. این اپلیکیشن مستقیماً به آدرس http://[mac-mini-tailnet-url]/v1 متصل می‌شود و نیازی به کلید API یا اشتراک ماهانه ندارد. این ابزار برای کارهایی مثل «این پاراگراف را بازنویسی کن» یا «معنای این خطا چیست» ایده‌آل است.
  • Pi: به‌طور اختصاصی به‌عنوان یک عامل کدنویسی (coding agent) به کار می‌رود.
  • Raycast AI (macOS): برای کارهای تصادفی و سریع که نیازی به نصب یا باز کردن یک اپلیکیشن کامل ندارند.

رمز کارایی حافظه در معماری MoE

راز اجرای یک مدل ۳۵ میلیارد پارامتری روی ۴۸ گیگابایت رم در معماری ترکیب خبره‌ها (MoE) نهفته است. در یک مدل متراکم (Dense)، تمام پارامترها برای هر توکن فعال می‌شوند. برای مثال، یک مدل متراکم ۲۷ میلیارد پارامتری نیاز دارد که تمام ۲۷ میلیارد پارامتر برای تولید هر تکه متن در رم بارگذاری شوند.

اما در مدل Qwen3.6-35B-A3B، نام مدل مکانیسم آن را فاش می‌کند: در حالی که در مجموع ۳۵ میلیارد پارامتر در میان تمام خبره‌ها وجود دارد، در هر توکن تنها ۳ میلیارد پارامتر (بخش A3B) فعال هستند. ۳۲ میلیارد پارامتر دیگر در رم حضور دارند اما هیچ فعالیتی ندارند. این موضوع اجازه می‌دهد مدل در حالت کوانتیده ۴ بیتی، تنها ۲۰ گیگابایت فضا اشغال کند و ۲۸ گیگابایت برای سیستم‌عامل، پنجره‌های زمینه و سایر برنامه‌ها باقی بماند.

در مقابل، یک مک‌بوک ایر با ۱۶ گیگابایت رم برای اجرای یک مدل متراکم ۲۷ میلیارد پارامتری ۴ بیتی (که حدود ۱۴ گیگابایت نیاز دارد) دچار مشکل می‌شود، زیرا فضای بسیار کمی برای سیستم‌عامل باقی می‌ماند و سیستم مجبور می‌شود از SSD به‌عنوان رم (Swap) استفاده کند که سرعت را به‌شدت کاهش می‌دهد. اما چون مدل MoE 35B تنها ۳ میلیارد وزن را در هر توکن فعال می‌کند، ردپای حافظه GPU/Media آن بیشتر شبیه به یک مدل متراکم ۶ میلیارد پارامتری است و همین امر آن را روی سخت‌افزارهای با مشخصات پایین‌تر نیز قابل اجرا می‌کند.

چک‌لیست سازگاری سخت‌افزاری

طبق مستندات فنی، برای تعیین اینکه آیا یک مدل روی سخت‌افزار خاص شما کار می‌کند یا خیر، این مراحل را دنبال کنید:

  • بررسی حجم فایل کوانتیده: یک مدل ۴ بیتی تقریباً برابر با تعداد پارامترها به گیگابایت است (مثلاً ۳۵ میلیارد پارامتر ≈ ۱۷ تا ۲۰ گیگابایت).
  • کسر فضای سیستم‌عامل: macOS معمولاً روی اپل سیلیکون ۶ تا ۸ گیگابایت رم اشغال می‌کند.
  • برنامه‌ریزی برای پنجره‌های زمینه: هر چند هزار توکن، مگابایت‌هایی به KV cache اضافه می‌کند؛ بنابراین ۸ تا ۱۶ گیگابایت برای گفتگوهای طولانی در نظر بگیرید.
  • تأیید پارامترهای فعال: در مدل‌های MoE، تعداد کل پارامترها را نادیده بگیرید و برای درک حافظه واقعی استنتاج، به عدد «پارامترهای فعال» توجه کنید.

اگر مجموع این موارد با یک حاشیه امنیت ۱۰ تا ۱۵ درصدی در حافظه یکپارچه جای بگیرد، سیستم از Swap کردن روی SSD اجتناب می‌کند. هر چیزی که به ظرفیت کامل نزدیک‌تر باشد، باعث فعال شدن Swap خواهد شد.

مزایای عملیاتی و اقتصادی

میزبانی محلی اقتصاد هوش مصنوعی را تغییر می‌دهد. به‌جای پرداخت اشتراک‌های ماهانه متغیر — که در این مورد خاص به ۴۰۰ دلار در ماه می‌رسید — هزینه تنها به خرید اولیه سخت‌افزار و مصرف برق محدود می‌شود. هر استنتاج بعدی رایگان است و پیش‌بینی‌پذیری کامل هزینه‌ها را فراهم می‌کند.

تأخیر (Latency) نیز به‌طور قابل‌توجهی کاهش می‌یابد. چون هیچ رفت‌وبرگشتی به سرورهای دوردست وجود ندارد، موتور رسانه‌ای M4 Pro پاسخ‌هایی را ارائه می‌دهد که برای اکثر پرامپت‌ها آنی به نظر می‌رسند. علاوه بر این، oMLX قابلیت پایداری KV cache را پیاده‌سازی کرده و بلوک‌ها را روی SSD ذخیره می‌کند. وقتی یک عامل کدنویسی به زمینه‌های قبلی در یک جلسه بازمی‌گردد، پیشوندها در عرض چند میلی‌ثانیه از دیسک بازیابی می‌شوند، به‌جای اینکه دوباره محاسبه شوند.

نگهداری و به‌روزرسانی

به‌روزرسانی این سیستم یک فرآیند بسیار ساده است که به کاربر اجازه می‌دهد با سرعت بالای دنیای هوش مصنوعی همگام بماند. جریان کاری به این صورت است:

۱. دانلود مدل جدید در دایرکتوری ~/models/ (سرور oMLX یک مرورگر داخلی HuggingFace برای این کار دارد).
۲. oMLX به‌طور خودکار مدل را از دایرکتوری شناسایی می‌کند.
۳. انتخاب مدل در اپلیکیشن oMLX یا ری‌استارت کردن سرور.
۴. به‌روزرسانی انتخاب مدل در Hermes، Pi، Raycast و Apollo.

این فرآیند را می‌توان از طریق CLI و با SSH کردن به مک‌مینی از هر دستگاهی در شبکه Tailscale مدیریت کرد. این انعطاف‌پذیری حیاتی است زیرا فاصله بین مدل‌های محلی و مدل‌های API در حال بسته شدن است. با کوانتیزاسیون ۴ بیتی از OptiQ (که برای اکثر لایه‌ها از ۴ بیت و برای لایه‌های حساس از ۸ بیت استفاده می‌کند)، مدل 35B-A3B تنها ۱ تا ۲ امتیاز در بنچمارک‌ها نسبت به نسخه BF16 فشرده‌نشده از دست می‌دهد. این یک معاوضه پذیرفتنی است تا به‌جای ۷۰ گیگابایت، از ۴۸ گیگابایت حافظه استفاده شود.

این ساختار قرار نیست جایگزین مدل‌های پیشرو مثل GPT-5 یا Claude Opus برای سخت‌ترین ۲۰٪ کارهای دنیا شود، بلکه ۸۰٪ نیازهای روزمره را به‌صورت رایگان و در حریم خصوصی کامل پوشش می‌دهد. در حالی که نویسنده همین حالا یک Mac Studio M5 Max با ۱۲۸ گیگابایت رم برای اواخر امسال سفارش داده است، اما در حال حاضر مک‌مینی M4 Pro بدون هیچ فشار اضافه‌ای از پس این حجم از کار برمی‌آید.

گام بعدی شما

  • بررسی مدل‌های MoE در HuggingFace برای یافتن مدل‌هایی با پارامترهای فعال پایین.
  • نصب Tailscale برای ایجاد شبکه خصوصی بین دستگاه‌های اپل خود.
  • تست سرور oMLX برای بهینه‌سازی استنتاج روی تراشه‌های Apple Silicon.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیاده‌سازی ثابت می‌کند که حاکمیت داده‌ها دیگر یک رویای تئوریک نیست و با سخت‌افزارهای موجود، تخصص در استقرار محلی مدل‌ها به یک مزیت رقابتی تبدیل می‌شود. اعتماد به سیستم‌های محلی، ریسک نشت داده‌های حساس شرکتی را به صفر می‌رساند.

تأثیر برای ایران

این روش برای توسعه‌دهندگان ایرانی که با محدودیت‌های پرداخت ارزی و تحریم‌های API دست‌وپنجه نرم می‌کنند، بهترین راه برای داشتن هوش مصنوعی سطح بالا و رایگان است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر مدل‌های MoE نشان می‌دهد که مسیر بهینه‌سازی از «بزرگ‌تر کردن مدل» به «هوشمندتر کردن فعال‌سازی پارامترها» تغییر کرده است. این رویکرد باعث می‌شود سخت‌افزارهای مصرف‌کننده (Consumer Grade) بتوانند کارهایی را انجام دهند که تا سال پیش نیاز به سرورهای سازمانی داشت. در واقع، مرز بین رایانش لبه و مراکز داده در حال محو شدن است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.