پرش به محتوای اصلی
پرش به محتوای مقاله

درون مکانیزم استریم وزن‌ها از SSD برای اجرای AI بر روی موبایل

·۱۳ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
لوگوی Swiftlet: پرنده‌ای در حال پرواز با بال‌های کشیده و دم بلند، نماد چابکی و سرعت.
لوگوی Swiftlet: پرنده‌ای در حال پرواز با بال‌های کشیده و دم بلند، نماد چابکی و سرعت.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل حافظه RAM با استریم مستقیم از SSD برای مدل‌های MoE در مقیاس ۸۰ میلیارد پارامتر؛ اقدامی که برای نخستین بار اجرای بومی مدل‌های کلاس Heavyweight را روی سخت‌افزار موبایل (آیفون) ممکن کرد.

تصور کنید یک مدل زبانی عظیم با ۸۰ میلیارد پارامتر را روی لپ‌تاپی اجرا کنید که رم آن برای چنین کاری ناکافی است. این کابوس سخت‌افزاری اکنون به واقعیت تبدیل شده است؛ Swiftlet با رویکردی جسورانه، دیوار رم را فرو ریخت تا مدل‌های پیشرو بر روی سخت‌افزارهای مصرف‌کننده جای بگیرند.

طبق اعلام توسعه‌دهندگان در ۳ اوت ۲۰۲۶، این زمان اجرای (Runtime) جدید که با زبان Swift و چارچوب Metal ساخته شده، به جای نگه داشتن کل مدل در حافظه، وزن‌های ترکیب خبره‌ها (Mixture-of-Experts یا MoE) — شبیه به یک کتابخانه بزرگ که فقط کتاب‌های مورد نیاز در هر لحظه روی میز کار می‌روند — را مستقیماً از حافظه SSD استریم می‌کند. به همین دلیل، اجرای یک مدل ۸۰ میلیارد پارامتری روی یک مک استاندارد، تنها به ۴.۳ گیگابایت رم نیاز دارد. این رویکرد به مدیریت بهینه‌تر مدل‌های حجیم کمک می‌کند، مشابه آنچه در رویکرد مهندسی Meituan برای توسعه مدل LongCat-2.0 با معماری MoE شاهد بودیم.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی محدودیت‌های سخت‌افزاری مدل‌های بازمتن اشاره کردیم، «دیوار رم» همیشه مانع اصلی بود. اکثر مدل‌های پیشرفته برای اجرا به ده‌ها گیگابایت حافظه یکپارچه نیاز دارند که عملاً آن‌ها را از آیفون‌ها و مک‌های میان‌رده دور می‌کرد. Swiftlet با تبدیل SSD به امتدادی از استخر حافظه برای اجزای پراکنده مدل، این مشکل را حل کرده است.

این راهکار به‌طور خاص برای خانواده مدل‌های Qwen3-Next و مدل‌های ترکیبی Qwen3.5/3.6 MoE طراحی شده است. از آنجا که این مدل‌ها در هر لحظه تنها بخش کوچکی از پارامترهای خود را فعال می‌کنند، Swiftlet فقط «هسته متراکم» را در رم نگه می‌دارد و خبره‌ها یا متخصصان مورد نیاز را به‌صورت لحظه‌ای و در جریان (on the fly) فراخوانی می‌کند.

بنچمارک‌های سخت‌افزاری و عملکرد

بر اساس مستندات پروژه در گیت‌هاب، شکاف عمیقی بین فضای اشغال‌شده در دیسک و رم فعال وجود دارد:

  • مدل ۴-بیتی Qwen3.6-35B-A3B: ۱۸ گیگابایت فضای دیسک اشغال می‌کند اما تنها ۲.۶ گیگابایت رم مصرف می‌کند. این مدل روی مک‌های M5 سرعتی بین ۷ تا ۱۱ توکن در ثانیه ارائه می‌دهد.
  • مدل Qwen3-Next-80B-A3B: ۴۲ گیگابایت فضای دیسک می‌طلبد اما اوج مصرف رم آن تنها ۴.۳ گیگابایت است. سرعت تولید متن در این حالت روی همان سخت‌افزار بین ۴.۵ تا ۵ توکن در ثانیه است.

شگفت‌انگیزترین بخش، ادغام با آیفون ۱۷ است. مدل ۳۵ میلیارد پارامتری به‌طور بومی روی گوشی با مصرف حدود ۲.۵ گیگابایت رم و سرعت ۱ توکن در ثانیه اجرا می‌شود. توسعه‌دهنده خاطرنشان کرده که احتمالاً این نخستین بار است که مدلی در این کلاس، به‌طور بومی روی یک دستگاه موبایل اجرا می‌شود.

جزئیات معماری و فنی

Swiftlet ماهیت پراکندگی بالای پشته‌های ترکیبی Qwen را مدیریت می‌کند. برای درک این موضوع باید به ساختار مدل نگاه کرد: در مدل ۸۰ میلیارد پارامتری، هر لایه توکن‌ها را به ۱۰ خبره از میان ۵۱۲ خبره هدایت می‌کند؛ در حالی که مدل ۳۵ میلیارد پارامتری، توکن‌ها را به ۸ خبره از میان ۲۵۶ خبره می‌فرستد. برای حفظ کارایی، این سامانه بر محورهای زیر استوار است:

  • حضور هسته متراکم (Dense Core Residency): وزن‌های مربوط به توجه (Attention)، پروژکشن‌های DeltaNet، روتورها، خبره‌های مشترک (shared experts) و بردار معنایی (Embedding) — مثل کارت شناسایی عددی هر واژه که همسایگانش را می‌شناساند — همیشه در رم می‌مانند. این بخش برای مدل ۳۵ میلیارد پارامتری حدود ۱.۳ گیگابایت و برای مدل ۸۰ میلیارد پارامتری ۲.۵ گیگابایت فضای رم (در حالت کوانتش ۴-بیتی) می‌گیرد.
  • کانتینر qpack.: این فرمت سفارشی، ده‌ها هزار خبره مسیریابی شده را در بلوک‌هایی با گام ثابت (fixed-stride blobs) بسته‌بندی می‌کند. این کار تضمین می‌کند که فراخوانی هر خبره دقیقاً با یک دستور pread از SSD انجام شود و از مشکلات مربوط به mmap و تلاطم کش صفحه (page-cache thrash) جلوگیری شود.
  • بهینه‌سازی Metal: کل مسیر پیشرو (Forward Pass) روی Metal با شیدرهای کامپایل‌شده در زمان اجرا اجرا می‌شود. این رویکرد نیاز به ابزارهای Metal در زمان ساخت (build time) را حذف می‌کند و اجازه می‌دهد یک کد یکسان هم روی macOS و هم روی iOS اجرا شود.
  • مدیریت وضعیت (State Management): حدود ۷۵٪ از لایه‌ها از توجه خطی Gated DeltaNet با یک وضعیت بازگشتی (recurrent state) با اندازه ثابت استفاده می‌کنند. در نتیجه، برخلاف مدل‌های سنتی، برای این لایه‌ها هیچ KV Cache رو به رشدی وجود ندارد و طول زمینه (context length) تأثیری بر مصرف حافظه این بخش ندارد. این بهینه‌سازی در مدیریت حافظه، یادآور تلاش‌هایی است که در معماری مدل LFM2.5 برای پردازش متون طولانی برای حذف وابستگی‌های سنگین سخت‌افزاری صورت گرفت.

برای حفظ سرعت، سیستم از لایه‌های بهینه‌سازی متعددی استفاده می‌کند، از جمله یک استخر محدود که از الگوریتم اخراج بر اساس «کم‌ترین دفعات استفاده» (LFU) و تازگی (recency) برای نگه داشتن خبره‌های «داغ» در رم بهره می‌برد. تست‌های عملکرد نشان می‌دهد که اندازه کش تأثیر چندانی بر سرعت ندارد — با نرخ命中 (hit rate) بین ۴۳٪ تا ۷۰٪ — زیرا SSDهای اپل به‌طور موثری افت‌های کش را جذب می‌کنند.

اعتبارسنجی و صحت خروجی

برای تضمین قابلیت اطمینان (reliability) خروجی‌های استریم شده، هر لایه از مسیر پیشرو — از جمله بازگشت Gated DeltaNet، توجه Gated GQA و مسیریابی پراکنده MoE — با پیاده‌سازی‌های مرجع mlx-lm اعتبارسنجی شده است. این بررسی با استفاده از نمونه‌های ثابت (fixtures) در هر لایه و در هر دو حالت f32 و int4 کوانتیده انجام شده است.

همچنین رمزگشایی افزایشی (Incremental decoding) — عملیاتی که مدل در آن جواب را تولید می‌کند — در برابر پردازش کل توالی‌ها تست شده است. علاوه بر این، هسته‌های Metal در برابر یک مرجع دقیق CPU آزمایش شده‌اند و هسته‌های سریع و اسکالر GPU تایید شده‌اند که خروجی‌های یکسانی تولید می‌کنند. کانتینرها نیز از نظر بایتی در برابر نقاط بازرسی (checkpoints) منبع قابل تأیید هستند؛ این یعنی جایگذاری استریم هرگز معناشناسی مدل را تغییر نمی‌دهد و یک خبره چه از کش خوانده شود و چه از دیسک، پاسخ یکسانی می‌دهد.

دسترسی و ادغام در اکوسیستم

Swiftlet به‌جای یک اپلیکیشن واحد، به صورت یک اکوسیستم منعطف عرضه شده است. این سیستم در درجه اول به عنوان یک کتابخانه از طریق بسته SwiftletCore طراحی شده است که به برنامه‌نویسان اجازه می‌دهد قابلیت‌هایی مثل چت با دلتاهای استریم شده، کش مکالمات و مدیریت فشار رم (memory-pressure handling) را پیاده کنند.

راه‌های دسترسی به این فناوری عبارتند از:

  • رابط خط فرمان (CLI): ابزارهایی مانند swiftlet chat و swiftlet generate برای بنچمارک محلی فراهم شده‌اند. همچنین ابزار swiftlet-repack کانتینرها را از نقاط بازرسی MLX می‌سازد و از استریم قابل بازیابی (resumable) مستقیماً از Hugging Face پشتیبانی می‌کند.
  • سرور: ابزار swiftlet-server رابط OpenAI chat-completions را روی لوپ‌بک پیاده می‌کند تا هر رابط کاربری سازگار با OpenAI بتواند از مدل محلی استفاده کند.
  • اپلیکیشن Priv AI: این برنامه در iOS از SwiftletCore به عنوان موتور استفاده می‌کند. کاربران می‌توانند مدل‌های آزمایشی را از طریق منوی 'Experimental Models' در تنظیمات دانلود کنند تا بدون نیاز به سرور، روی دستگاه خود چت کنند.

برای توسعه‌دهندگانی که رویکرد متن‌باز را ترجیح می‌دهند، کد اپلیکیشن در leonickson1/localLLM در دسترس است تا بتوانند مخزن را کلون کرده، Swiftlet را ادغام کنند و آن را از طریق Xcode روی آیفون اجرا نمایند.

رابطه با TurboFieldfare

این پروژه بر پایه تز «استریم خبره‌ها» که توسط TurboFieldfare برای مدل‌های Gemma روی مک‌ها اثبات شده بود، بنا شده است. Swiftlet درس‌های طراحی مهمی از آن گرفت: استفاده از pread به جای mmap در یک استخر اسلات محدود، استفاده از LFU به همراه اخراج بر اساس تازگی، بسته‌بندی با گام ثابت و کامپایل شیدر در زمان اجرا.

با این حال، این یک پیاده‌سازی کامل و از پایه با حدود ۱۰ هزار خط کد Swift و Metal است. Swiftlet قابلیت‌های حیاتی جدیدی را معرفی می‌کند: پشتیبانی از معماری ترکیبی Qwen، محاسبات کوانتش گروهی MLX affine int4/int8 در Metal، هسته‌های با آدرس‌دهی بایتی و آفست‌های ۶۴-بیتی برای شارد‌های چند گیگابایتی، و یک مسیر سریع коопераتیو simdgroup GEMV. همچنین یک لایه کامل مدیریت جلسه چت با مدیریت قالب‌ها (Template Handling) برای نسخه‌های «متفکر» و «غیرمتفکر» Qwen و جریمه‌های حضور/تکرار (presence/frequency penalties) را اضافه کرده است.

تحلیل تحریریه

این تغییر رویکرد، نشان‌دهنده گذار از «کوانتایزیشن برای کاهش اندازه» به سمت «استریمینگ برای دسترسی‌پذیری» است. با اثبات اینکه گلوگاه دیگر مقدار رم نیست، بلکه کارایی استریم از SSD به GPU است، Swiftlet پیش‌فرض‌های مربوط به آنچه «آماده برای موبایل» (mobile-ready) است را تغییر می‌دهد.

با این حال، یک هزینه در قابلیت‌های شناختی وجود دارد. چون در هر توکن تنها حدود ۳ میلیارد پارامتر فعال هستند، این مدل‌ها نوعی «شخصیت دوگانه» نشان می‌دهند: آن‌ها تسلط زبانی و سبک نوشتاری مدل‌های غول‌پیکر را دارند، اما بازخوانی حقایق (factual recall) آن‌ها شبیه به مدل‌های بسیار کوچک‌تر است.

برای کاربر نهایی، این به معنای پیروزی بزرگ در زمینه حریم خصوصی و استقلال است. توانایی اجرای یک مدل ۳۵ یا ۸۰ میلیارد پارامتری روی گوشی به این معناست که استدلال‌های پیچیده و پیش‌نویس‌های باکیفیت دیگر نیازمند اتصال به داده یا اشتراک ماهانه در یک سرویس ابری نیستند.

گام بعدی شما

  • اگر کاربر مک M-series هستید، مدل‌های Qwen3.6 را از طریق مخزن گیت‌هاب Swiftlet تست کنید تا سرعت استنتاج محلی را بسنجید.
  • توسعه‌دهندگان iOS می‌توانند با بررسی SwiftletCore، قابلیت‌های AI سطح بالا را بدون نیاز به سرورهای ابری به اپلیکیشن‌های خود اضافه کنند.
  • برای کاهش هزات‌های API، مدل‌های MoE را به عنوان جایگزین برای وظایفی که نیاز به استدلال پیچیده اما حریم خصوصی بالا دارند، بررسی کنید.

اما داستان سخت‌افزاری این تحول با معرفی تراشه‌های جدیدتر حتی شگفت‌انگیزتر است — به تحلیل ما درباره معماری‌های NPU در پردازنده‌های اپل مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با تکیه بر تخصص در مدیریت حافظه و بهینه‌سازی Metal، استقلال کاربر را از سرورهای ابری تأمین می‌کند. اکنون استدلال‌های پیچیده در سطح مدل‌های ۸۰ میلیارد پارامتری، بدون نیاز به اشتراک ماهیانه یا اتصال به اینترنت، در جیب کاربر جای می‌گیرند.

تأثیر برای ایران

به دلیل ماهیت Open Weights مدل‌های Qwen و اجرای محلی Swiftlet، برنامه‌نویسان ایرانی می‌توانند بدون درگیر شدن با تحریم‌های API و هزینه‌های دلاری، مدل‌های پیشرفته را روی سخت‌افزارهای موجود اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

Swiftlet پارادایم «کوانتش برای کاهش اندازه» را به «استریم برای دسترسی» تغییر می‌دهد. این یعنی گلوگاه AI دیگر حجم رم نیست، بلکه پهنای باند SSD به GPU است. با این حال، کاربر باید بداند که این مدل‌های ترکیبی هرچند روان صحبت می‌کنند، اما به دلیل فعال بودن تنها ۳ میلیارد پارامتر در هر توکن، حافظه的事实 (factual recall) آن‌ها ضعیف‌تر از مدل‌های متراکم غول‌پیکر است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.