تصور کنید یک مدل زبانی عظیم با ۸۰ میلیارد پارامتر را روی لپتاپی اجرا کنید که رم آن برای چنین کاری ناکافی است. این کابوس سختافزاری اکنون به واقعیت تبدیل شده است؛ Swiftlet با رویکردی جسورانه، دیوار رم را فرو ریخت تا مدلهای پیشرو بر روی سختافزارهای مصرفکننده جای بگیرند.
طبق اعلام توسعهدهندگان در ۳ اوت ۲۰۲۶، این زمان اجرای (Runtime) جدید که با زبان Swift و چارچوب Metal ساخته شده، به جای نگه داشتن کل مدل در حافظه، وزنهای ترکیب خبرهها (Mixture-of-Experts یا MoE) — شبیه به یک کتابخانه بزرگ که فقط کتابهای مورد نیاز در هر لحظه روی میز کار میروند — را مستقیماً از حافظه SSD استریم میکند. به همین دلیل، اجرای یک مدل ۸۰ میلیارد پارامتری روی یک مک استاندارد، تنها به ۴.۳ گیگابایت رم نیاز دارد. این رویکرد به مدیریت بهینهتر مدلهای حجیم کمک میکند، مشابه آنچه در رویکرد مهندسی Meituan برای توسعه مدل LongCat-2.0 با معماری MoE شاهد بودیم.
همانطور که در تحلیلهای پیشین ما دربارهی محدودیتهای سختافزاری مدلهای بازمتن اشاره کردیم، «دیوار رم» همیشه مانع اصلی بود. اکثر مدلهای پیشرفته برای اجرا به دهها گیگابایت حافظه یکپارچه نیاز دارند که عملاً آنها را از آیفونها و مکهای میانرده دور میکرد. Swiftlet با تبدیل SSD به امتدادی از استخر حافظه برای اجزای پراکنده مدل، این مشکل را حل کرده است.
این راهکار بهطور خاص برای خانواده مدلهای Qwen3-Next و مدلهای ترکیبی Qwen3.5/3.6 MoE طراحی شده است. از آنجا که این مدلها در هر لحظه تنها بخش کوچکی از پارامترهای خود را فعال میکنند، Swiftlet فقط «هسته متراکم» را در رم نگه میدارد و خبرهها یا متخصصان مورد نیاز را بهصورت لحظهای و در جریان (on the fly) فراخوانی میکند.
بنچمارکهای سختافزاری و عملکرد
بر اساس مستندات پروژه در گیتهاب، شکاف عمیقی بین فضای اشغالشده در دیسک و رم فعال وجود دارد:
- مدل ۴-بیتی Qwen3.6-35B-A3B: ۱۸ گیگابایت فضای دیسک اشغال میکند اما تنها ۲.۶ گیگابایت رم مصرف میکند. این مدل روی مکهای M5 سرعتی بین ۷ تا ۱۱ توکن در ثانیه ارائه میدهد.
- مدل Qwen3-Next-80B-A3B: ۴۲ گیگابایت فضای دیسک میطلبد اما اوج مصرف رم آن تنها ۴.۳ گیگابایت است. سرعت تولید متن در این حالت روی همان سختافزار بین ۴.۵ تا ۵ توکن در ثانیه است.
شگفتانگیزترین بخش، ادغام با آیفون ۱۷ است. مدل ۳۵ میلیارد پارامتری بهطور بومی روی گوشی با مصرف حدود ۲.۵ گیگابایت رم و سرعت ۱ توکن در ثانیه اجرا میشود. توسعهدهنده خاطرنشان کرده که احتمالاً این نخستین بار است که مدلی در این کلاس، بهطور بومی روی یک دستگاه موبایل اجرا میشود.
جزئیات معماری و فنی
Swiftlet ماهیت پراکندگی بالای پشتههای ترکیبی Qwen را مدیریت میکند. برای درک این موضوع باید به ساختار مدل نگاه کرد: در مدل ۸۰ میلیارد پارامتری، هر لایه توکنها را به ۱۰ خبره از میان ۵۱۲ خبره هدایت میکند؛ در حالی که مدل ۳۵ میلیارد پارامتری، توکنها را به ۸ خبره از میان ۲۵۶ خبره میفرستد. برای حفظ کارایی، این سامانه بر محورهای زیر استوار است:
- حضور هسته متراکم (Dense Core Residency): وزنهای مربوط به توجه (Attention)، پروژکشنهای DeltaNet، روتورها، خبرههای مشترک (shared experts) و بردار معنایی (Embedding) — مثل کارت شناسایی عددی هر واژه که همسایگانش را میشناساند — همیشه در رم میمانند. این بخش برای مدل ۳۵ میلیارد پارامتری حدود ۱.۳ گیگابایت و برای مدل ۸۰ میلیارد پارامتری ۲.۵ گیگابایت فضای رم (در حالت کوانتش ۴-بیتی) میگیرد.
- کانتینر qpack.: این فرمت سفارشی، دهها هزار خبره مسیریابی شده را در بلوکهایی با گام ثابت (fixed-stride blobs) بستهبندی میکند. این کار تضمین میکند که فراخوانی هر خبره دقیقاً با یک دستور
preadاز SSD انجام شود و از مشکلات مربوط بهmmapو تلاطم کش صفحه (page-cache thrash) جلوگیری شود. - بهینهسازی Metal: کل مسیر پیشرو (Forward Pass) روی Metal با شیدرهای کامپایلشده در زمان اجرا اجرا میشود. این رویکرد نیاز به ابزارهای Metal در زمان ساخت (build time) را حذف میکند و اجازه میدهد یک کد یکسان هم روی macOS و هم روی iOS اجرا شود.
- مدیریت وضعیت (State Management): حدود ۷۵٪ از لایهها از توجه خطی Gated DeltaNet با یک وضعیت بازگشتی (recurrent state) با اندازه ثابت استفاده میکنند. در نتیجه، برخلاف مدلهای سنتی، برای این لایهها هیچ KV Cache رو به رشدی وجود ندارد و طول زمینه (context length) تأثیری بر مصرف حافظه این بخش ندارد. این بهینهسازی در مدیریت حافظه، یادآور تلاشهایی است که در معماری مدل LFM2.5 برای پردازش متون طولانی برای حذف وابستگیهای سنگین سختافزاری صورت گرفت.
برای حفظ سرعت، سیستم از لایههای بهینهسازی متعددی استفاده میکند، از جمله یک استخر محدود که از الگوریتم اخراج بر اساس «کمترین دفعات استفاده» (LFU) و تازگی (recency) برای نگه داشتن خبرههای «داغ» در رم بهره میبرد. تستهای عملکرد نشان میدهد که اندازه کش تأثیر چندانی بر سرعت ندارد — با نرخ命中 (hit rate) بین ۴۳٪ تا ۷۰٪ — زیرا SSDهای اپل بهطور موثری افتهای کش را جذب میکنند.
اعتبارسنجی و صحت خروجی
برای تضمین قابلیت اطمینان (reliability) خروجیهای استریم شده، هر لایه از مسیر پیشرو — از جمله بازگشت Gated DeltaNet، توجه Gated GQA و مسیریابی پراکنده MoE — با پیادهسازیهای مرجع mlx-lm اعتبارسنجی شده است. این بررسی با استفاده از نمونههای ثابت (fixtures) در هر لایه و در هر دو حالت f32 و int4 کوانتیده انجام شده است.
همچنین رمزگشایی افزایشی (Incremental decoding) — عملیاتی که مدل در آن جواب را تولید میکند — در برابر پردازش کل توالیها تست شده است. علاوه بر این، هستههای Metal در برابر یک مرجع دقیق CPU آزمایش شدهاند و هستههای سریع و اسکالر GPU تایید شدهاند که خروجیهای یکسانی تولید میکنند. کانتینرها نیز از نظر بایتی در برابر نقاط بازرسی (checkpoints) منبع قابل تأیید هستند؛ این یعنی جایگذاری استریم هرگز معناشناسی مدل را تغییر نمیدهد و یک خبره چه از کش خوانده شود و چه از دیسک، پاسخ یکسانی میدهد.
دسترسی و ادغام در اکوسیستم
Swiftlet بهجای یک اپلیکیشن واحد، به صورت یک اکوسیستم منعطف عرضه شده است. این سیستم در درجه اول به عنوان یک کتابخانه از طریق بسته SwiftletCore طراحی شده است که به برنامهنویسان اجازه میدهد قابلیتهایی مثل چت با دلتاهای استریم شده، کش مکالمات و مدیریت فشار رم (memory-pressure handling) را پیاده کنند.
راههای دسترسی به این فناوری عبارتند از:
- رابط خط فرمان (CLI): ابزارهایی مانند
swiftlet chatوswiftlet generateبرای بنچمارک محلی فراهم شدهاند. همچنین ابزارswiftlet-repackکانتینرها را از نقاط بازرسی MLX میسازد و از استریم قابل بازیابی (resumable) مستقیماً از Hugging Face پشتیبانی میکند. - سرور: ابزار
swiftlet-serverرابط OpenAI chat-completions را روی لوپبک پیاده میکند تا هر رابط کاربری سازگار با OpenAI بتواند از مدل محلی استفاده کند. - اپلیکیشن Priv AI: این برنامه در iOS از SwiftletCore به عنوان موتور استفاده میکند. کاربران میتوانند مدلهای آزمایشی را از طریق منوی 'Experimental Models' در تنظیمات دانلود کنند تا بدون نیاز به سرور، روی دستگاه خود چت کنند.
برای توسعهدهندگانی که رویکرد متنباز را ترجیح میدهند، کد اپلیکیشن در leonickson1/localLLM در دسترس است تا بتوانند مخزن را کلون کرده، Swiftlet را ادغام کنند و آن را از طریق Xcode روی آیفون اجرا نمایند.
رابطه با TurboFieldfare
این پروژه بر پایه تز «استریم خبرهها» که توسط TurboFieldfare برای مدلهای Gemma روی مکها اثبات شده بود، بنا شده است. Swiftlet درسهای طراحی مهمی از آن گرفت: استفاده از pread به جای mmap در یک استخر اسلات محدود، استفاده از LFU به همراه اخراج بر اساس تازگی، بستهبندی با گام ثابت و کامپایل شیدر در زمان اجرا.
با این حال، این یک پیادهسازی کامل و از پایه با حدود ۱۰ هزار خط کد Swift و Metal است. Swiftlet قابلیتهای حیاتی جدیدی را معرفی میکند: پشتیبانی از معماری ترکیبی Qwen، محاسبات کوانتش گروهی MLX affine int4/int8 در Metal، هستههای با آدرسدهی بایتی و آفستهای ۶۴-بیتی برای شاردهای چند گیگابایتی، و یک مسیر سریع коопераتیو simdgroup GEMV. همچنین یک لایه کامل مدیریت جلسه چت با مدیریت قالبها (Template Handling) برای نسخههای «متفکر» و «غیرمتفکر» Qwen و جریمههای حضور/تکرار (presence/frequency penalties) را اضافه کرده است.
تحلیل تحریریه
این تغییر رویکرد، نشاندهنده گذار از «کوانتایزیشن برای کاهش اندازه» به سمت «استریمینگ برای دسترسیپذیری» است. با اثبات اینکه گلوگاه دیگر مقدار رم نیست، بلکه کارایی استریم از SSD به GPU است، Swiftlet پیشفرضهای مربوط به آنچه «آماده برای موبایل» (mobile-ready) است را تغییر میدهد.
با این حال، یک هزینه در قابلیتهای شناختی وجود دارد. چون در هر توکن تنها حدود ۳ میلیارد پارامتر فعال هستند، این مدلها نوعی «شخصیت دوگانه» نشان میدهند: آنها تسلط زبانی و سبک نوشتاری مدلهای غولپیکر را دارند، اما بازخوانی حقایق (factual recall) آنها شبیه به مدلهای بسیار کوچکتر است.
برای کاربر نهایی، این به معنای پیروزی بزرگ در زمینه حریم خصوصی و استقلال است. توانایی اجرای یک مدل ۳۵ یا ۸۰ میلیارد پارامتری روی گوشی به این معناست که استدلالهای پیچیده و پیشنویسهای باکیفیت دیگر نیازمند اتصال به داده یا اشتراک ماهانه در یک سرویس ابری نیستند.
گام بعدی شما
- اگر کاربر مک M-series هستید، مدلهای Qwen3.6 را از طریق مخزن گیتهاب Swiftlet تست کنید تا سرعت استنتاج محلی را بسنجید.
- توسعهدهندگان iOS میتوانند با بررسی SwiftletCore، قابلیتهای AI سطح بالا را بدون نیاز به سرورهای ابری به اپلیکیشنهای خود اضافه کنند.
- برای کاهش هزاتهای API، مدلهای MoE را به عنوان جایگزین برای وظایفی که نیاز به استدلال پیچیده اما حریم خصوصی بالا دارند، بررسی کنید.
اما داستان سختافزاری این تحول با معرفی تراشههای جدیدتر حتی شگفتانگیزتر است — به تحلیل ما درباره معماریهای NPU در پردازندههای اپل مراجعه کنید.




گفتگو