پرش به محتوای اصلی
پرش به محتوای مقاله

موتور Lily سرعت رمزگشایی Qwen3.6 در مک‌های اپل را ۱.۳۵ برابر کرد

·۱۳ شهریور ۱۴۰۵۴ دقیقه مطالعه
موتور استنتاج لیلی: اجرای مدل کیوئن ۳.۶-۳۵B روی تراشه‌های اپل سیلیکون با راست و متال
موتور استنتاج لیلی: اجرای مدل کیوئن ۳.۶-۳۵B روی تراشه‌های اپل سیلیکون با راست و متال
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل چارچوب‌های عمومی (PyTorch/MLX) با یک محیط اجرای تخصصی تک‌پروسه برای یک مدل خاص، که منجر به افزایش ۱.۳۵ برابری سرعت رمزگشایی شد.

۱.۳۵ برابر. این عدد، میزان افزایش سرعت رمزگشایی (Decoding) است که تیم Perplexity برای مدل Qwen3.6-35B-A3B روی تراشه‌های اپل به دست آورده است. این جهش مدیون Lily است؛ یک موتور استنتاج محلی با کارایی بالا که چارچوب‌های عمومی مانند PyTorch و MLX را کنار زده و به‌جای آن‌ها از یک محیط اجرای تک‌پروسه استفاده می‌کند که دقیقاً برای یک مدل و یک خانواده سخت‌افزاری طراحی شده است.

این عرضه در زمانی رخ می‌دهد که صنعت به سمت «محاسبات ترکیبی» (Hybrid Compute) حرکت می‌کند؛ جایی که سخت‌افزار محلی برای کاهش تأخیر و هزینه، وظایف خاصی را بر عهده می‌گیرد. این رویکرد با استراتژی‌های کلی شرکت برای مدیریت داده‌ها هم‌سو است، همان‌طور که پراپلسیتی پیش‌تر رویکرد جدیدی را برای مدیریت داده‌های حساس در محیط‌های ترکیبی معرفی کرد. در حالی که ما پیش‌تر تحلیل کردیم که چگونه مدل Meta Muse Spark 1.3 فراخوانی‌های ابزار را برای کدنویسی عامل‌محور (Agentic Coding) بهینه کرده است، Lily بر لایه خام اجرا تمرکز دارد. این موتور برای کاربران مک‌های دارای تراشه اپل، سیستم‌عامل macOS 15 به بالا و حداقل ۲۴ گیگابایت حافظه یکپارچه (Unified Memory) طراحی شده است، هرچند برای دستیابی به عملکرد بهینه، ۳۲ گیگابایت حافظه توصیه می‌شود.

معماری فنی

طبق مستندات فنی، Lily به عنوان یک محیط اجرای تک‌پروسه ساخته شده است. یک لایه Rust نقطه بازرسی (Checkpoint) مدل را بارگذاری کرده و حلقه تولید را هدایت می‌کند، در حالی که یک API سازگار با OpenAI برای تکمیل چت (Chat-completions)، توکن‌ها را استریم می‌کند. اجرای واقعی مدل توسط هسته‌های دست‌نویس Metal مدیریت می‌شود.

با حذف PyTorch و MLX از مسیر اجرا، Lily از سربارهای معماری‌هایی که باید روی سخت‌افزارهای مختلف قابل استفاده باشند، می‌زند. این تلاش برای بهینه‌سازی لایه‌های زیرین، یادآور تلاش‌های پیشین برای رفع گلوگاه‌های سخت‌افزاری است؛ برای مثال پروژه oMLX نیز تلاش کرد تا محدودیت‌های حافظه را در اجرای مدل‌های محلی اپل بشکند. در عوض، ساختار مدل، برنامه‌های اجرایی و انتخاب هسته‌ها را در یک محیط اجرای تخصصی متمرکز می‌کند. این تمرکز محدود و حذف لایه‌های انتزاعی عمومی، هسته اصلی استدلال این تیم برای دستیابی به عملکرد بالاتر است.

مشخصات مدل

این موتور برای مدل Qwen3.6-35B-A3B طراحی شده است که ۳۵ میلیارد پارامتر را ذخیره می‌کند اما برای هر توکن تنها حدود ۳ میلیارد پارامتر را فعال می‌کند. این مدل از یک مسیریاب (Router) استفاده می‌کند که ۲۵۶ خبره (Expert) را امتیازدهی کرده و هشت مورد را انتخاب می‌کند، به‌علاوه یک خبره مشترک که هر توکن را پردازش می‌کند. ساختار آن ترکیبی از ۱۰ لایه توجه کامل با استفاده از توجه پرس‌وجوی گروهی (Grouped-Query Attention) با ۱۶ سر پرس‌وجو و دو سر KV، و ۳۰ لایه Gated DeltaNet است. این ترکیب، سه الگوی کاری متمایز ایجاد می‌کند: گروه‌های خبره نامتقارن، توجه بر روی یک حافظه پنهان KV در حال رشد، و یک بازگشت (Recurrence) با اندازه ثابت.

به گزارش Marktechpost، دستاوردهای عملکردی Lily از چندین بهینه‌سازی در لایه‌های عمیق سیستم ناشی می‌شود:

بهینه‌سازی‌های پیش‌پُرکردن (Prefill)

  • کوانتش ادغام‌شده (Fused Dequantization): نقطه بازرسی مدل از کوانتش ۴ بیتی افین گروهی (Groupwise Affine) استفاده می‌کند که در آن هر ۶۴ وزن، یک مقیاس و بایاس bfloat16 مشترک دارند. Lily این وزن‌ها را تکه‌تکه درون GEMM گروهی بازسازی کرده و نتایج را در حافظه threadgroup نگه می‌دارد و در FP32 انباشت می‌کند. این ادغام، سرعت پیش‌پُرکردن را در پرامپت‌های ۵۱۲ توکنی ۷۷.۴٪ افزایش داد.
  • مسیریابی مقیم در GPU: نگه داشتن هیستوگرام مسیریابی، اسکن پیشوندی (Prefix Scan)، پراکندگی (Scatter) و نقشه بلوکی درون یک بافر فرمان واحد GPU، همگام‌سازی با CPU را در هر لایه MoE حذف کرد و سرعت را در ۵۱۲ توکن ۸۹٪ بالا برد.
  • کاشی‌بندی و اسکن‌ها: تغییر کاشی‌ها از ۱۶ ردیف به ۳۲ ردیف با چهار simdgroup، ۱۳.۲٪ سرعت را در توکن‌های ۲ هزارتایی افزایش داد، در حالی که یک اسکن Gated DeltaNet مقیم در ثبات (Register-resident)، ۵.۶٪ دیگر به سرعت افزود.
  • مدیریت حافظه: پرامپت‌های طولانی در تکه‌های محدود (Bounded Chunks) اجرا می‌شوند تا فعال‌سازهای موقت با وزن‌ها و حافظه پنهان برای رم رقابت نکنند و از کمبود حافظه جلوگیری شود.

بهینه‌سازی‌های رمزگشایی (Decode)

  • بسته‌بندی GQA: اشتراک چهار سر پرس‌وجو در یک threadgroup باعث شد هر ردیف KV تنها یک‌بار بارگذاری شود و سرعت رمزگشایی در زمینه ۳۲ هزار توکنی ۲۳.۸٪ بهبود یابد.
  • توجه بلوک‌ثابت (Fixed-Block Attention): این چیدمان باعث جهشی ۷.۷ درصدی در زمینه ۳۲ هزار توکنی، ۲۷.۴ درصدی در ۶۴ هزار توکنی و ۴۰.۲ درصدی در زمینه ۱۲۸ هزار توکنی شد.
  • ادغام هسته‌ها (Kernel Fusion): چهار زنجیره هسته ادغام شدند تا متغیرهای میانی در ثبات‌ها (Registers) بمانند. توکن انتخاب شده مستقیماً در جایگاه ورودی مقیم در GPU برای گام بعدی نوشته می‌شود و رفت‌وبرگشت‌های CPU در هر توکن حذف می‌شود.
  • بهبود پهنای باند: خواندن‌های متمرکز (Coalesced) از حافظه پنهان، پهنای باند کلید (Key) را از ۳۳.۸ به ۴۷.۹ گیگابایت بر ثانیه و پهنای باند مقدار (Value) را از ۴۲۰ به ۶۱.۸ گیگابایت بر ثانیه رساند.

در آزمایش روی یک M5 Max با ۴۰ هسته و ۱۲۸ گیگابایت رم، Lily به‌طور میانگین ۴,۱۵۶ توکن پیش‌پُرکردن در ثانیه (۱.۲۳ برابر سریع‌تر از MLX-LM) و ۱۷۰ توکن رمزگشایی در ثانیه ثبت کرد. در حالت ۴ هزار توکن پرامپت و ۴ هزار توکن زمینه، این اعداد به ترتیب به ۵,۷۴۹.۹ و ۱۸۶.۶ رسیدند. نقطه بازرسی ۴ بیتی این مدل ۱۹.۴ گیگابایت فضا اشغال می‌کند که در واقع ۷۰ گیگابایت وزن‌های bfloat16 را فشرده کرده است.

صحت مدل نیز حفظ شده است؛ بررسی‌های Teacher-forced در ۱۹۲ موقعیت نشان داد که perplexity مدل Lily تنها ۰.۰۴٪ بیشتر از مدل پایه است و در ۹۶.۳۵٪ موارد، توکن برتر یکسانی را تولید کرده است.

برای جامعه فنی، Lily نشان‌دهنده چرخش از معماری‌های «چندمنظوره» به محیط‌های اجرای «تخصصی» است. اکثر چارچوب‌ها سازگاری با سخت‌افزارهای مختلف را اولویت می‌دهند، اما Lily ثابت کرد که فدا کردن کلیت در برابر برنامه‌های اجرایی مدل‌محور، می‌تواند منجر به افزایش دو رقمی توان عملیاتی شود. این موضوع نشان می‌دهد که سقف هوش مصنوعی روی دستگاه، اغلب توسط لایه‌های انتزاع نرم‌افزاری محدود شده است، نه خودِ سیلیکون.

گام بعدی شما

  • توسعه‌دهندگان می‌توانند از طریق مخزن pplx-garden در گیت‌هاب به کد منبع و دموی مستقل دسترسی پیدا کنند تا این افزایش سرعت را روی سخت‌افزار خود آزمایش کنند.
  • اگر از مدل‌های Qwen روی مک استفاده می‌کنید، بررسی کنید که آیا حذف لایه‌های انتزاعی مانند PyTorch می‌تواند گلوگاه‌های استنتاج شما را برطرف کند یا خیر.
  • دنبال کنید که آیا این رویکرد «تخصصی‌سازی» به مدل‌های دیگر مانند Llama نیز تعمیم می‌یابد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه با تکیه بر تخصص در هسته‌های Metal، نشان می‌دهد که بهینه‌سازی نرم‌افزاری می‌تواند محدودیت‌های سخت‌افزاری را جابه‌جا کند. این دستاورد برای کاربرانی که به دنبال استنتاج محلی سریع و کم‌هزینه روی مک هستند، یک نقطه عطف است.

تأثیر برای ایران

به‌دلیل ماهیت متن‌باز بودن کد در گیت‌هاب، توسعه‌دهندگان ایرانی که از سخت‌افزارهای اپل استفاده می‌کنند، می‌توانند بدون نیاز به APIهای پولی، استنتاج محلی را با سرعت بسیار بالاتر روی مدل‌های Qwen اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

Lily ثابت می‌کند که ما هنوز در ابتدای مسیر استخراج حداکثری توان سخت‌افزارهای لبه هستیم. در حالی که صنعت سال‌ها روی لایه‌های انتزاعی (Abstraction Layers) برای سهولت در توسعه تمرکز کرده، اکنون می‌بینیم که برای رسیدن به عملکرد واقعی، باید دوباره به سمت کدنویسی سطح پایین و سخت‌افزار-محور بازگردیم. این رویکرد احتمالاً آغازگر موجی از موتورهای استنتاج «تک‌مدلی» خواهد بود که کارایی را فدای انعطاف‌پذیری می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.