اگر امروز مدلهای زبانی را بهصورت محلی اجرا میکنید، احتمالاً بخشی از توان سختافزارتان را به دلیل عدم بهینگی نرمافزار از دست میدهید. موتور جدید Magnitude این اتلاف را متوقف کرده و سرعت استنتاج را تا ۲ برابر افزایش داده است.
طبق مستندات مخزن گیتهاب این پروژه که در ۳۰ سپتامبر ۲۰۲۶ بهروزرسانی شد، این ابزار با کامپایل اختصاصی کرنلها برای هر تراشه، شکاف عملکردی موتورهای عمومی را از بین میبرد. استنتاج (Inference) — که شبیه لحظهٔ خودِ آشپزی است، نه دورهی آموزش آشپز — در این سامانه مستقیماً با معماری سختافزاری شما همراستا میشود. این تلاش برای بهینهسازی، در راستای رقابت گستردهتر شرکتهای بزرگ برای کاهش هزینههای استنتاج عاملهای هوش مصنوعی است تا دسترسی به مدلهای پیشرفته ارزانتر شود.
همانطور که در تحلیل قبلی ما دربارهی تبدیل شدن مکهای اپل به نیروگاههای هوش مصنوعی اشاره کردیم، بهینهسازی لایهی سختافزار کلید بازی است. در حالی که اکثر ابزارها از کرنلهای پیشکامپایلشده (که برای دستههای کلی سختافزار ساخته شدهاند) استفاده میکنند، Magnitude ابتدا موتور را روی خودِ دستگاه تنظیم میکند تا نرمافزار دقیقاً بر اساس مشخصات پردازنده شما قالبریزی شود.
عملکرد فنی و سازگاری
بر اساس گزارشهای فنی، Magnitude دستاوردهای مشخصی نسبت به موتورهای سنتی دارد:
- سرعت: نرخ رمزگشایی (Decode) در Metal تا ۹۲٪ و در CUDA تا ۱۹٪ سریعتر از لاماسیپلاسپلاس (llama.cpp) است.
- حافظه: مصرف حافظه برای هر عامل (Agent) ۲۷٪ کاهش یافته و بلافاصله پس از توقف عامل، آزاد میشود.
- همزمانی: جلسات از حافظهٔ پیشوند (Prefix Cache) مشترک استفاده میکنند تا در کارهای همزمان، سرعت افت نکند.
این موتور از پردازندههای اپل سیلیکون، NVIDIA و AMD و همچنین سیستمهای CPU-only در ویندوز، لینوکس و مک پشتیبانی میکند. همچنین اتصال به عاملهایی مثل Pi، OpenCode و Claude Code از طریق API سازگار با OpenAI یا اتصال تککلیکی امکانپذیر است. در این زمینه، پروژه HydraFusion در گیتهاب نیز گامهای مشابهی برای کاهش چشمگیر هزینه استنتاج در کدنویسی برداشته است.
برای کاربر عادی، این تغییر یعنی «مالیات سختافزاری» اجرای هوش مصنوعی محلی در حال کاهش است. دیگر لازم نیست امیدوار باشید تراشهی شما در دستههای پشتیبانیشدهی پیشفرض باشد؛ حالا نرمافزار خودش را با سختافزار شما تطبیق میدهد.
این رویکرد عملاً یک PC یا مک معمولی را به یک ایستگاه کاری تخصصی تبدیل میکند. Magnitude با بهینهسازی در لبه (Edge)، سد ورود برای اجرای مدلهای وزنباز (Open Weights) — که یعنی دستور پخت مدل علناً منتشر شده و نه فقط غذای آماده — روی سختافزارهای مصرفکننده را پایین میآورد. این تسهیل در اجرا، مسیر را برای پیادهسازی سوارمهای هماهنگ در توسعه نرمافزار هموار میکند تا بهرهوری تیمها را به جای تکنفره، به صورت جمعی افزایش دهد.
گام بعدی شما
- اپلیکیشن دسکتاپ Magnitude را دانلود کرده و مدلهای پیشنهادی را در تب Discover تست کنید.
- اگر توسعهدهنده هستید، جایگزینی APIهای محلی خود با این موتور را برای کاهش تأخیر (Latency) بررسی کنید.
- میزان مصرف VRAM را هنگام اجرای همزمان چند عامل با llama.cpp مقایسه کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ برای درک لایههای عمیقتر بهینهسازی، تحلیل ما دربارهی تراشههای Blackwell را بخوانید.




گفتگو