پرش به محتوای اصلی
پرش به محتوای مقاله

Magnitude سرعت استنتاج مدل‌های باز را ۲ برابر llama.cpp کرد

·۸ مهر ۱۴۰۵۲ دقیقه مطالعه۳ بازدید
موتور استنتاج متن‌باز برای عامل‌های هوش مصنوعی که خود را برای سخت‌افزار شما بهینه می‌کند. مدل‌های باز را تا ۲ برابر سریع‌تر ا
موتور استنتاج متن‌باز برای عامل‌های هوش مصنوعی که خود را برای سخت‌افزار شما بهینه می‌کند. مدل‌های باز را تا ۲ برابر سریع‌تر ا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کرنل‌های پیش‌کامپایل‌شده با کامپایل مستقیم روی سخت‌افزار کاربر؛ این یعنی نرم‌افزار به‌جای تحمیل ساختار به سخت‌افزار، خود را با تراشه تطبیق می‌دهد.

اگر امروز مدل‌های زبانی را به‌صورت محلی اجرا می‌کنید، احتمالاً بخشی از توان سخت‌افزارتان را به دلیل عدم بهینگی نرم‌افزار از دست می‌دهید. موتور جدید Magnitude این اتلاف را متوقف کرده و سرعت استنتاج را تا ۲ برابر افزایش داده است.

طبق مستندات مخزن گیت‌هاب این پروژه که در ۳۰ سپتامبر ۲۰۲۶ به‌روزرسانی شد، این ابزار با کامپایل اختصاصی کرنل‌ها برای هر تراشه، شکاف عملکردی موتورهای عمومی را از بین می‌برد. استنتاج (Inference) — که شبیه لحظهٔ خودِ آشپزی است، نه دوره‌ی آموزش آشپز — در این سامانه مستقیماً با معماری سخت‌افزاری شما هم‌راستا می‌شود. این تلاش برای بهینه‌سازی، در راستای رقابت گسترده‌تر شرکت‌های بزرگ برای کاهش هزینه‌های استنتاج عامل‌های هوش مصنوعی است تا دسترسی به مدل‌های پیشرفته ارزان‌تر شود.

همان‌طور که در تحلیل قبلی ما درباره‌ی تبدیل شدن مک‌های اپل به نیروگاه‌های هوش مصنوعی اشاره کردیم، بهینه‌سازی لایه‌ی سخت‌افزار کلید بازی است. در حالی که اکثر ابزارها از کرنل‌های پیش‌کامپایل‌شده (که برای دسته‌های کلی سخت‌افزار ساخته شده‌اند) استفاده می‌کنند، Magnitude ابتدا موتور را روی خودِ دستگاه تنظیم می‌کند تا نرم‌افزار دقیقاً بر اساس مشخصات پردازنده شما قالب‌ریزی شود.

عملکرد فنی و سازگاری

بر اساس گزارش‌های فنی، Magnitude دستاوردهای مشخصی نسبت به موتورهای سنتی دارد:

  • سرعت: نرخ رمزگشایی (Decode) در Metal تا ۹۲٪ و در CUDA تا ۱۹٪ سریع‌تر از لاماسی‌پلاس‌پلاس (llama.cpp) است.
  • حافظه: مصرف حافظه برای هر عامل (Agent) ۲۷٪ کاهش یافته و بلافاصله پس از توقف عامل، آزاد می‌شود.
  • هم‌زمانی: جلسات از حافظهٔ پیشوند (Prefix Cache) مشترک استفاده می‌کنند تا در کارهای هم‌زمان، سرعت افت نکند.

این موتور از پردازنده‌های اپل سیلیکون، NVIDIA و AMD و همچنین سیستم‌های CPU-only در ویندوز، لینوکس و مک پشتیبانی می‌کند. همچنین اتصال به عامل‌هایی مثل Pi، OpenCode و Claude Code از طریق API سازگار با OpenAI یا اتصال تک‌کلیکی امکان‌پذیر است. در این زمینه، پروژه HydraFusion در گیت‌هاب نیز گام‌های مشابهی برای کاهش چشمگیر هزینه استنتاج در کدنویسی برداشته است.

برای کاربر عادی، این تغییر یعنی «مالیات سخت‌افزاری» اجرای هوش مصنوعی محلی در حال کاهش است. دیگر لازم نیست امیدوار باشید تراشه‌ی شما در دسته‌های پشتیبانی‌شده‌ی پیش‌فرض باشد؛ حالا نرم‌افزار خودش را با سخت‌افزار شما تطبیق می‌دهد.

این رویکرد عملاً یک PC یا مک معمولی را به یک ایستگاه کاری تخصصی تبدیل می‌کند. Magnitude با بهینه‌سازی در لبه (Edge)، سد ورود برای اجرای مدل‌های وزن‌باز (Open Weights) — که یعنی دستور پخت مدل علناً منتشر شده و نه فقط غذای آماده — روی سخت‌افزارهای مصرف‌کننده را پایین می‌آورد. این تسهیل در اجرا، مسیر را برای پیاده‌سازی سوارم‌های هماهنگ در توسعه نرم‌افزار هموار می‌کند تا بهره‌وری تیم‌ها را به جای تک‌نفره، به صورت جمعی افزایش دهد.

گام بعدی شما

  • اپلیکیشن دسکتاپ Magnitude را دانلود کرده و مدل‌های پیشنهادی را در تب Discover تست کنید.
  • اگر توسعه‌دهنده هستید، جایگزینی APIهای محلی خود با این موتور را برای کاهش تأخیر (Latency) بررسی کنید.
  • میزان مصرف VRAM را هنگام اجرای هم‌زمان چند عامل با llama.cpp مقایسه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک لایه‌های عمیق‌تر بهینه‌سازی، تحلیل ما درباره‌ی تراشه‌های Blackwell را بخوانید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر تخصص در بهینه‌سازی کرنل، هزینه‌ی سخت‌افزاری اجرای مدل‌های بزرگ را کاهش می‌دهد. در نتیجه، مدل‌های پیشرفته‌تر اکنون روی سخت‌افزارهای ارزان‌تر با سرعت تجاری قابل اجرا هستند.

تأثیر برای ایران

به دلیل ماهیت متن‌باز و محلی بودن، Magnitude ابزاری ایده‌آل برای توسعه‌دهندگان ایرانی است تا بدون نیاز به APIهای تحریمی و هزینه‌های دلاری، مدل‌های قدرتمند را روی سخت‌افزارهای موجود اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

انتقال تمرکز از «کتابخانه‌های جامع» به «کامپایل در لحظه روی سخت‌افزار» نشان می‌دهد که دوران مدل‌های یک‌اندازه برای همه به پایان رسیده است. Magnitude با حذف لایه‌های انتزاعی، سخت‌افزار مصرف‌کننده را به سطح سخت‌افزارهای تخصصی نزدیک می‌کند و احتمالاً استانداردی جدید برای تمام فریم‌ورک‌های استنتاج محلی خواهد بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.