پرش به محتوای اصلی
پرش به محتوای مقاله

مایکروسافت: اجرای مدل‌های ۱۰۰ میلیارد پارامتری روی یک CPU

·۲۱ مرداد ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
BitNet: فریم‌ورک متن‌باز مایکروسافت برای اجرای LLM صد میلیارد پارامتری روی یک CPU
BitNet: فریم‌ورک متن‌باز مایکروسافت برای اجرای LLM صد میلیارد پارامتری روی یک CPU
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی ضرب‌های ماتریسی پیچیده با عملیات ساده اعداد صحیح در مقیاس ۱.۵۸ بیت؛ این یعنی اجرای مدل‌های ۱۰۰ میلیاردی روی CPU بدون افت شدید کیفیت، چیزی که پیش از این غیرممکن بود.

تصور کنید یک لپ‌تاپ معمولی بتواند مدل‌های غول‌پیکر هوش مصنوعی را بدون نیاز به کارت‌های گرافیکی گران‌قیمت، اشتراک‌های ابری و سخت‌افزارهایی که ده‌ها هزار دلار قیمت دارند، اجرا کند. مایکروسافت با معرفی BitNet این رویای دسترسی محلی به مدل‌های ۱۰۰ میلیاردی را به واقعیت نزدیک کرده است. این چارچوب استنتاج متن‌باز اجازه می‌دهد یک CPU لپ‌تاپ، مدلی با ۱۰۰ میلیارد پارامتر را با سرعتی مشابه مطالعه‌ی انسان اجرا کند و نیاز اجباری به شتاب‌دهنده‌های رده‌بالا را از بین ببرد.

این تحول در حالی رخ می‌دهد که صنعت با بحران هزینه‌های سرسام‌آور سخت‌افزاری و مصرف انرژی مدل‌های زبانی دست‌وپنجه نرم می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی اینکه چگونه بهینه‌سازی‌های مبتنی بر LLM می‌تواند هزینه‌های نمونه‌سازی را تا ۹۹٪ کاهش دهد اشاره کردیم، کاهش هزینه‌ها در لایه‌ی نرم‌افزاری حیاتی است، اما BitNet مستقیماً ریشه‌ی مشکل را در لایه‌ی سخت‌افزار هدف قرار می‌دهد. این چارچوب، بار محاسباتی را از تراشه‌های تخصصی AI به پردازنده مرکزی (CPU) — که در تقریباً هر کامپیوتری وجود دارد — منتقل می‌کند.

مایکروسافت ریسرچ (Microsoft Research) این پروژه را به‌صورت ۱۰۰٪ متن‌باز و تحت مجوز MIT منتشر کرده است. این پروژه مورد استقبال گسترده‌ای قرار گرفته و تا کنون بیش از ۳۹,۹۰۰ ستاره (Star) و ۳,۷۰۰ فورک (Fork) در گیت‌هاب به دست آورده است.

طبق مستندات این مخزن، BitNet از مکانیزم کوانتایزیشن (Quantization) ۱.۵۸ بیتی استفاده می‌کند. برخلاف مدل‌های استاندارد که از اعداد اعشاری ۱۶ بیتی یا ۳۲ بیتی استفاده می‌کنند، BitNet وزن‌ها را به صورت مقادیر سه‌گانه (Ternary) ذخیره می‌کند: ۱+، ۰ یا ۱-. این مکانیزم ضرب‌های ماتریسی پیچیده را با عملیات ساده‌ی اعداد صحیح جایگزین می‌کند؛ عملیاتی که CPUها به‌طور بومی برای مدیریت بهینه آن‌ها طراحی شده‌اند.

بر اساس گزارش‌های فنی مایکروسافت، دستاوردهای این معماری در پردازنده‌های مختلف خیره‌کننده است و بهره‌وری را در معماری‌های گوناگون افزایش می‌دهد:

  • پردازنده‌های x86: سرعت اجرا ۲.۳۷ تا ۶.۱۷ برابر بیشتر از لاماسی‌پلاس‌پلاس (llama.cpp) است و مصرف انرژی بین ۷۱.۹٪ تا ۸۲.۲٪ کاهش یافته است.
  • پردازنده‌های ARM: افزایش سرعت بین ۱.۳۷ تا ۵.۰۷ برابری مشاهده شده و مصرف انرژی بین ۵۵.۴٪ تا ۷۰٪ کاهش یافته است.
  • بهینگی حافظه: نیاز به حافظه در مقایسه با مدل‌های با دقت کامل (Full-precision)، ۱۶ تا ۳۲ برابر کمتر شده است.
  • تخمین مدل ۱۰۰ میلیاردی: گزارش فنی تخمین می‌زند که یک مدل ۱۰۰ میلیارد پارامتری می‌تواند روی یک CPU واحد با سرعت ۵ تا ۷ توکن (Token) در ثانیه اجرا شود.

مایکروسافت پیش از این چندین مدل را در هاگینگ فیس (Hugging Face) منتشر کرده است. مدل پرچم‌دار BitNet-b1.58-2B-4T دارای ۲.۴ میلیارد پارامتر است که روی ۴ تریلیون توکن آموزش دیده و در آوریل ۲۰۲۵ عرضه شده است. سایر مدل‌های منتشر شده شامل BitNet-embedding-0.6B و BitNet-embedding-270M هستند که هر دو در جولای ۲۰۲۶ منتشر شدند.

با این حال، یک محدودیت حیاتی وجود دارد که باید به آن توجه کنید: شما نمی‌توانید مدل‌های موجود مثل Llama، Qwen یا DeepSeek را به‌سادگی به ۱.۵۸ بیت تبدیل کنید. برای حفظ دقت و کیفیت، مدل‌ها باید از همان ابتدا با استفاده از معماری BitNet آموزش ببینند. اگر یک مدل استاندارد را پس از آموزش کوانتایز کنید، کیفیت پاسخ‌ها به‌شدت افت می‌کند.

علاوه بر این، در حالی که مدل ۱۰۰ میلیاردی یک بنچمارک تئوریک در گزارش فنی است، هنوز برای دانلود عمومی در دسترس نیست. مدل‌های فعلی موجود بسیار کوچک‌تر هستند، مانند نسخه ۲.۴ میلیاردی.

برای کاربر عادی، این به معنای آن است که هوش مصنوعی با کیفیت بالا می‌تواند در نهایت به‌طور کامل آفلاین روی دستگاه‌های لبه (Edge Devices) مستقر شود. این فناوری لپ‌تاپ را از یک ترمینال که به GPUهای ابری متصل است، به یک ایستگاه کاری AI خودکفا تبدیل می‌کند. برنامه‌هایی که حریم خصوصی را در اولویت قرار می‌دهند و دستگاه‌های اینترنت اشیا (IoT) بیشترین سود را می‌برند، زیرا داده‌های حساس دیگر نیازی به خروج از سخت‌افزار محلی ندارند.

با این حال، سرعت ۵ تا ۷ توکن در ثانیه برای دستیارهای کدنویسی آنی یا چت‌بات‌های با سرعت بالا، بیش از حد کند است. بنابراین GPUها همچنان برای محیط‌های تولیدی با تأخیر کم (Low-latency) و توان عملیاتی بالا ضروری هستند. BitNet یک پیروزی برای دسترسی‌پذیری و بهره‌وری است، اما جایگزینی کامل برای محاسبات رده‌بالا نیست.

مخزن گیت‌هاب BitNet را دنبال کنید تا زمان انتشار وزن‌های مدل‌های در مقیاس ۱۰۰ میلیاردی مطلع شوید و ببینید آیا سرعت‌های تئوریک CPU در تست‌های استرس واقعی نیز پابرجا می‌مانند یا خیر.

گام بعدی شما

  • مخزن گیت‌هاب BitNet را دنبال کنید تا زمان انتشار وزن‌های مدل‌های ۱۰۰ میلیاردی مطلع شوید.
  • اگر توسعه‌دهنده هستید، مدل‌های ۲.۴ میلیاردی را روی CPUهای ARM (مثل مک‌های سری M) تست کنید تا تفاوت مصرف انرژی را ببینید.
  • برای کاربردهای حساس به حریم خصوصی، استقرار مدل‌های کوانتایز شده را جایگزین APIهای ابری کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با تکیه بر اعتبار پژوهشی مایکروسافت، دموکراتیزه کردن دسترسی به مدل‌های بزرگ را ممکن می‌کند. کاهش شدید نیاز به VRAM باعث می‌شود مدل‌های پیشرفته از مراکز داده به دستگاه‌های شخصی منتقل شوند.

تأثیر برای ایران

این ابزار برای توسعه‌دهندگان ایرانی که با محدودیت دسترسی به GPUهای ابری و هزینه‌های بالای ارزی مواجه‌اند، فرصتی است تا مدل‌های قدرتمند را روی سخت‌افزارهای معمولی و آفلاین اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

انتقال محاسبات از GPU به CPU در این مقیاس، فرضیه «وابستگی مطلق به شتاب‌دهنده‌های گران‌قیمت» را می‌شکند. BitNet نشان می‌دهد که با تغییر در نحوه نمایش داده‌ها (از اعشاری به ترنری)، می‌توانیم سخت‌افزارهای موجود را دوباره تعریف کنیم. این مسیر احتمالاً منجر به ظهور نسل جدیدی از سخت‌افزارهای مصرفی می‌شود که به‌جای تمرکز بر دقت اعشاری، بر عملیات صحیح بهینه‌شده متمرکز هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.