پرش به محتوای اصلی
پرش به محتوای مقاله

استقرار مدل Bonsai-27B روی GPUهای خانگی با کوانتیزاسیون ۱-بیتی

·۶ مرداد ۱۴۰۵۷ دقیقه مطالعه۱ بازدید
راهنما
استقرار مدل ۱ بیتی Bonsai-27B با PrismML و llama.cpp برای استنتاج محلی سازگار با OpenAI
استقرار مدل ۱ بیتی Bonsai-27B با PrismML و llama.cpp برای استنتاج محلی سازگار با OpenAI
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اجرای مدل ۲۷ میلیارد پارامتری با حافظه کمتر از ۶ گیگابایت از طریق کوانتیزاسیون ۱-بیتی و سازگاری کامل با APIهای استاندارد OpenAI.

تصور کنید یک مدل ۲۷ میلیارد پارامتری را که قاعدتاً به سخت‌افزارهای عظیم نیاز دارد، روی یک لپ‌تاپ یا یک GPU رایگان در فضای ابری اجرا کنید. این اتفاق اکنون با استفاده از کوانتیزاسیون (Quantization) — شبیه به تبدیل یک عکس باکیفیت و حجیم به یک فایل JPEG کوچک که هنوز هم قابل تشخیص است — به واقعیت تبدیل شده است. در حالت عادی، مدل‌های با این تعداد پارامتر به حافظه گرافیکی (VRAM) بسیار بالایی نیاز دارند، اما تکنیک‌های جدید این محدودیت را می‌شکنند.

بر اساس مستندات فنی، مدل Bonsai-27B با بهره‌گیری از یک فورک (Fork) تخصصی از لاماسی‌پلاس‌پلاس (llama.cpp) توسعه‌یافته توسط PrismML، اکنون روی سخت‌افزارهای محدودی مثل GPU T4 در گوگل کولب قابل میزبانی است. این مدل در حالت پیک مصرف، تنها به حدود ۵.۲ گیگابایت حافظه برای یک پنجره زمینه ۴ هزار توکنی نیاز دارد. این یعنی حتی کاربران بدون دسترسی به سرورهای صنعتی نیز می‌توانند از قدرت یک مدل ۲۷ میلیارد پارامتری بهره‌مند شوند.

این پیشرفت در حالی رخ می‌دهد که صنعت به سمت فشرده‌سازی‌های حداکثری حرکت می‌کند تا مدل‌های بزرگ‌تر روی لبه (Edge Computing) قابل اجرا شوند. در حالی که تلاش‌های قبلی روی فرمت‌های ۴-بیتی یا ۸-بیتی متمرکز بود، حرکت به سمت ۱-بیت (به‌خصوص فرمت GGUF مدل Q1_0_g128) کاهش شدید مصرف حافظه را بدون از دست دادن کامل کاربرد مدل رقم زده است. این یک جهش در بهینه‌سازی است که اجازه می‌دهد مدل‌هایی که پیش‌تر فقط در دیتاسنترها جای داشتند، به محیط‌های محلی منتقل شوند. همان‌طور که در تحلیل قبلی ما درباره‌ی ابزارهای یکپارچه‌سازِ ارائه‌دهندگان مدل اشاره کردیم، این گردش‌کار حالا کل پشته — از وزن‌ها تا سرور استنتاج — را مستقیماً به محیط محلی کاربر منتقل می‌کند.

زیرساخت و راه‌اندازی

برای فعال‌سازی این سیستم، ابتدا باید نسخه خاصی از llama.cpp کامپایل شود. طبق گزارش PrismML، استفاده از فورک آن‌ها ضروری است زیرا شامل هسته‌های CUDA تخصصی برای رمزگشایی فرمت ۱-بیتی است. بدون این هسته‌ها، سخت‌افزار قادر به تفسیر وزن‌های به شدت فشرده مدل نخواهد بود. این فرایند شامل کلون کردن مخزن از گیت‌هاب و استفاده از CMake برای ساخت فایل‌های اجرایی llama-cli ،llama-server و llama-bench با پشتیبانی فعال‌شده از CUDA است تا بیشترین سرعت پردازش حاصل شود.

پس از آماده‌سازی فایل‌های اجرایی، وزن‌های Bonsai-27B-Q1_0.gguf از Hugging Face دانلود می‌شوند. به نقل از راهنمای فنی منتشر شده توسط Marktechpost، این مدل به‌گونه‌ای طراحی شده که بسیار سبک باشد و نیازی به پردازنده‌های گران‌قیمت A100 نداشته باشد. این ویژگی، مدل را برای نمونه‌سازی سریع (Prototyping) در نوت‌بوک‌های ابری مانند گوگل کولب به گزینه‌ای ایده‌آل تبدیل می‌کند.

استنتاج محلی و یکپارچگی API

پس از تست اولیه در خط فرمان (Smoke Test) برای تایید اجرای صحیح محیط زمان اجرا (Runtime)، سیستم یک سرور استنتاج (Inference) — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره آموزش آشپز — سازگار با OpenAI را فعال می‌کند. این ویژگی اجازه می‌دهد مدل از طریق درخواست‌های HTTP استاندارد فراخوانی شود و جایگزینی کاملاً مستقیم (Drop-in replacement) برای APIهای ابری باشد.

تنظیمات کلیدی فنی برای دستیابی به بهترین عملکرد عبارت‌اند از:

  • تخلیه لایه‌های GPU: تنظیم N_GPU_LAYERS روی ۹۹ برای اطمینان از اینکه تمامی لایه‌های مدل روی حافظه GPU قرار بگیرند و گلوگاه CPU حذف شود.
  • مدیریت زمینه: اندازه پیش‌فرض ۸,۱۹۲ توکن در نظر گرفته شده است، هرچند معماری داخلی این مدل از پنجره‌های بسیار بزرگ‌تر تا ۲۶۲ هزار توکن پشتیبانی می‌کند.
  • پارامترهای نمونه‌برداری: استفاده از پیکربندی‌های استاندارد شامل Temperature (۰.۷) برای کنترل خلاقیت، top-p (۰.۹۵) برای محدود کردن احتمالات توکن‌ها و top-k (۲۰) برای افزایش انسجام پاسخ.

اعتبارسنجی عملکرد و قابلیت‌ها

این استقرار از طریق چهار الگوی تعاملی اصلی با استفاده از یک کلاینت پایتون تایید شد تا مشخص شود کوانتیزاسیون ۱-بیتی تا چه حد بر کیفیت اثر گذاشته است. نخست، مدل پاسخ‌های ساده و تک‌مرحله‌ای مثل شناسایی پایتخت فرانسه را بدون خطا مدیریت کرد. دوم، توانایی استدلال ریاضی خود را در حل مسائل مربوط به محاسبه سرعت متوسط نشان داد و پاسخ‌ها را به‌صورت جریانی (Streamed) و توکن-به-توکن تولید کرد.

در گام سوم، سیستم حافظه مکالمه‌ای چند-دور (Multi-turn) را حفظ کرد و توانست جزئیات ارائه شده توسط کاربر را در طول یک سری از پرامپت‌های متوالی به یاد آورد و از آن‌ها در پاسخ‌های بعدی استفاده کند. در نهایت، مدل کدهای کاربردی پایتون، به‌ویژه پیاده‌سازی دنباله فیبوناچی با استفاده از تکنیک Memoization را تولید کرد. این موفقیت در تولید کد ثابت می‌کند که حتی کوانتیزاسیون شدید، ساختار منطقی و توانایی برنامه‌نویسی مدل را به‌طور کامل تخریب نمی‌کند.

گزینه‌های بهینه‌سازی پیشرفته

برای کاربرانی که به چیزی فراتر از چت ساده نیاز دارند، PrismML افزونه‌های پرکارایی را ارائه می‌دهد. برای مدیریت پنجره متنی (Context Window) — شبیه میز کاری که جا برای چند ورق دارد نه کل کتابخانه — تا ۲۶۲ هزار توکن، می‌توان کش KV کوانتیده ۴-بیتی را فعال کرد. این بهینه‌سازی اجازه می‌دهد زمینه‌های ۱۰۰ هزار توکنی در حدود ۶.۸ گیگابایت حافظه جای بگیرند، که همچنان به‌طور کامل در محدوده ۱۶ گیگابایت حافظه GPU T4 قرار می‌گیرد.

همچنین سرعت تولید متن را می‌توان با استفاده از رمزگشایی گمانه‌زنانه (Speculative Decoding) افزایش داد. این مخزن شامل یک پیش‌خوان (Drafter) با نام DSpark (در حالت Q4_1 با حجم حدود ۱.۷۹ گیگابایت) است که یک افزایش سرعت بدون افت کیفیت (Lossless) به میزان ۱.۳۷ برابر روی سخت‌افزارهای CUDA فراهم می‌کند. برای کسانی که به قابلیت‌های چندوجهی (Multimodal) — مدلی که مثل انسان هم‌زمان متن و عکس را می‌فهمد — نیاز دارند، یک بسته mmproj مجزا با حجم ۰.۶۳ گیگابایت قابل بارگذاری است تا پشتیبانی از ورودی تصویر اضافه شود، بدون اینکه سرعت درخواست‌های متنی کاهش یابد.

اگر دقت ۱-بیتی برای یک مورد کاربردی خاص بیش از حد تهاجمی باشد و منجر به کاهش کیفیت شود، تیم توسعه یک مدل خواهر ترنری (Ternary) به نام Ternary-Bonsai-27B-gguf را پیشنهاد می‌کند. این نسخه با حجم کمی بیشتر (حدود ۵.۹ گیگابایت)، تقریباً ۹۵٪ از کیفیت مدل اصلی در حالت FP16 را حفظ کرده است و می‌تواند به‌جای نسخه ۱-بیتی جایگزین شود.

این چرخش به سمت فرمت‌های ۱-بیتی و ترنری، معیار مدل‌های محلی را تغییر می‌دهد. ما از عصر مدل‌های ۷ یا ۸ میلیارد پارامتری عبور کرده‌ایم و به سمتی می‌رویم که مدل‌های ۲۷ میلیارد پارامتری و بزرگ‌تر روی سخت‌افزارهای مشابه لپ‌تاپ‌های رده‌بالا اجرا شوند. این یعنی دموکراتیزه شدن دسترسی به استدلال‌های پیچیده و پارامترهای بالا، بدون اینکه کاربر نیاز به بودجه‌های کلان شرکتی برای خرید خوشه‌های H100 داشته باشد.

برای توسعه‌دهندگان، ارزش فوری این ابزار، امکان تست پرامپت‌های پیچیده و گردش‌کارهای عامل‌محور (Agentic) به‌صورت کاملاً محلی پیش از انتقال به APIهای پولی و گران‌قیمت است. به دلیل سازگاری کامل با فرمت API شرکت OpenAI، شما می‌توانید تنها با تغییر یک URL در کد خود، بک‌اِند سیستم را از یک ارائه‌دهنده ابری به یک نمونه محلی Bonsai تغییر دهید بدون اینکه نیاز به بازنویسی کد باشد.

گام بعدی شما

  • وزن‌های مدل را از Hugging Face دانلود کرده و با فورک PrismML آزمایش کنید تا صحت (Accuracy) مدل را با نیازهای خاص خود بسنجید.
  • برای کاهش تأخیر در پاسخ‌دهی و افزایش سرعت تولید توکن‌ها، قابلیت Speculative Decoding را فعال کنید.
  • اگر در پاسخ‌های مدل افت کیفیت یا عدم دقت محسوس کردید، نسخه Ternary را جایگزین نسخه ۱-بیتی کنید تا تعادلی بین حجم و کیفیت برقرار شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره تأثیر تراشه‌های جدید بر استقرار مدل‌های فشرده مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص در مهندسی کرنل‌های CUDA، سد سخت‌افزاری برای اجرای مدل‌های متوسط را می‌شکند. نتیجه این است که توسعه‌دهندگان مستقل اکنون قدرت استدلالی مدل‌های بزرگ را بدون نیاز به زیرساخت‌های ابری گران‌قیمت در اختیار دارند.

تأثیر برای ایران

به دلیل محدودیت دسترسی به GPUهای ابری و هزینه‌های بالای دلاری APIها، این ابزار به توسعه‌دهندگان ایرانی اجازه می‌دهد مدل‌های قدرتمند را روی سخت‌افزارهای موجود یا سرورهای ارزان‌قیمت داخلی اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

فشار برای کاهش حافظه (VRAM) اکنون از مرزهای رایج ۴-بیت گذشته و به ۱-بیت رسیده است. این روند نشان می‌دهد که برای بسیاری از کاربردهای عملی، «اندازه مدل» (تعداد پارامترها) اهمیت بیشتری نسبت به «دقت وزن‌ها» (Precision) دارد. در واقع داشتن یک مدل ۲۷ میلیارد پارامتریِ بسیار فشرده، احتمالاً نتایج بهتری نسبت به یک مدل ۷ میلیارد پارامتری با دقت بالا می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.