پرش به محتوای اصلی
پرش به محتوای مقاله

«هوشمندی محلی»؛ هدف PrismML از عرضه مدل Bonsai 27B

·۲۳ تیر ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
معرفی Bonsai 27B: نخستین مدل ۲۷ میلیاردی قابل اجرا روی گوشی
معرفی Bonsai 27B: نخستین مدل ۲۷ میلیاردی قابل اجرا روی گوشی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین استقرار مدل ۲۷ میلیاردی با دقت یک-بیتی که بدون افت شدید کیفیت، در حافظه محدود گوشی‌های هوشمند (زیر ۶ گیگابایت) جای می‌گیرد.

تصور کنید یک مدل استدلالی قدرتمند با ۲۷ میلیارد پارامتر، به‌جای سرورهای عظیم، در جیب شما باشد. در ۱۴ ژوئیه ۲۰۲۶، شرکت PrismML مدل Bonsai 27B را منتشر کرد تا ثابت کند استدلال‌های پیچیده و حلقه‌های عامل‌محور می‌توانند کاملاً روی دستگاه‌های محلی اجرا شوند.

برای سال‌ها تصور می‌شد مدل‌هایی که قادر به استدلال چندمرحله‌ای و فراخوانی ابزار هستند، به حافظه ویدیویی (VRAM) عظیمی نیاز دارند. یک مدل استاندارد ۲۷ میلیاردی با دقت ۱۶-بیتی به ۵۴ گیگابایت حافظه نیاز دارد و حتی نسخه‌های فشرده ۴-بیتی هم ۱۸ گیگابایت اشغال می‌کنند که برای هر گوشی مدرنی غیرممکن است. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی گلوگاه‌های وابستگی به API اشاره کردیم، این مدل تلاش می‌کند با انتقال کامل هوش به روی دستگاه، «آخرین مایل» توزیع هوش مصنوعی را طی کند.

هوش مصنوعی زاینده (Generative AI) — مثل آشپزی که به‌جای دنبال کردن دقیق یک دستور، بر اساس تجربه و الگوها غذا می‌پزد — در این مدل با روشی متفاوت پیاده شده است. PrismML برای رسیدن به این حجم کم، از روش کوانتزش وزن‌ها (Weight Quantization) — شبیه به کاهش کیفیت یک عکس برای اینکه سریع‌تر دانلود شود اما شکل کلی‌اش حفظ شود — استفاده کرده است. برخلاف مدل‌های رایج، Bonsai 27B در تمام شبکه، از جمله بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگانش را مشخص می‌کند — به‌صورت کم‌دقت اجرا می‌شود.

طبق مستندات فنی این شرکت، دو نسخه از این مدل ارائه شده است:

  • Bonsai 27B ترنری: از وزن‌های {۱+، ۰، ۱-} استفاده می‌کند و تنها ۵.۹ گیگابایت حافظه می‌گیرد. این نسخه برای لپ‌تاپ‌ها طراحی شده و ۹۵٪ کیفیت مدل اصلی را حفظ می‌کند.
  • Bonsai 27B یک-بیتی: از وزن‌های باینری {۱+، ۱-} استفاده می‌کند و تنها ۳.۹ گیگابایت حافظه اشغال می‌کند. این نسخه به‌طور خاص برای آیفون ۱۷ پرو بهینه شده است، جایی که اپلیکیشن‌ها معمولاً فقط به ۶ گیگابایت از ۱۲ گیگابایت رم دسترسی دارند.

معرفی Bonsai 27B: نخستین مدل ۲۷ میلیاردی قابل اجرا روی گوشی

به گزارش PrismML، این مدل در «حالت تفکر» که زنجیره تفکر (Chain-of-Thought) — مثل وقتی شاگرد ریاضی پای تخته بلند بلند فکر می‌کند تا به جواب برسد — فعال است، ۹۰٪ توانایی مدل پایه را حفظ می‌کند. در آزمون‌های ریاضی و کدنویسی، افت کیفیت تقریباً صفر است و قابلیت استفاده از ابزار (Tool Use) در سطح مدل‌های با دقت بالا باقی مانده است. این مدل همچنین از پنجره زمینه (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه میز کاری که جا برای چند ورق دارد — به اندازه ۲۶۲ هزار توکن پشتیبانی می‌کند.

برای افزایش سرعت، از رمزگشایی گمانه‌زنانه (Speculative Decoding) استفاده شده است. بر اساس داده‌های منتشر شده، نسخه یک-بیتی روی کارت گرافیک RTX 5090 به سرعت ۱۶۳ توکن در ثانیه و روی تراشه M5 Max به ۸۷ توکن در ثانیه می‌رسد.

این مدل تنها محدود به متن نیست و یک برج بینایی با دقت ۴-بیتی دارد. این یعنی عامل‌های (Agents) محلی می‌توانند اسکرین‌شات‌ها و ورودی‌های دوربین را بدون ارسال داده به ابر پردازش کنند. این قابلیت اجازه می‌دهد یک عامل، صفحه نمایش کاربر را ببیند، وضعیت بصری را تحلیل کند و برای تعامل با رابط کاربری، یک ابزار را فراخوانی کند.

شرکت PrismML مفهوم «تراکم هوش» را معرفی کرده است تا میزان توانایی مدل را نسبت به هر گیگابایت حافظه بسنجد. مدل یک-بیتی Bonsai 27B تراکمی ۱۰ برابر بیشتر از مدل‌های پایه و ۲.۷ برابر بیشتر از بهترین جایگزین‌های فعلی دارد. این تغییر، اقتصاد عامل‌های هوش مصنوعی را دگرگون می‌کند؛ زیرا هزینه استنتاج برای یک حلقه استدلالی صد مرحله‌ای در حالت محلی، صفر است و ریسک حریم خصوصی حذف می‌شود.

این پیشرفت امکان معماری ترکیبی را فراهم می‌کند. توسعه‌دهندگان می‌توانند کارهای روتین یا حساس را به مدل محلی بسپارند و مدل‌های ابری گران‌قیمت را فقط برای پیچیده‌ترین مراحل رزرو کنند. این رویکرد، دستیارهای آفلاین و خصوصی را به یک واقعیت کاربردی تبدیل می‌کند.

مدل Bonsai 27B به‌صورت بومی روی دستگاه‌های اپل (از طریق MLX) و پردازنده‌های انویدیا (از طریق CUDA) اجرا می‌شود. این پروژه توسط تیمی از پژوهشگران Caltech با حمایت Khosla Ventures و گوگل توسعه یافته و تحت لایسنس Apache 2.0 منتشر شده است.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، از API پیش‌نمایش PrismML برای تست جایگزینی مدل‌های ابری با Bonsai در کارهای روتین استفاده کنید.
  • در محیط MLX روی مک، مدل را برای پردازش اسناد محلی و خصوصی آزمایش کنید.
  • بررسی کنید که آیا گردش‌کارهای شما می‌تواند با مدل‌های یک-بیتی و هزینه صفر استنتاج اجرا شود یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص تیم Caltech در کوانتش، سد حافظه را برای استقرار مدل‌های استدلالی روی لبه (Edge) شکست. نتیجه آن، کاهش شدید هزینه‌های عملیاتی برای شرکت‌ها و افزایش حریم خصوصی برای کاربران نهایی است.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights)، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به پرداخت هزینه API یا درگیر شدن با تحریم‌ها، این مدل قدرتمند را به‌صورت محلی روی سخت‌افزارهای موجود اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «تراکم هوش» به‌جای صرفاً کاهش اندازه، نشان می‌دهد که رقابت آینده بر سر بهینه‌سازی سخت‌افزاری است نه فقط افزایش پارامترها. وقتی استدلال سطح بالا روی گوشی ممکن شود، مدل‌های ابری از «تنها منبع هوش» به «لایه نظارتی» تبدیل می‌شوند. این یعنی پایان دوران وابستگی مطلق به API برای کارهای پیچیده.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.