۳.۹ گیگابایت. این تمام حافظهٔ ویدیویی (VRAM) است که PrismML برای اجرای یک مدل ۲۷ میلیارد پارامتری نیاز دارد؛ رقمی که در مقایسه با ۵۴ گیگابایت مورد نیاز برای دقت ۱۶ بیتی، تکاندهنده است.
طبق اعلام این شرکت در ژوئیه ۲۰۲۶، مدل Bonsai 27B ثابت میکند که پیوند سنتی میان تعداد پارامترها و محدودیتهای سختافزاری دیگر مطلق نیست. این تحول در زمانی رخ میدهد که صنعت از نقاط بازرسی یکپارچه به سمت «تبار مدلها» حرکت میکند. در این رویکرد، یک مدل پیشرو بهعنوان منبع اصلی قابلیتها عمل میکند و مدلهای کوچکتر، ردپای استدلالی و چشمانداز احتمالی آن را به ارث میبرند تا در محیطهای خاص مستقر شوند.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای لبه اشاره کردیم، کاهش اثر حافظه کلید دسترسی عمومی به هوش مصنوعی است. بر اساس تحلیل فنی وبسایت thesequence.substack.com، مدل Bonsai 27B از مدل Qwen3.6-27B مشتق شده و در دو قالب فشرده عرضه شده است:
- نسخه ترنری (Ternary): حدود ۵.۹ گیگابایت
- نسخه باینری (Binary): حدود ۳.۹ گیگابایت

برخلاف روشهای متداول تقطیر (Distillation) که بر تابع زیان استاد-شاگرد متکی هستند، PrismML از یک پشته تولیدی ترکیبی شامل آموزش کمبیت سرتاسری، هرس کردن (Pruning) و آموزش آگاه از کوانتش (Quantization) استفاده کرده است. این رویکرد در تضاد با روشهای سنتی فشردهسازی مسیر در برابر تقلید پاسخ قرار دارد که بیشتر بر خروجیهای مدل متمرکز بودند. این سازوکار اجازه میدهد نسخه باینری در بودجه حافظه یک دستگاه موبایل ردهبالا جای بگیرد و در عین حال از قابلیتهای چندوجهی (Multimodal) و استدلال در بستر متن طولانی پشتیبانی کند.

برای جامعه فنی، این اتفاق به معنای گذاری است که در آن «درخت تبار مدل» به واحد ارزش تبدیل میشود. این تحول در راستای تلاشهایی برای فشردهسازی استدلال در وزنهای مدل است تا پیچیدگیهای محاسباتی زمان استنتاج کاهش یابد. توانایی بستهبندی رفتارهای سطح پیشرو در استفاده از ابزار در یک قالب باینری نشان میدهد که گلوگاه هوش مصنوعی روی دستگاه، از ظرفیت خام حافظه به کارایی پشته کوانتش تغییر یافته است. این پیشرفتها در حالی رخ میدهد که شرکتهایی مانند اپل با تبدیل قوانین مقیاسپذیری تقطیر به مسائل ریاضی، استانداردهای جدیدی برای آموزش مدلهای کوچکتر تعریف کردهاند.
گام بعدی شما
- بررسی تأثیر تبارهای کمبیت بر تأخیر استنتاج در NPUهای موبایل در مقایسه با مدلهای ۴ بیتی.
- تست مدل Bonsai روی سختافزارهای لبه برای سنجش نرخ توهم در حالتهای فشرده.
- دنبال کردن توسعه مدلهای مشتقشده از Qwen برای کاربردهای محلی.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو