پرش به محتوای اصلی
پرش به محتوای مقاله

«اجرای مدل‌های بزرگ روی موبایل»، هدف جدید PrismML

·۱۰ شهریور ۱۴۰۵۱ دقیقه مطالعه
شماره ۹۲۴ دانش توالی: مدل‌های تقطیر شده‌ای که باید بشناسید
شماره ۹۲۴ دانش توالی: مدل‌های تقطیر شده‌ای که باید بشناسید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از کوانتش باینری و ترنری برای رساندن مدل ۲۷ میلیارد پارامتری به زیر ۴ گیگابایت حافظه، بدون تخریب شدید قابلیت‌های استدلالی و چندوجهی.

۳.۹ گیگابایت. این تمام حافظهٔ ویدیویی (VRAM) است که PrismML برای اجرای یک مدل ۲۷ میلیارد پارامتری نیاز دارد؛ رقمی که در مقایسه با ۵۴ گیگابایت مورد نیاز برای دقت ۱۶ بیتی، تکان‌دهنده است.

طبق اعلام این شرکت در ژوئیه ۲۰۲۶، مدل Bonsai 27B ثابت می‌کند که پیوند سنتی میان تعداد پارامترها و محدودیت‌های سخت‌افزاری دیگر مطلق نیست. این تحول در زمانی رخ می‌دهد که صنعت از نقاط بازرسی یکپارچه به سمت «تبار مدل‌ها» حرکت می‌کند. در این رویکرد، یک مدل پیشرو به‌عنوان منبع اصلی قابلیت‌ها عمل می‌کند و مدل‌های کوچک‌تر، ردپای استدلالی و چشم‌انداز احتمالی آن را به ارث می‌برند تا در محیط‌های خاص مستقر شوند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های لبه اشاره کردیم، کاهش اثر حافظه کلید دسترسی عمومی به هوش مصنوعی است. بر اساس تحلیل فنی وب‌سایت thesequence.substack.com، مدل Bonsai 27B از مدل Qwen3.6-27B مشتق شده و در دو قالب فشرده عرضه شده است:

  • نسخه ترنری (Ternary): حدود ۵.۹ گیگابایت
  • نسخه باینری (Binary): حدود ۳.۹ گیگابایت

شماره ۹۲۴ دانش توالی: مدل‌های تقطیر‌شده‌ای که باید بشناسید

برخلاف روش‌های متداول تقطیر (Distillation) که بر تابع زیان استاد-شاگرد متکی هستند، PrismML از یک پشته تولیدی ترکیبی شامل آموزش کم‌بیت سرتاسری، هرس کردن (Pruning) و آموزش آگاه از کوانتش (Quantization) استفاده کرده است. این رویکرد در تضاد با روش‌های سنتی فشرده‌سازی مسیر در برابر تقلید پاسخ قرار دارد که بیشتر بر خروجی‌های مدل متمرکز بودند. این سازوکار اجازه می‌دهد نسخه باینری در بودجه حافظه یک دستگاه موبایل رده‌بالا جای بگیرد و در عین حال از قابلیت‌های چندوجهی (Multimodal) و استدلال در بستر متن طولانی پشتیبانی کند.

شماره ۹۲۴ دانش توالی: مدل‌های تقطیرشده‌ای که باید بشناسید

برای جامعه فنی، این اتفاق به معنای گذاری است که در آن «درخت تبار مدل» به واحد ارزش تبدیل می‌شود. این تحول در راستای تلاش‌هایی برای فشرده‌سازی استدلال در وزن‌های مدل است تا پیچیدگی‌های محاسباتی زمان استنتاج کاهش یابد. توانایی بسته‌بندی رفتارهای سطح پیشرو در استفاده از ابزار در یک قالب باینری نشان می‌دهد که گلوگاه هوش مصنوعی روی دستگاه، از ظرفیت خام حافظه به کارایی پشته کوانتش تغییر یافته است. این پیشرفت‌ها در حالی رخ می‌دهد که شرکت‌هایی مانند اپل با تبدیل قوانین مقیاس‌پذیری تقطیر به مسائل ریاضی، استانداردهای جدیدی برای آموزش مدل‌های کوچک‌تر تعریف کرده‌اند.

گام بعدی شما

  • بررسی تأثیر تبار‌های کم‌بیت بر تأخیر استنتاج در NPUهای موبایل در مقایسه با مدل‌های ۴ بیتی.
  • تست مدل Bonsai روی سخت‌افزارهای لبه برای سنجش نرخ توهم در حالت‌های فشرده.
  • دنبال کردن توسعه مدل‌های مشتق‌شده از Qwen برای کاربردهای محلی.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در کوانتش پیشرفته، مرز بین مدل‌های ابری و محلی را از بین می‌برد. اکنون مدل‌های با توان استدلالی بالا بدون نیاز به سرورهای گران‌قیمت، روی سخت‌افزارهای مصرف‌کننده قابل اجرا هستند.

تأثیر برای ایران

این مدل فرصتی برای توسعه‌دهندگان ایرانی است تا مدل‌های قدرتمند را بدون نیاز به GPUهای گران‌قیمت و تحریم‌شده، به‌صورت محلی و روی سخت‌افزارهای موجود اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «تبار مدل» به‌جای مدل‌های تک‌سازه، پارادایم توزیع هوش مصنوعی را تغییر می‌دهد. این رویکرد نشان می‌دهد که استدلال پیچیده لزوماً به دقت‌های محاسباتی بالا نیاز ندارد و می‌توان «منطق» مدل‌های غول‌پیکر را در قالب‌های بسیار فشرده حفظ کرد. در واقع، ارزش مدل‌ها از تعداد پارامترها به کیفیت فرآیند فشرده‌سازی منتقل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.