پرش به محتوای اصلی
پرش به محتوای مقاله

PrismML: کاهش ۹ برابری اثر حافظه با حفظ ۹۸٪ دقت Qwen

·۲۷ شهریور ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
لوگوی استارتاپ PrismML روی پس‌زمینه‌ای گرادیانتی بنفش و آبی.
لوگوی استارتاپ PrismML روی پس‌زمینه‌ای گرادیانتی بنفش و آبی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از وزن‌های سه‌گانه برای رسیدن به ۹۸٪ شباهت عملکردی در حالی که حجم مدل ۹ برابر کم شده است؛ این یعنی عبور از مرز «فشرده‌سازی با افت کیفیت شدید» به «فشرده‌سازی نامحسوس».

تصور کنید یک مدل استدلالی قدرتمند با ۲۷ میلیارد پارامتر، به‌جای نیاز به سرورهای عظیم، در فضای ۵.۹ گیگابایتی حافظه دستگاه شما جای بگیرد. در ۱۷ سپتامبر ۲۰۲۶، شرکت PrismML از مدل Bonsai 2 27B پرده‌برداری کرد؛ نسخه‌ای فشرده از مدل Qwen3.8 27B شرکت علی‌بابا که اجرای محلی هوش مصنوعی با کارایی بالا را روی PCها و گوشی‌های هوشمند ممکن می‌کند.

این چرخش به سمت هوش محلی در حالی رخ می‌دهد که صنعت با هزینه‌های سرسام‌آور انرژی و زیرساخت‌های ابری مدل‌های زبانی بزرگ (LLM) — که شبیه کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — دست‌وپنجه نرم می‌کند. در حالی که ما پیش‌تر بررسی کردیم که چگونه می‌توان از LLMها به‌عنوان ویراستار بدون از دست دادن لحن انسانی استفاده کرد، گلوگاه اصلی همواره سخت‌افزار مورد نیاز برای اجرای خصوصی این مدل‌ها بوده است. PrismML قصد دارد با کوچک کردن مدل‌های استدلالی تا حدی که برای دستگاه‌های مصرف‌کننده مناسب باشند، این سد سخت‌افزاری را بشکند.

این شرکت تنها بازیگر این میدان نیست. شرکت Multiverse Computing که توسط پروفسوری از مرکز بین‌المللی فیزیک دونوستیا در اسپانیا تأسیس شده است، نیز روی فشرده‌سازی LLMها کار می‌کند و سرمایه‌های قابل‌توجهی جذب کرده است. با این حال، PrismML روی این فرضیه شرط بسته است که مدل‌های استدلالی با عملکرد بالا، برای داشتن توانمندی واقعی، لزوماً نباید حجیم باشند. این رویکرد با روندی همسو است که در آن مدل‌های کوچک و وزن‌باز توانسته‌اند هزینه‌ی استنتاج عامل‌های هوش مصنوعی را تا ۷۰٪ کاهش دهند و کارایی را جایگزین حجم کنند.

این استارتاپ که توسط پژوهشگران کال‌تک تأسیس شده و تحت رهبری پروفسور بابک حسیبی، متخصص فناوری‌های فشرده‌سازی است، در دور اول جذب سرمایه ۲۲.۲۵ میلیون دلار جذب کرده است. سرمایه‌گذاران بزرگی چون Khosla Ventures، Cerberus Capital و کال‌تک از حامیان این پروژه هستند.

همچنین Ion Stoica، از بنیان‌گذاران Databricks و مدیر آزمایشگاه Sky Computing برکلی، به‌عنوان مشاور این شرکت فعالیت می‌کند. استویکا پیش از این نقش کلیدی در خلق فناوری‌ها و استارتاپ‌های مختلفی همچون SGLang و Letta داشته است.

طبق گزارش TechCrunch، PrismML از مکانیزم فشرده‌سازی خاصی به نام «وزن‌های سه‌گانه» (Ternary Weights) استفاده می‌کند. جزئیات فنی این روش عبارت است از:

  • کاهش وزن‌ها: وزن‌ها (Weights) — که در واقع دستور پخت مدل و محل ذخیره اطلاعات آموخته‌شده در طول آموزش هستند — معمولاً به ۱۶ بیت نیاز دارند. PrismML این مقادیر را به سه حالت ساده +۱، -۱ یا ۰ تبدیل کرده است.
  • بهره‌وری حافظه: ردپای حافظه مدل در مقایسه با Qwen3.8 اصلی، ۹ تا ۱۰ برابر کاهش یافته است.
  • حفظ عملکرد: مدل Bonsai 2 توانسته ۹۸٪ از امتیازات مجموع محک‌های (Benchmarks) مدل اصلی را به دست آورد. این رقم نسبت به نسخه اول Bonsai که در ماه مارس منتشر شد و ۹۵٪ بود، پیشرفت قابل‌توجهی است.
  • پذیرش بازار: نسخه اول این مدل بیش از ۱۱ میلیون بار دانلود شد و مدل‌های حتی کوچک‌تر PrismML نیز ۲.۶ میلیون بار دریافت شده‌اند.

Ion Stoica معتقد است این فناوری «هوش در نوک انگشتان» را فراهم می‌کند که هم رایگان است و هم خصوصی. چون مدل روی سخت‌افزار کاربر اجرا می‌شود، هیچ داده‌ای نیاز نیست به ابر ارسال شود.

این دستاورد، این باور رایج را که برای استدلال پیچیده حتماً باید مدل‌ها بزرگ‌تر باشند («بزرگ‌تر همیشه بهتر است»)، به چالش می‌کشد. PrismML با اثبات اینکه افت ۲ درصدی در بنچمارک‌ها برای کاربر نهایی ناچیز است، پیشنهاد می‌کند که صنعت می‌تواند مقدار کمی از دقت تئوریک را فدای دسترسی گسترده و حریم خصوصی کند. پروفسور حسیبی تأکید می‌کند که بنچمارک‌ها همیشه بازتاب‌دهنده وظایف واقعی نیستند و نرم‌افزارهای جانبی (Software Harness) نیز بر دقت اثر می‌گذارند.

برای کاربر عادی، این یعنی تغییر وضعیت از «هوش مصنوعی به‌عنوان سرویس» به «هوش مصنوعی به‌عنوان یک ابزار محلی». دیگر برای دسترسی به یک مدل استدلالی (Reasoning Model) — مدلی که قبل از جواب، یک قدم درنگ می‌کند و فکر می‌کند، شبیه شطرنج‌بازی که چند حرکت جلوتر را می‌بیند — نیازی به اشتراک ماهانه یا اتصال به اینترنت نخواهید داشت، به شرطی که یک گوشی رده‌بالا یا PC مدرن داشته باشید.

PrismML اکنون هدف خود را روی مدل‌های بسیار بزرگ‌تر در مقیاس چند صد میلیارد پارامتر برای نسخه‌های آتی قرار داده است که امیدوار است طی دو ماه آینده منتشر شوند. حسیبی پیش‌بینی می‌کند مدل‌های بزرگ‌تر حتی راحت‌تر فشرده شوند و احتمالاً به ۱۰۰٪ شباهت با نسخه اصلی برسند، چون فضای بیشتری برای حذف داده‌های زائد بدون آسیب به هوش مدل وجود دارد.

با حرکت صنعت به سمت عامل‌های استدلالی بومی که به سرورهای خارجی وابسته نیستند، احتمال ادغام این فناوری با اکوسیستم اپل وجود دارد. هرچند بابک حسیبی از اظهارنظر درباره مذاکرات با اپل خودداری کرد، اما زیرساخت فنی این اتفاق اکنون مهیاست.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل‌های خانواده Qwen را برای تست‌های محلی بررسی کنید تا پتانسیل جایگزینی APIهای ابری را بسنجید.
  • سخت‌افزارهای خود را برای پشتیبانی از مدل‌های کوانتیده (Quantized) بهینه‌سازی کنید.
  • منتظر انتشار نسخه‌های فشرده‌تر از مدل‌های ۱۰۰ میلیارد پارامتری در ماه‌های آینده باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با تکیه بر تخصص در فشرده‌سازی داده‌ها، مدل‌های استدلالی را از مراکز داده به جیب کاربران منتقل می‌کند. نتیجه این تغییر، کاهش شدید هزینه‌های عملیاتی برای شرکت‌ها و تضمین حریم خصوصی مطلق برای کاربران نهایی است.

تأثیر برای ایران

این مدل به‌دلیل اجرای محلی و عدم نیاز به API، محدودیت‌های تحریمی و دسترسی به سرورهای خارجی را برای برنامه‌نویسان ایرانی حذف می‌کند.

·نگاه ما
تحریریه دات‌هوش

فشرده‌سازی مدل‌ها از یک بهینه‌سازی فنی به یک استراتژی رقابتی تبدیل شده است. وقتی افت ۲ درصدی دقت در برابر کاهش ۹ برابری هزینه و حذف وابستگی به ابر قرار می‌گیرد، برنده قطعی دسترسی محلی است. این روند نشان می‌دهد که «قوانین مقیاس‌پذیری» (Scaling Laws) ممکن است در لایه استنتاج، مسیر متفاوتی را طی کنند و لزوماً بزرگ‌تر بودن به معنای برتری عملی نباشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.