تصور کنید یک مدل استدلالی قدرتمند با ۲۷ میلیارد پارامتر، بهجای نیاز به سرورهای عظیم، در فضای ۵.۹ گیگابایتی حافظه دستگاه شما جای بگیرد. در ۱۷ سپتامبر ۲۰۲۶، شرکت PrismML از مدل Bonsai 2 27B پردهبرداری کرد؛ نسخهای فشرده از مدل Qwen3.8 27B شرکت علیبابا که اجرای محلی هوش مصنوعی با کارایی بالا را روی PCها و گوشیهای هوشمند ممکن میکند.
این چرخش به سمت هوش محلی در حالی رخ میدهد که صنعت با هزینههای سرسامآور انرژی و زیرساختهای ابری مدلهای زبانی بزرگ (LLM) — که شبیه کتابخانهداری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — دستوپنجه نرم میکند. در حالی که ما پیشتر بررسی کردیم که چگونه میتوان از LLMها بهعنوان ویراستار بدون از دست دادن لحن انسانی استفاده کرد، گلوگاه اصلی همواره سختافزار مورد نیاز برای اجرای خصوصی این مدلها بوده است. PrismML قصد دارد با کوچک کردن مدلهای استدلالی تا حدی که برای دستگاههای مصرفکننده مناسب باشند، این سد سختافزاری را بشکند.
این شرکت تنها بازیگر این میدان نیست. شرکت Multiverse Computing که توسط پروفسوری از مرکز بینالمللی فیزیک دونوستیا در اسپانیا تأسیس شده است، نیز روی فشردهسازی LLMها کار میکند و سرمایههای قابلتوجهی جذب کرده است. با این حال، PrismML روی این فرضیه شرط بسته است که مدلهای استدلالی با عملکرد بالا، برای داشتن توانمندی واقعی، لزوماً نباید حجیم باشند. این رویکرد با روندی همسو است که در آن مدلهای کوچک و وزنباز توانستهاند هزینهی استنتاج عاملهای هوش مصنوعی را تا ۷۰٪ کاهش دهند و کارایی را جایگزین حجم کنند.
این استارتاپ که توسط پژوهشگران کالتک تأسیس شده و تحت رهبری پروفسور بابک حسیبی، متخصص فناوریهای فشردهسازی است، در دور اول جذب سرمایه ۲۲.۲۵ میلیون دلار جذب کرده است. سرمایهگذاران بزرگی چون Khosla Ventures، Cerberus Capital و کالتک از حامیان این پروژه هستند.
همچنین Ion Stoica، از بنیانگذاران Databricks و مدیر آزمایشگاه Sky Computing برکلی، بهعنوان مشاور این شرکت فعالیت میکند. استویکا پیش از این نقش کلیدی در خلق فناوریها و استارتاپهای مختلفی همچون SGLang و Letta داشته است.
طبق گزارش TechCrunch، PrismML از مکانیزم فشردهسازی خاصی به نام «وزنهای سهگانه» (Ternary Weights) استفاده میکند. جزئیات فنی این روش عبارت است از:
- کاهش وزنها: وزنها (Weights) — که در واقع دستور پخت مدل و محل ذخیره اطلاعات آموختهشده در طول آموزش هستند — معمولاً به ۱۶ بیت نیاز دارند. PrismML این مقادیر را به سه حالت ساده +۱، -۱ یا ۰ تبدیل کرده است.
- بهرهوری حافظه: ردپای حافظه مدل در مقایسه با Qwen3.8 اصلی، ۹ تا ۱۰ برابر کاهش یافته است.
- حفظ عملکرد: مدل Bonsai 2 توانسته ۹۸٪ از امتیازات مجموع محکهای (Benchmarks) مدل اصلی را به دست آورد. این رقم نسبت به نسخه اول Bonsai که در ماه مارس منتشر شد و ۹۵٪ بود، پیشرفت قابلتوجهی است.
- پذیرش بازار: نسخه اول این مدل بیش از ۱۱ میلیون بار دانلود شد و مدلهای حتی کوچکتر PrismML نیز ۲.۶ میلیون بار دریافت شدهاند.
Ion Stoica معتقد است این فناوری «هوش در نوک انگشتان» را فراهم میکند که هم رایگان است و هم خصوصی. چون مدل روی سختافزار کاربر اجرا میشود، هیچ دادهای نیاز نیست به ابر ارسال شود.
این دستاورد، این باور رایج را که برای استدلال پیچیده حتماً باید مدلها بزرگتر باشند («بزرگتر همیشه بهتر است»)، به چالش میکشد. PrismML با اثبات اینکه افت ۲ درصدی در بنچمارکها برای کاربر نهایی ناچیز است، پیشنهاد میکند که صنعت میتواند مقدار کمی از دقت تئوریک را فدای دسترسی گسترده و حریم خصوصی کند. پروفسور حسیبی تأکید میکند که بنچمارکها همیشه بازتابدهنده وظایف واقعی نیستند و نرمافزارهای جانبی (Software Harness) نیز بر دقت اثر میگذارند.
برای کاربر عادی، این یعنی تغییر وضعیت از «هوش مصنوعی بهعنوان سرویس» به «هوش مصنوعی بهعنوان یک ابزار محلی». دیگر برای دسترسی به یک مدل استدلالی (Reasoning Model) — مدلی که قبل از جواب، یک قدم درنگ میکند و فکر میکند، شبیه شطرنجبازی که چند حرکت جلوتر را میبیند — نیازی به اشتراک ماهانه یا اتصال به اینترنت نخواهید داشت، به شرطی که یک گوشی ردهبالا یا PC مدرن داشته باشید.
PrismML اکنون هدف خود را روی مدلهای بسیار بزرگتر در مقیاس چند صد میلیارد پارامتر برای نسخههای آتی قرار داده است که امیدوار است طی دو ماه آینده منتشر شوند. حسیبی پیشبینی میکند مدلهای بزرگتر حتی راحتتر فشرده شوند و احتمالاً به ۱۰۰٪ شباهت با نسخه اصلی برسند، چون فضای بیشتری برای حذف دادههای زائد بدون آسیب به هوش مدل وجود دارد.
با حرکت صنعت به سمت عاملهای استدلالی بومی که به سرورهای خارجی وابسته نیستند، احتمال ادغام این فناوری با اکوسیستم اپل وجود دارد. هرچند بابک حسیبی از اظهارنظر درباره مذاکرات با اپل خودداری کرد، اما زیرساخت فنی این اتفاق اکنون مهیاست.
گام بعدی شما
- اگر توسعهدهنده هستید، مدلهای خانواده Qwen را برای تستهای محلی بررسی کنید تا پتانسیل جایگزینی APIهای ابری را بسنجید.
- سختافزارهای خود را برای پشتیبانی از مدلهای کوانتیده (Quantized) بهینهسازی کنید.
- منتظر انتشار نسخههای فشردهتر از مدلهای ۱۰۰ میلیارد پارامتری در ماههای آینده باشید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو