پرش به محتوای اصلی
پرش به محتوای مقاله

POCKET-Darwin-180B: اجرای مدل ۱۸۰ میلیارد پارامتری روی لپ‌تاپ‌های معمولی

·۱۴ مهر ۱۴۰۵۶ دقیقه مطالعه
اجرا مدل ۱۸۰ میلیارد پارامتری روی لپ‌تاپ بدون GPU: چگونه GGUF ۴ بیتی دقت کامل را حفظ می‌کند
اجرا مدل ۱۸۰ میلیارد پارامتری روی لپ‌تاپ بدون GPU: چگونه GGUF ۴ بیتی دقت کامل را حفظ می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از کوانتش گزینشی (Selective Quantization) که اجازه می‌دهد مدل ۱۸۰ میلیاردی بدون افت دقت در بنچمارک‌ها، روی سخت‌افزارهای معمولی اجرا شود؛ در حالی که کوانتش‌های قبلی همواره منجر به کاهش هوش مدل می‌شدند.

تصور کنید یک مدل زبانی با ۱۸۰ میلیارد پارامتر را بدون نیاز به سرورهای گران‌قیمت، مستقیماً روی لپ‌تاپ شخصی خود اجرا کنید. این سناریو که تا پیش از این غیرممکن به نظر می‌رسید، اکنون با معرفی POCKET-Darwin-180B-GGUF به واقعیت تبدیل شده است. ۱۸۰ میلیارد پارامتر؛ تا همین اواخر، مدلی در این مقیاس برای عملکرد صحیح به یک رک سخت‌افزاری کامل از GPUها در یک مرکز داده نیاز داشت.

طبق گزارش فنی منتشر شده در ۶ اکتبر ۲۰۲۶، این مدل از طریق یک طرح تخصصی کوانتش (Quantization) — شبیه به فشرده‌سازی یک فایل حجیم برای جا شدن در فلش‌مموری بدون از دست دادن محتوای اصلی — استنتاج در سطح مدل‌های پیشرو را روی لپ‌تاپ‌ها و مینی‌پی‌سی‌ها ممکن کرده است. برای سال‌ها تصور می‌شد اجرای چنین مقیاسی نیازمند صدها گیگابایت حافظه ویدیویی (VRAM) است و توسعه‌دهندگان برای فرار از تأخیر شدید پردازشگر مرکزی (CPU)، به APIهای ابری یا کلاسترهای سخت‌افزاری عظیم پناه می‌بردند. اما این بیلد جدید با بهینه‌سازی نحوه ذخیره و دسترسی به وزن‌ها در حافظه، این پیش‌فرض را شکست.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کلید موفقیت در کاهش نیازهای سخت‌افزاری بدون افت کیفیت نهفته است. عملکرد این مدل شبیه به خواندن یک کتابخانه عظیم است که در آن برای پاسخ به یک سؤال، فقط به ۱۰ کتاب خاص نیاز دارید؛ مدل به جای فعال کردن کل ۱۸۰ میلیارد پارامتر برای هر کلمه‌ای که تولید می‌کند، تنها بخش کوچکی از «مغز» خود را به کار می‌گیرد.

معماری پراکندگی

به نقل از گزارش dev.to، این مدل از معماری ترکیب خبره‌ها (Mixture-of-Experts یا MoE) استفاده می‌کند. این ساختار شامل ۵۱۲ زیرشبکه متخصص است، اما مسیریاب مدل برای هر توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — تنها ۱۰ خبره را انتخاب می‌کند. این یعنی در هر لحظه فقط حدود ۳ میلیارد پارامتر فعال هستند. این رویکرد یادآور مدل Colibrì است که پیش‌تر توانست یک مدل ۱۵۰ میلیاردی را با کمترین گلوگاه ذخیره‌سازی روی لپ‌تاپ اجرا کند.

در حالی که وزن‌های خبره‌ها بر حسب نیاز خوانده می‌شوند، بخش‌های متراکم مدل شامل توجه (Attention)، مسیریابی و بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که همسایگی آن با کلمات دیگر را مشخص می‌کند — در هر مرحله اجرا می‌شوند. این ساختار ترکیبی است که مدل را روی سخت‌افزارهای مصرف‌کننده قابل مدیریت می‌کند.

این پراکندگی به لاماسی‌پلاس‌پلاس (llama.cpp) اجازه می‌دهد از نقشه‌برداری حافظه (Memory-mapping) استفاده کند. سیستم‌عامل تنسورهای خبره را بر اساس نیاز از دیسک به رم منتقل (Page in/out) می‌کند. بنابراین برای دریافت پاسخ، نیازی نیست تمام ۱۱۱ گیگابایت مدل به صورت مقیم در حافظه باشد، هرچند داشتن رم بیشتر سرعت را به‌شدت افزایش می‌دهد.

اجرا مدل ۱۸۰ میلیارد پارامتری روی لپ‌تاپ بدون GPU: دقت کامل با فرمت ۴ بیتی GGUF

کوانتش گزینشی و حفظ دقت

کوانتش استاندارد ۴ بیتی معمولاً هوش مدل را کاهش می‌دهد، اما POCKET-Darwin با استراتژی «دقت گزینشی» از این مشکل عبور کرده است. این بیلد از یک کوانتش ۴ بیتی تأییدشده توسط جامعه کاربران برای وزن‌های پایه شروع می‌شود. بر روی این پایه، تنها بخشی که آموزش خودبهبودی (Self-improvement training) واقعاً تغییر داده است — که تقریباً ۳٪ از حجم کل است — با دقت بالاتری نگه داشته شده است.

توسعه‌دهندگان با تخصیص بودجه بیتی در نقاطی که سیگنال قوی‌تر است، به‌جای اعمال یکنواخت کوانتش، مدلی ساختند که به‌جای «۴ بیتی و دارای افت کیفیت»، به مدلی «۴ بیتی و بدون افت در بنچمارک» تبدیل شد.

این رویکرد در محک MMLU-Pro نتیجه‌ای خیره‌کننده داشت. در یک مقایسه جفت‌شده روی ۲۰۰۰ سؤال با استفاده از رمزگشایی (Decoding) یکسان، هر دو نسخه BF16 (اصلی) و نسخه ۴ بیتی، دقیقاً امتیاز ۸۷.۶۵٪ را کسب کردند. افت دقت عملاً صفر بود زیرا حیاتی‌ترین سیگنال‌های مرتبط با وظایف حفظ شده بودند. برای بهبود سرعت در این مرحله از رمزگشایی، می‌توان از تکنیک‌های جدید دور زدن گلوگاه حافظه برای شتاب‌بخشی به تولید توکن‌ها بهره برد.

بنچمارک‌های عملکرد

عملکرد مدل بسته به سقف حافظه سخت‌افزار به شدت متفاوت است. این مدل در Hugging Face و ModelScope به صورت بیلد GGUF عرضه شده و از نسخه ۳۶۰ گیگابایتی BF16 (شامل ۱۳۱ فایل) به نسخه ۱۱۱ گیگابایتی ۴ بیتی (شامل ۴ فایل) کاهش یافته است:

  • پردازنده سرور (۱۶ رشته): تولید ۱۸.۴ تا ۲۱.۰ توکن در ثانیه با حداکثر مصرف حافظه ۷۸.۸ گیگابایت.
  • مینی‌پی‌سی (۱۲۸ گیگابایت رم): کل مدل در حافظه جای می‌گیرد تا حداکثر توان عملیاتی حاصل شود و از صفحه‌بندی دیسک (Disk paging) جلوگیری شود.
  • لپ‌تاپ (RTX 5060, 32GB RAM): سرعت ۴.۱۷ توکن در ثانیه. به دلیل اینکه VRAM ۸ گیگابایتی تنها می‌تواند بخشی از لایه‌ها را نگه دارد، بیشتر فشار روی CPU و رم است و مدل به شدت به سرعت صفحه‌بندی سیستم‌عامل از یک SSD NVMe وابسته است.

در محک SuperGPQA که ۱۰۰۰ سؤال سطح تحصیلات تکمیلی در علوم را می‌سنجد (سؤالاتی که هرگز در آموزش استفاده نشده‌اند)، نسخه POCKET امتیاز ۶۱.۵۵٪ را کسب کرد که ۲.۴۵ واحد بیشتر از مدل ۴ بیتی پایه (۵۹.۱۰٪) است. این افزایش ۲.۴۵ واحدی از نظر آماری معنادار بود. علاوه بر این، نسخه POCKET حدود ۱۳٪ توکن کمتری برای هر سؤال مصرف کرد؛ این موضوع نشان می‌دهد که آموزش خودبهبودی به مدل یاد داده است که به‌جای استدلال مجدد و طولانی، مستقیماً روی پاسخ متعهد شود.

الزامات استقرار

برای بازتولید این نتایج، کاربران به نسخه جدید llama.cpp (b11048 یا بالاتر) و چهار تکه فایل GGUF به مجموع ۱۱۱ گیگابایت نیاز دارند. این فرآیند کاملاً محلی است و نیازی به حساب ابری یا درایورهای پیچیده GPU برای مسیر پردازش CPU ندارد.

مراحل اجرا:

  • Build: کلون کردن مخزن llama.cpp و بیلد با CMake در حالت Release.
  • Download: دریافت چهار تکه فایل از مسیر FINAL-Bench/POCKET-Darwin-180B-GGUF در Hugging Face یا ModelScope.
  • Execute: اجرا از طریق llama-cli با فلگ -m برای مدل، -t 16 برای رشته‌ها و -c 8192 برای پنجره متنی (Context).

کاربران باید تعداد رشته‌ها (-t) را دقیقاً با هسته‌های فیزیکی CPU خود تطبیق دهند، زیرا تخصیص بیش از حد رشته‌ها (Oversubscribing) معمولاً سرعت تولید را کاهش می‌دهد. همچنین افزایش طول زمینه (-c) باعث افزایش فضای اشغال‌شده توسط KV Cache در کنار وزن‌ها می‌شود که نیازمند رم در دسترس بیشتری است. این نیاز به حافظه در مقایسه با چالش‌های تنظیم دقیق مدل‌های کوچک‌تر که حتی برای مدل‌های ۷ میلیاردی به رم‌های حجیم نیاز دارند، در حالت استنتاج بهینه‌تر شده است.

چرخش به سمت حاکمیت داده‌ها

این پیشرفت بحث را از «توان عملیاتی خام» به «حاکمیت داده‌ها» تغییر می‌دهد. اگرچه ۴ توکن در ثانیه برای یک محصول چت تجاری کند است، اما برای محیط‌های ایزوله (Air-gapped) یک پیروزی بزرگ است.

در بخش‌های دفاعی، مالی یا زیرساخت‌های دولتی، توانایی اجرای یک مدل ۱۸۰ میلیاردی روی یک باکس محلی بدون اتصال به اینترنت، یک امتیاز نیست، بلکه تنها سیاست امنیتی پذیرفتنی است. هوش مصنوعی لبه اکنون کمتر درباره میلی‌ثانیه‌ها و بیشتر درباره این است که بایت‌ها کجا اجازه اقامت دارند.

اگر در محیطی امن فعالیت می‌کنید، پذیرفتن سرعت کمتر در برابر حریم خصوصی اکنون یک واقعیت کاربردی است. گلوگاه از VRAM گرافیک به سرعت صفحه‌بندی SSD منتقل شده است. برای کارهای دسته‌ای (Batch jobs)، پیش‌نویس‌ها یا گام‌های عامل‌محور (Agent steps) که تأخیر را تحمل می‌کنند، یک CPU سرور با سرعت ۲۱ توکن در ثانیه، جایگزینی بسیار بهینه برای ابر است.

گام بعدی شما

  • اگر لپ‌تاپی با رم بالای ۳۲ گیگابایت و SSD سریع دارید، بیلد GGUF را برای تست کارهای آفلاین دانلود کنید.
  • تعداد رشته‌های پردازشی را با هسته‌های فیزیکی CPU خود تطبیق دهید تا از افت سرعت جلوگیری کنید.
  • برای کاربردهای حساس امنیتی، مدل را در محیط ایزوله تست کنید تا تفاوت تأخیر در مقابل حریم خصوصی را بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در معماری MoE، وابستگی سازمان‌های حساس به زیرساخت‌های ابری را از بین می‌برد. اکنون حاکمیت داده‌ها در مقیاس مدل‌های پیشرو، بدون نیاز به سرمایه‌گذاری میلیونی در سخت‌افزار، امکان‌پذیر است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت‌های دسترسی به APIهای ابری و تحریم‌های سخت‌افزاری مواجه‌اند، اجرای محلی مدل‌های پیشرو یک راهکار حیاتی است. این مدل امکان پیاده‌سازی سیستم‌های تحلیل داده حساس را به‌صورت کاملاً آفلاین فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

انتقال مدل‌های ۱۸۰ میلیاردی به سخت‌افزار مصرف‌کننده، مفهوم «دسترسی» را بازتعریف می‌کند. این اتفاق نشان می‌دهد که بهینه‌سازی‌های نرم‌افزاری مانند کوانتش گزینشی می‌توانند شکاف سخت‌افزاری بین مراکز داده و کاربران خانگی را به‌طور چشم‌گیری کاهش دهند. به نظر ما، این مسیر به سمت مدل‌هایی می‌رود که به‌جای بزرگ‌تر شدن، «هوشمندتر در مصرف منابع» می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.