پرش به محتوای اصلی
پرش به محتوای مقاله

POCKET-Darwin: کاهش حجم مدل ۱۸۰ میلیارد پارامتری به ۱۱۱ گیگابایت

·۱۴ مهر ۱۴۰۵۶ دقیقه مطالعه
راهنما
اجرا مدل ۱۸۰ میلیارد پارامتری بدون GPU: POCKET-Darwin-180B با فرمت GGUF در llama.cpp
اجرا مدل ۱۸۰ میلیارد پارامتری بدون GPU: POCKET-Darwin-180B با فرمت GGUF در llama.cpp
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اجرای مدل ۱۸۰ میلیاردی روی CPU بدون افت دقت در بنچمارک MMLU-Pro؛ این نخستین بار است که مدل‌های این مقیاس با کوانتش ۴ بیتی، عملکرد نسخه BF16 را به‌طور کامل بازتولید می‌کنند.

تصور کنید یک لپ‌تاپ معمولی بدون کارت گرافیک قدرتمند، بتواند مدل زبانی با ۱۸۰ میلیارد پارامتر را اجرا کند. انتشار مدل POCKET-Darwin-180B-GGUF در ۶ اکتبر ۲۰۲۶ ثابت کرد که برای بهره‌گیری از ظرفیت مدل‌های عظیم، دیگر نیازی به مزرعه‌های سرور نیست، به شرطی که معماری مدل به اندازه کافی بهینه باشد.

سال‌ها تصور می‌شد اجرای مدلی در این مقیاس نیازمند صدها گیگابایت حافظه VRAM و چندین پردازنده H100 است. اکثر کاربران به یک انتخاب سخت عادت کرده بودند: یا استفاده از مدل‌های کوچک و سریع به‌صورت محلی، یا مدل‌های عظیم و کند در فضای ابری. این انتشار جدید با انتقال گلوگاه از قدرت پردازشی خام به پهنای باند حافظه، این دوگانه را می‌شکند. این دستاورد در واقع پیاده‌سازی عملیِ رویکرد اجرای مدل‌های ۱۸۰ میلیاردی روی سخت‌افزارهای مصرف‌کننده است که پیش‌تر بررسی کرده بودیم.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کاهش وابستگی به سخت‌افزارهای انحصاری، کلید دموکراتیزه کردن هوش مصنوعی است.

راز کارایی در معماری MoE

این مدل بر پایه معماری Darwin-180B-RSI ساخته شده که از ترکیب خبره‌ها (Mixture of Experts یا MoE) — شبیه به تیمی از متخصصان که هر کس فقط در حوزه خودش نظر می‌دهد — استفاده می‌کند. در یک شبکه عصبی متراکم، تمام پارامترها برای هر کلمه فعال می‌شوند، اما این مدل دارای ۵۱۲ شبکه «متخصص» مجزا است. شایان ذکر است که مدل پایه Darwin-180B-RSI پیش از این در ۱۰ شاخص مختلف Hugging Face رتبه اول را کسب کرده بود و قدرت استدلالی خود را به اثبات رسانده بود.

به نقل از مستندات فنی، برای تولید هر توکن (Token) — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — یک مسیریاب تنها ۱۰ متخصص را انتخاب می‌کند. این یعنی با وجود ۱۸۰ میلیارد پارامتر کلی، در هر محاسبه تنها حدود ۳ میلیارد پارامتر فعال هستند.

در یک مدل متراکم ۱۸۰ میلیاردی، سیستم باید تمام ۱۸۰ میلیارد پارامتر را برای هر توکن از حافظه عبور دهد. اما در MoE، بار محاسباتی هر توکن شبیه به یک مدل ۳ میلیاردی است، در حالی که ظرفیت دانشی آن در سطح یک مدل عظیم باقی می‌ماند. در اینجا چالش اصلی از محاسبات خام به نحوه ذخیره‌سازی وزن‌ها و سرعت خواندن آن‌ها تغییر می‌کند.

کوانتش و ردپای حافظه

توسعه‌دهندگان برای جا دادن مدل در سخت‌افزارهای مصرف‌کننده، از کوانتش (Quantization) ۴ بیتی در قالب GGUF استفاده کردند. این فرآیند حجم مدل را از ۳۶۰ گیگابایت در حالت BF16 به ۱۱۱ گیگابایت کاهش داد.

جالب است بدانید تیم سازنده از استراتژی «دقت گزینشی» استفاده کرده است. آن‌ها بخش‌هایی از مدل را که توسط آموزش خودبهبودی VIDRAFT تغییر کرده بود (حدود ۳٪ حجم کل) در دقت بالاتر نگه داشتند تا کیفیت استدلال حفظ شود. نتیجه نهایی ۱۱۱ گیگابایت فضای دیسک است که در ۴ فایل GGUF توزیع شده است. این تمرکز بر آموزش خودبهبودی در حالی صورت می‌گیرد که برخی تحلیلگران در بحث‌های مربوط به «توقف انفجار هوش»، موانع فنی در مسیر تکامل خودکار مدل‌ها را به چالش کشیده‌اند.

بنچمارک‌های عملکرد سخت‌افزاری

طبق گزارش وب‌سایت dev.to، عملکرد مدل بسته به نحوه بارگذاری به‌شدت تغییر می‌کند:

  • سیستم‌های با رم بالا: در یک Mini PC با ۱۲۸ گیگابایت رم، مدل به‌طور کامل در حافظه جای می‌گیرد و بدون GPU اجرا می‌شود. با استفاده از یک CPU ۱۶ رشته‌ای (۱ سوکت)، سرعت به ۱۸.۴ تا ۲۱ توکن در ثانیه می‌رسد و ۷۸.۸ گیگابایت رم اشغال می‌کند.
  • سیستم‌های با رم پایین: در لپ‌تاپی با ۳۲ گیگابایت رم و کارت گرافیک RTX 5060 (با ۸ گیگابایت VRAM)، مدل به‌طور کامل در حافظه جا نمی‌شود. در این حالت از نگاشت حافظه (mmap) از طریق لاماسی‌پلاس‌پلاس (llama.cpp) استفاده می‌شود تا خبره‌های مورد نیاز در لحظه از یک SSD NVMe خوانده شوند که سرعت را به ۴.۱۷ توکن در ثانیه کاهش می‌دهد.

دقت بدون سازش

مهندسان معمولاً می‌ترسند که فشرده‌سازی ۴ بیتی، هوش مدل را نابود کند. با این حال، آزمایش روی محک MMLU-Pro (با ۲۰۰۰ سؤال) نشان داد که هر دو نسخه BF16 و POCKET 4-bit دقیقاً امتیاز ۸۷.۶۵٪ را کسب کردند. این یعنی کوانتش تهاجمی، نرخ موفقیت را در این مجموعه داده کاهش نداده است.

علاوه بر این، آموزش خودبهبودی (RSI) باعث جهشی قابل‌اندازه‌گیری در علوم سطح تحصیلات تکمیلی شد. در محک SuperGPQA (مجموعه‌ای از ۱۰۰۰ سؤال علمی پیشرفته که در طول آموزش استفاده نشده بودند)، نتایج به این ترتیب بود:

  • مدل پایه (۴ بیتی): ۵۹.۱۰٪
  • مدل POCKET (۴ بیتی): ۶۱.۵۵٪

این بهبود ۲.۴۵ واحدی از نظر آماری معنادار است. همچنین نسخه POCKET حدود ۱۳٪ توکن کمتری برای هر سؤال مصرف کرد که نشان می‌دهد مدل موجزتر استدلال می‌کند و پس از یافتن پاسخ، از تکرار بررسی‌ها خودداری می‌کند. این نتایج توسط یک توسعه‌دهنده خارجی در بحث‌های عمومی به‌صورت فایل‌به‌فایل تأیید شده است.

استقرار از طریق llama.cpp

برای اجرای این مدل به نسخه جدید llama.cpp (b11048 یا بالاتر) نیاز است. کاربران می‌توانند ۴ فایل GGUF را از Hugging Face (در مسیر FINAL-Bench/POCKET-Darwin-180B-GGUF) یا ModelScope دانلود کرده و با یک دستور خط فرمان اجرا کنند.

مراحل اجرا:
۱. نصب کلاینت HF: pip install -U "huggingface_hub[cli]"
۲. دانلود فایل‌ها: استفاده از hf download برای دریافت ۱۱۱ گیگابایت داده در یک دایرکتوری محلی.
۳. کامپایل llama.cpp: کلون کردن مخزن و ساخت با استفاده از cmake (در پیکربندی Release).
۴. اجرای استنتاج: استفاده از llama-cli با تعیین مسیر مدل، تعداد رشته‌ها (مطابق با هسته‌های فیزیکی CPU) و اندازه پنجره متنی (مثلاً --ctx-size 8192).

برای محیط‌های عملیاتی و آماده تولید، توسعه‌دهندگان توصیه می‌کنند به‌جای llama-cli از llama-server استفاده شود تا یک API سازگار با رابط‌های چت استاندارد ایجاد گردد.

کاربردهای استراتژیک

این تغییر در نحوه استقرار به این معناست که بخش‌هایی با قوانین سخت‌گیرانه حریم خصوصی داده‌ها — مانند دفاع، امور مالی و بخش دولتی — اکنون می‌توانند مدل‌های استدلالی پیشرفته را به‌طور کاملاً آفلاین میزبانی کنند. دیگر نیازی نیست برای دسترسی به هوش سطح ۱۸۰ میلیاردی، داده‌های حساس را به ارائه‌دهندگان ابری بفرستید؛ مدل در یک سرور محلی یا Mini PC بدون اتصال به اینترنت اجرا می‌شود.

برای یک توسعه‌دهنده معمولی، این موضوع معادله هزینه را تغییر می‌دهد. سروری با ۸ پردازنده H100 صدها هزار دلار هزینه دارد، اما یک لپ‌تاپ گیمینگ میان‌رده با ۸ گیگابایت VRAM و ۳۲ گیگابایت رم، کسری از این مبلغ است. اگرچه سرعت کمتر است، اما برای پردازش‌های دسته‌ای (Batch Processing) و استنتاج محلی کاملاً کاربردی است.

پرسش‌های متداول فنی

  • حداقل سخت‌افزار: یک Mini PC با ۱۲۸ گیگابایت رم برای بارگذاری کامل در حافظه، یا ۳۲ گیگابایت رم به همراه یک SSD NVMe سریع برای حالت mmap.
  • فضای دیسک: ۱۱۱ گیگابایت برای ۴ فایل GGUF، به علاوه فضای اضافی برای کش سیستم‌عامل.
  • سازگاری: به‌طور خاص برای llama.cpp b11048+ تست شده است. پیش از استفاده با ابزارهای دسکتاپ دیگر مانند Ollama یا LM Studio، نسخه‌های موتور را بررسی کنید.
  • در دسترس بودن: در Hugging Face و ModelScope موجود است. مدل اصلی غیرکوانتش شده در مسیر huggingface.co/FINAL-Bench/Darwin-180B-RSI میزبانی می‌شود.

برای شروع، شما به حداقل ۱۱۱ گیگابایت فضای دیسک و یک SSD NVMe سریع نیاز دارید تا تأخیر ناشی از نگاشت حافظه در ماشین‌های با رم پایین به حداقل برسد.

گام بعدی شما

  • اگر رم سیستم شما بالای ۶۴ گیگابایت است، مدل را با llama-server تست کنید تا سرعت استنتاج در حالت Full-RAM را بسنجید.
  • برای سیستم‌های با رم پایین، حتماً از SSD NVMe با سرعت خواندن بالا استفاده کنید تا تأخیر mmap به حداقل برسد.
  • مدل را در محیط آفلاین روی داده‌های حساس خود تست کنید تا تفاوت کیفیت استدلال آن با مدل‌های کوچک‌تر را مشاهده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در کوانتش و معماری MoE، سد سخت‌افزاری برای اجرای مدل‌های غول‌پیکر را می‌شکند. اکنون سازمان‌های حساس می‌توانند بدون ریسک نشت داده در ابر، از استدلال سطح بالا بهره‌مند شوند.

تأثیر برای ایران

این مدل فرصتی استثنایی برای توسعه‌دهندگان ایرانی است تا بدون نیاز به پرداخت هزینه‌های دلاری APIها یا درگیر شدن با تحریم‌های سخت‌گیرانه GPU، مدل‌های سطح جهانی را روی سرورهای داخلی میزبانی کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی پهنای باند حافظه با قدرت پردازشی خام، پارادایم استقرار مدل‌های بزرگ را تغییر می‌دهد. این رویکرد نشان می‌دهد که مدل‌های آینده احتمالاً به جای افزایش متراکم پارامترها، به سمت معماری‌های پراکنده (Sparse) می‌روند تا روی سخت‌افزارهای لبه قابل اجرا باشند. در واقع، «ظرفیت دانش» از یک کالای گران‌قیمت ابری به یک دارایی محلی تبدیل می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.