تصور کنید یک لپتاپ معمولی بدون کارت گرافیک قدرتمند، بتواند مدل زبانی با ۱۸۰ میلیارد پارامتر را اجرا کند. انتشار مدل POCKET-Darwin-180B-GGUF در ۶ اکتبر ۲۰۲۶ ثابت کرد که برای بهرهگیری از ظرفیت مدلهای عظیم، دیگر نیازی به مزرعههای سرور نیست، به شرطی که معماری مدل به اندازه کافی بهینه باشد.
سالها تصور میشد اجرای مدلی در این مقیاس نیازمند صدها گیگابایت حافظه VRAM و چندین پردازنده H100 است. اکثر کاربران به یک انتخاب سخت عادت کرده بودند: یا استفاده از مدلهای کوچک و سریع بهصورت محلی، یا مدلهای عظیم و کند در فضای ابری. این انتشار جدید با انتقال گلوگاه از قدرت پردازشی خام به پهنای باند حافظه، این دوگانه را میشکند. این دستاورد در واقع پیادهسازی عملیِ رویکرد اجرای مدلهای ۱۸۰ میلیاردی روی سختافزارهای مصرفکننده است که پیشتر بررسی کرده بودیم.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای بازمتن اشاره کردیم، کاهش وابستگی به سختافزارهای انحصاری، کلید دموکراتیزه کردن هوش مصنوعی است.
راز کارایی در معماری MoE
این مدل بر پایه معماری Darwin-180B-RSI ساخته شده که از ترکیب خبرهها (Mixture of Experts یا MoE) — شبیه به تیمی از متخصصان که هر کس فقط در حوزه خودش نظر میدهد — استفاده میکند. در یک شبکه عصبی متراکم، تمام پارامترها برای هر کلمه فعال میشوند، اما این مدل دارای ۵۱۲ شبکه «متخصص» مجزا است. شایان ذکر است که مدل پایه Darwin-180B-RSI پیش از این در ۱۰ شاخص مختلف Hugging Face رتبه اول را کسب کرده بود و قدرت استدلالی خود را به اثبات رسانده بود.
به نقل از مستندات فنی، برای تولید هر توکن (Token) — تکههای کوچکی از متن که مدل تکهتکه میخورد — یک مسیریاب تنها ۱۰ متخصص را انتخاب میکند. این یعنی با وجود ۱۸۰ میلیارد پارامتر کلی، در هر محاسبه تنها حدود ۳ میلیارد پارامتر فعال هستند.
در یک مدل متراکم ۱۸۰ میلیاردی، سیستم باید تمام ۱۸۰ میلیارد پارامتر را برای هر توکن از حافظه عبور دهد. اما در MoE، بار محاسباتی هر توکن شبیه به یک مدل ۳ میلیاردی است، در حالی که ظرفیت دانشی آن در سطح یک مدل عظیم باقی میماند. در اینجا چالش اصلی از محاسبات خام به نحوه ذخیرهسازی وزنها و سرعت خواندن آنها تغییر میکند.
کوانتش و ردپای حافظه
توسعهدهندگان برای جا دادن مدل در سختافزارهای مصرفکننده، از کوانتش (Quantization) ۴ بیتی در قالب GGUF استفاده کردند. این فرآیند حجم مدل را از ۳۶۰ گیگابایت در حالت BF16 به ۱۱۱ گیگابایت کاهش داد.
جالب است بدانید تیم سازنده از استراتژی «دقت گزینشی» استفاده کرده است. آنها بخشهایی از مدل را که توسط آموزش خودبهبودی VIDRAFT تغییر کرده بود (حدود ۳٪ حجم کل) در دقت بالاتر نگه داشتند تا کیفیت استدلال حفظ شود. نتیجه نهایی ۱۱۱ گیگابایت فضای دیسک است که در ۴ فایل GGUF توزیع شده است. این تمرکز بر آموزش خودبهبودی در حالی صورت میگیرد که برخی تحلیلگران در بحثهای مربوط به «توقف انفجار هوش»، موانع فنی در مسیر تکامل خودکار مدلها را به چالش کشیدهاند.
بنچمارکهای عملکرد سختافزاری
طبق گزارش وبسایت dev.to، عملکرد مدل بسته به نحوه بارگذاری بهشدت تغییر میکند:
- سیستمهای با رم بالا: در یک Mini PC با ۱۲۸ گیگابایت رم، مدل بهطور کامل در حافظه جای میگیرد و بدون GPU اجرا میشود. با استفاده از یک CPU ۱۶ رشتهای (۱ سوکت)، سرعت به ۱۸.۴ تا ۲۱ توکن در ثانیه میرسد و ۷۸.۸ گیگابایت رم اشغال میکند.
- سیستمهای با رم پایین: در لپتاپی با ۳۲ گیگابایت رم و کارت گرافیک RTX 5060 (با ۸ گیگابایت VRAM)، مدل بهطور کامل در حافظه جا نمیشود. در این حالت از نگاشت حافظه (mmap) از طریق لاماسیپلاسپلاس (llama.cpp) استفاده میشود تا خبرههای مورد نیاز در لحظه از یک SSD NVMe خوانده شوند که سرعت را به ۴.۱۷ توکن در ثانیه کاهش میدهد.
دقت بدون سازش
مهندسان معمولاً میترسند که فشردهسازی ۴ بیتی، هوش مدل را نابود کند. با این حال، آزمایش روی محک MMLU-Pro (با ۲۰۰۰ سؤال) نشان داد که هر دو نسخه BF16 و POCKET 4-bit دقیقاً امتیاز ۸۷.۶۵٪ را کسب کردند. این یعنی کوانتش تهاجمی، نرخ موفقیت را در این مجموعه داده کاهش نداده است.
علاوه بر این، آموزش خودبهبودی (RSI) باعث جهشی قابلاندازهگیری در علوم سطح تحصیلات تکمیلی شد. در محک SuperGPQA (مجموعهای از ۱۰۰۰ سؤال علمی پیشرفته که در طول آموزش استفاده نشده بودند)، نتایج به این ترتیب بود:
- مدل پایه (۴ بیتی): ۵۹.۱۰٪
- مدل POCKET (۴ بیتی): ۶۱.۵۵٪
این بهبود ۲.۴۵ واحدی از نظر آماری معنادار است. همچنین نسخه POCKET حدود ۱۳٪ توکن کمتری برای هر سؤال مصرف کرد که نشان میدهد مدل موجزتر استدلال میکند و پس از یافتن پاسخ، از تکرار بررسیها خودداری میکند. این نتایج توسط یک توسعهدهنده خارجی در بحثهای عمومی بهصورت فایلبهفایل تأیید شده است.
استقرار از طریق llama.cpp
برای اجرای این مدل به نسخه جدید llama.cpp (b11048 یا بالاتر) نیاز است. کاربران میتوانند ۴ فایل GGUF را از Hugging Face (در مسیر FINAL-Bench/POCKET-Darwin-180B-GGUF) یا ModelScope دانلود کرده و با یک دستور خط فرمان اجرا کنند.
مراحل اجرا:
۱. نصب کلاینت HF: pip install -U "huggingface_hub[cli]"
۲. دانلود فایلها: استفاده از hf download برای دریافت ۱۱۱ گیگابایت داده در یک دایرکتوری محلی.
۳. کامپایل llama.cpp: کلون کردن مخزن و ساخت با استفاده از cmake (در پیکربندی Release).
۴. اجرای استنتاج: استفاده از llama-cli با تعیین مسیر مدل، تعداد رشتهها (مطابق با هستههای فیزیکی CPU) و اندازه پنجره متنی (مثلاً --ctx-size 8192).
برای محیطهای عملیاتی و آماده تولید، توسعهدهندگان توصیه میکنند بهجای llama-cli از llama-server استفاده شود تا یک API سازگار با رابطهای چت استاندارد ایجاد گردد.
کاربردهای استراتژیک
این تغییر در نحوه استقرار به این معناست که بخشهایی با قوانین سختگیرانه حریم خصوصی دادهها — مانند دفاع، امور مالی و بخش دولتی — اکنون میتوانند مدلهای استدلالی پیشرفته را بهطور کاملاً آفلاین میزبانی کنند. دیگر نیازی نیست برای دسترسی به هوش سطح ۱۸۰ میلیاردی، دادههای حساس را به ارائهدهندگان ابری بفرستید؛ مدل در یک سرور محلی یا Mini PC بدون اتصال به اینترنت اجرا میشود.
برای یک توسعهدهنده معمولی، این موضوع معادله هزینه را تغییر میدهد. سروری با ۸ پردازنده H100 صدها هزار دلار هزینه دارد، اما یک لپتاپ گیمینگ میانرده با ۸ گیگابایت VRAM و ۳۲ گیگابایت رم، کسری از این مبلغ است. اگرچه سرعت کمتر است، اما برای پردازشهای دستهای (Batch Processing) و استنتاج محلی کاملاً کاربردی است.
پرسشهای متداول فنی
- حداقل سختافزار: یک Mini PC با ۱۲۸ گیگابایت رم برای بارگذاری کامل در حافظه، یا ۳۲ گیگابایت رم به همراه یک SSD NVMe سریع برای حالت mmap.
- فضای دیسک: ۱۱۱ گیگابایت برای ۴ فایل GGUF، به علاوه فضای اضافی برای کش سیستمعامل.
- سازگاری: بهطور خاص برای llama.cpp b11048+ تست شده است. پیش از استفاده با ابزارهای دسکتاپ دیگر مانند Ollama یا LM Studio، نسخههای موتور را بررسی کنید.
- در دسترس بودن: در Hugging Face و ModelScope موجود است. مدل اصلی غیرکوانتش شده در مسیر
huggingface.co/FINAL-Bench/Darwin-180B-RSIمیزبانی میشود.
برای شروع، شما به حداقل ۱۱۱ گیگابایت فضای دیسک و یک SSD NVMe سریع نیاز دارید تا تأخیر ناشی از نگاشت حافظه در ماشینهای با رم پایین به حداقل برسد.
گام بعدی شما
- اگر رم سیستم شما بالای ۶۴ گیگابایت است، مدل را با
llama-serverتست کنید تا سرعت استنتاج در حالت Full-RAM را بسنجید. - برای سیستمهای با رم پایین، حتماً از SSD NVMe با سرعت خواندن بالا استفاده کنید تا تأخیر mmap به حداقل برسد.
- مدل را در محیط آفلاین روی دادههای حساس خود تست کنید تا تفاوت کیفیت استدلال آن با مدلهای کوچکتر را مشاهده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو