پرش به محتوای اصلی
پرش به محتوای مقاله

«تبدیل GPUهای شخصی به ابرکامپیوتر»؛ هدف فنی پروژه Mesh LLM

·۲۱ تیر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
شبکه مش: محاسبات هوش مصنوعی توزیع‌شده بر روی iroh
شبکه مش: محاسبات هوش مصنوعی توزیع‌شده بر روی iroh
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل GPUهای پراکنده در مکان‌های مختلف به یک خوشه واحد سازگار با OpenAI از طریق لایه شبکه غیرمتمرکز؛ برخلاف روش‌های سنتی، نیازی به سرور مرکزی یا تنظیمات پیچیده شبکه برای هر گره نیست.

تصور کنید مجموعه‌ای از کارت‌های گرافیک معمولی در دفاتر مختلف، اکنون بتوانند مانند یک ابرکامپیوتر غول‌پیکر عمل کنند. Mesh LLM که در ۱۱ ژوئیه ۲۰۲۶ منتشر شد، به کاربران اجازه می‌دهد تا حافظه موجود در چندین دستگاه را تجمیع کرده و مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — را بدون نیاز به مراکز داده متمرکز اجرا کنند.

بسیاری از تیم‌های هوش مصنوعی در حال حاضر میان راحتی و کنترل، دست به دست دادن می‌دهند. آن‌ها اغلب درخواست‌های خود را به یک «جعبه سیاه» می‌فرستند و امیدوارند قیمت، مدل و سیاست‌های حریم خصوصی تغییر نکند. طبق گزارش‌های منتشر شده، این وضعیت به معنای پذیرش فقدان کنترل بر زمان به‌روزرسانی مدل‌ها و محل ذخیره داده‌ها است. در نتیجه، تنها راه مقابله با رشد مصرف، پرداخت هزینه‌های بیشتر است. این چالش مدیریتی باعث شده تا بسیاری از سازمان‌ها به دنبال جایگزین‌های بهینه‌تر باشند؛ چنان‌که برخی شرکت‌ها با جایگزینی مدل‌های گران‌قیمت با گزینه‌های ارزان‌تر، توانسته‌اند هزینه‌های ماهانه استنتاج خود را تا ۹۲٪ کاهش دهند.

این چرخش به سمت محاسبات غیرمتمرکز، یادآور پیشرفت‌های قبلی در بهره‌وری است؛ همان‌طور که در تحلیل قبلی ما درباره‌ی تنظیم کارآمد با پارامتر اندک (PEFT) اشاره کردیم، کاهش پارامترهای قابل آموزش به مدل‌ها کمک کرد تا مهارت‌های خود را حفظ کنند. اکنون بسیاری از کسب‌وکارها GPUهایی دارند که در دفاتر یا حتی زیر میزها بلااستفاده مانده‌اند و فقط راهی برای تبدیل آن‌ها به یک واحد یکپارچه نبود.

به نقل از گزارش iroh.computer، ابزار Mesh LLM شبکه‌ای از دستگاه‌ها را به یک API سازگار با OpenAI تبدیل می‌کند. شما کافی است هر کلاینت استانداردی را به آدرس http://localhost:9337/v1 متصل کنید تا سیستم تصمیم بگیرد پردازش در کجا انجام شود. این نرم‌افزار بسیار سبک است و نصب آن تنها ۱۸ مگابایت فضا می‌گیرد. این رویکرد در واقع پاسخی به تضاد میان استفاده از سرویس‌های مدیریت‌شده و پیاده‌سازی زیرساخت‌های سخت‌افزاری اختصاصی است که کنترل کامل منابع را به کاربر بازمی‌گرداند.

معماری فنی

این سامانه برای پاسخ به درخواست‌ها از سه روش مجزا استفاده می‌کند:

  • اجرای محلی: اجرای مدل روی GPU دستگاه فعلی.
  • مسیریابی همتا: ارسال درخواست به گره دیگری که مدل از قبل روی آن بارگذاری شده است.
  • تقسیم خط لوله: توزیع مدل بین چندین ماشین با استفاده از حالتی که درونی «Skippy» نامیده می‌شود.

در حالت Skippy، مدل‌ها بر اساس محدوده لایه‌ها به مراحل مختلف تقسیم می‌شوند. برای مثال، لایه‌های ۰ تا ۱۵ روی یک گنه و لایه‌های ۱۶ تا ۳۱ روی گره بعدی قرار می‌گیرند و خروجی‌های هر مرحله به مرحله بعد منتقل می‌شود. این سازوکار اجازه می‌دهد مدل‌های غول‌پیکری مانند مدل‌های ۲۳۵ میلیارد پارامتری ترکیب خبره‌ها (Mixture of Experts) را اجرا کنید که هیچ لپ‌تاپ یا ورک‌استیشن واحدی توانایی پذیرش آن‌ها را ندارد. این توانایی در توزیع هوشمند بار کاری، یادآور رویکردهای مسیریابی معنایی در vLLM است که با استفاده از عوامل کوچک، عملکرد مدل‌های پیشرو را در بنچمارک‌های سخت به چالش کشیده است. در حال حاضر فهرستی شامل بیش از ۴۰ مدل، از نسخه‌های نیم میلیارد پارامتری برای لپ‌تاپ تا مدل‌های عظیم MoE، در دسترس است.

مکانیسم‌های طراحی

معماری این سیستم به‌گونه‌ای است که می‌توان قطعات جدیدی به آن افزود. افزونه‌ها در یک مانیفست اعلام می‌کنند چه خدماتی ارائه می‌دهند و محیط زمان اجرا (Runtime) آن‌ها را فعال کرده و تماس‌ها را مسیریابی می‌کند. این طراحی اجازه می‌دهد قابلیت‌ها از طریق پروتکل زمینهٔ مدل (MCP)، HTTP، استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی نه دوره‌ی آموزش آشپزی — و رویدادهای شبکه در دسترس باشند.

هر گره یک نقطه اتصال (Endpoint) از iroh را فعال می‌کند که به عنوان هویت و کلید عمومی گره عمل می‌کند. این نقطه، تنها سطح شبکه است و تضمین می‌کند هیچ سرور مرکزی وجود ندارد. برای حفظ اتصال در اینترنت آزاد، Mesh LLM دو رله iroh در مناطق مختلف اجرا می‌کند تا مسیری جایگزین برای گره‌هایی که نمی‌توانند مستقیماً به هم برسند، فراهم کند.

شبکه‌سازی با iroh

این سیستم در لایه‌های زیرین برای مدیریت شبکه‌های پیچیده از iroh استفاده می‌کند. برای ارتباطات احراز شده و عبور از NAT بین گره‌ها، از اتصالات QUIC بهره می‌برد و هر گره را با یک کلید عمومی شناسایی می‌کند. این روش نیاز به سرور مرکزی را حذف کرده و مدیریت حفره‌زنی (Hole-punching) و رله‌های جایگزین را به‌صورت خودکار انجام می‌دهد.

پروتکل ارتباطی از طریق سه مذاکره ALPN خاص عمل می‌کند:

  • mesh-llm/1: شبکه اصلی برای شایعه‌پراکنی (Gossip)، مسیریابی، تونل‌های HTTP و کانال‌های افزونه.
  • mesh-llm-control/1: صفحه کنترل مالکان برای همگام‌سازی تنظیمات و تایید مالکیت.
  • skippy-stage/2: انتقال فعال‌سازها با تأخیر بسیار کم برای مدل‌های تقسیم‌شده.

ارتباطات با جریانات دوطرفه QUIC سازماندهی می‌شوند که با یک بایت ابتدایی برچسب می‌خورند. این ساختار اجازه می‌دهد یک اتصال، انواع مختلف رویدادها را تفکیک کند:

  • 0x01: GOSSIP (اطلاعات همتاها درباره مدل، GPU، تأخیر و قابلیت‌ها)
  • 0x04: TUNNEL_HTTP (درخواست‌های استنتاج که به یک همتا پروکسی می‌شوند)
  • 0x05: ROUTE_REQUEST (پرس‌وجو درباره مدل‌های میزبانی شده)
  • 0x06: PEER_DOWN (اعلان قطع اتصال همتا)
  • 0x07: PEER_LEAVING (خروج منظم از شبکه)
  • 0x08: PLUGIN_CHANNEL (فراخوانی‌های RPC افزونه)
  • 0x0e: DIRECT_PATH_REQUEST (به اشتراک گذاشتن آدرس‌های مستقیم برای عبور از NAT)

این ساختار باعث می‌شود مسیریابی یک درخواست به یک همتای دوردست، به اندازه صحبت با localhost روان باشد. iroh انتقال امن را فراهم می‌کند و Mesh LLM لایه شایعه‌پراکنی خود را بر روی آن می‌سازد تا کنترل کند کدام نسخه‌ها سازگارند و به کدام همتاها باید اعتماد کرد.

برای کاربر، این یعنی مشکل «بودجه هوش مصنوعی» با استفاده از سخت‌افزارهای موجود حل می‌شود. تیم‌ها به‌جای پرداخت هزینه زیاد به مدل‌های پیشرو برای کارهای ساده‌ای مثل اصلاح regex یا به‌روزرسانی تیکت‌های Jira، می‌توانند بارهای کاری ساده‌تر را به مدل‌های کوچک‌تر و میزبانی‌شده در شبکه خودشان ارجاع دهند.

این معماری به‌طور موثری مدل را از سخت‌افزار تفکیک می‌کند. با استفاده از سیستم افزونه‌ها، محیط اجرا سخت‌افزار را به‌جای یک محدودیت ثابت، به یک منبع سیال تبدیل می‌کند. کاربران می‌توانند به شبکه عمومی بپیوندند یا استقرار‌های کاملاً خصوصی را پیکربندی کنند.

توسعه‌دهندگان باید منتظر اپلیکیشن موبایل آینده باشند که با Swift SDK شرکت iroh ساخته می‌شود. همچنین تیم قصد دارد ACP، استاندارد نوظهور عامل‌ها را پیاده‌سازی کند تا طیف گسترده‌تری از کلاینت‌ها به شبکه بپیوندند و وابستگی به سرورهای بسته کاهش یابد.

گام بعدی شما

  • اگر GPUهای بلااستفاده در شبکه داخلی شرکت دارید، نصب نسخه‌ی سبک Mesh LLM را برای تست مدل‌های Open-weights امتحان کنید.
  • بررسی کنید کدام بارهای کاری ساده در سازمان شما می‌تواند از مدل‌های غول‌پیکر ابری به مدل‌های محلی در شبکه منتقل شود تا هزینه‌ها کاهش یابد.
  • مستندات iroh را برای درک نحوه عبور از NAT در شبکه‌های توزیع‌شده مطالعه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ اثرات این مدل توزیع‌شده بر مصرف انرژی را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این فناوری با تکیه بر اعتبار پروتکل‌های QUIC و iroh، وابستگی سازمان‌ها به مراکز داده متمرکز را می‌شکند. در نتیجه، هزینه‌های استنتاج برای مدل‌های حجیم کاهش یافته و کنترل داده‌ها به‌طور کامل نزد کاربر باقی می‌ماند.

تأثیر برای ایران

این ابزار برای تیم‌های برنامه‌نویسی ایرانی که با محدودیت‌های پرداخت ارزی و تحریم APIهای ابری مواجه‌اند، راهکاری حیاتی برای به اشتراک گذاشتن منابع GPU داخلی و اجرای مدل‌های بزرگ است.

·نگاه ما
تحریریه دات‌هوش

جدا کردن لایه مدل از سخت‌افزار، مفهوم «پلتفرم» را در هوش مصنوعی بازتعریف می‌کند. اگر محاسبات از مراکز داده متمرکز به یک لایه سیال از سخت‌افزارهای پراکنده منتقل شود، قدرت چانه زنی سازمان‌ها در برابر غول‌های ابری به‌شدت افزایش می‌یابد. این رویکرد در واقع دمکراتیزه کردن دسترسی به مدل‌های فوق‌سنگین است، بدون آنکه نیاز به سرمایه‌گذاری میلیاردی در سخت‌افزارهای تک‌سرور باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.