پرش به محتوای اصلی
پرش به محتوای مقاله

چطور می‌توان بدون سخت‌افزار خاص، خوشه استنتاج AI محلی ساخت؟

·۱۲ شهریور ۱۴۰۵۵ دقیقه مطالعه
اتصال رایانه‌های خانگی به یک خوشه استنتاج هوش مصنوعی با فناوری PAIR انویدیا
اتصال رایانه‌های خانگی به یک خوشه استنتاج هوش مصنوعی با فناوری PAIR انویدیا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک لایه مسیریابی نرم‌افزاری که بدون نیاز به سخت‌افزار تخصصی یا اشتراک حافظه GPU، اجازه توزیع بارهای کاری AI را بین چندین کامپیوتر خانگی می‌دهد.

تصور کنید مجموعه‌ای از لپ‌تاپ‌ها و دسکتاپ‌های قدیمی در خانه را به یک ابرکامپیوتر کوچک برای اجرای مدل‌های زبانی تبدیل کنید. انویدیا با انتشار نسخه بتای Personal AI Router یا همان PAIR در ۳ سپتامبر ۲۰۲۶، این تخیل را به واقعیت تبدیل کرده است. این نرم‌افزار در واقع یک لایه متن‌باز است که به کامپیوترهای سازگار اجازه می‌دهد به عنوان یک خوشه (Cluster) واحد برای استنتاج (Inference) محلی عمل کنند.

برای اکثر کاربران، اجرای مدل‌های بزرگ در محیط خانه به دلیل محدودیت حافظه ویدیویی (VRAM) یک دستگاه متوقف می‌شود. در حالی که مراکز داده حرفه‌ای از اتصالات پیچیده و گران‌قیمت برای حل این مشکل استفاده می‌کنند، کاربران خانگی معمولاً با یک سقف سخت مواجه هستند. PAIR با مسیریابی درخواست‌های مستقل هوش مصنوعی در هر ماشین در دسترس در شبکه محلی، این سقف را می‌شکند و مجموعه‌ای از لپ‌تاپ‌ها و دسکتاپ‌ها را به یک استخر منابع مشترک تبدیل می‌کند.

به نقل از مستندات فنی انویدیا، PAIR یک مسیریاب مجازی است، نه یک سخت‌افزار جدید یا یک موتور استنتاج مجزا. این ابزار در کنار نرم‌افزارهای موجود مانند Ollama و LM Studio کار می‌کند، به طوری که این ابزارها همچنان مسئولیت اجرای واقعی مدل را بر عهده دارند. وظیفه PAIR صرفاً شناسایی سیستم‌های شرکت‌کننده، ردیابی آمادگی آن‌ها و زمان‌بندی وظایف برای مناسب‌ترین گره (Node) است و در نهایت هر پاسخ را به اپلیکیشنی که درخواست را ارسال کرده بود، بازمی‌گرداند.

مشخصات فنی و سازگاری

بر اساس اعلام انویدیا، نسخه بتای PAIR از طیف گسترده‌ای از محیط‌ها و سخت‌افزارها پشتیبانی می‌کند:

  • سیستم‌عامل‌ها: ویندوز ۱۱، DGX OS، اوبونتو ۱۴.۰۴ و macOS Tahoe (معماری‌های x64 و arm64). لازم به ذکر است که ویندوز روی ARM در حال حاضر در لیست حالت آزمایشی (Experimental) قرار دارد.
  • پشتیبانی از GPU: تمامی پردازنده‌های GeForce RTX سری ۲۰ به بعد، پردازنده‌های ایستگاه کاری RTX PRO (معماری تورینگ و جدیدتر)، سیستم‌های DGX Spark و GB10.
  • سیلیکون اپل: مک‌های مجهز به تراشه‌های Apple M4 یا جدیدتر.
  • حداقل نیازمندی‌ها: ۸ گیگابایت رم و حداقل ۲۰ گیگابایت فضای دیسک توصیه شده.

اتصال دستگاه‌ها از طریق پروتکل mDNS برای شناسایی محلی انجام می‌شود. جفت‌سازی امن از طریق یک کد ۶ رقمی مدیریت می‌گردد که روی ماشین دعوت‌کننده نمایش داده شده و در ماشین دعوت‌شده وارد می‌شود. تمام ارتباطات گره-به-گره تا زمان برقراری این جفت‌سازی امن مسدود است و پس از آن، ترافیک با استفاده از MTLS و گواهینامه‌های تولید شده، رمزنگاری و ایمن می‌شود.

نکته کلیدی این است که این نرم‌افزار به هیچ کابل خاص یا رک‌های سرور نیاز ندارد و کاملاً روی شبکه استاندارد خانه اجرا می‌شود. اگرچه برای دانلود مدل‌ها به اتصال اینترنت نیاز است، اما برای عملیات واقعی خوشه و استنتاج محلی، هیچ اتصال اینترنتی مورد نیاز نیست.

سازوکار مسیریابی

باید به این نکته مهم توجه داشت که PAIR حافظه GPUها را با هم ترکیب نمی‌کند و یک مدل واحد را بین چندین ماشین تکه‌تکه (Shard) نمی‌کند. این نرم‌افزار GPUها را به یک شتاب‌دهنده منطقی بزرگتر تبدیل نمی‌کند و یک درخواست استنتاج در حال اجرا را بین گره‌ها تقسیم نمی‌کند. در عوض، هر درخواست را برای تمام مدت عمرش به یک گره واجد شرایط اختصاص می‌دهد.

یک گره تنها زمانی واجد شرایط است که مدل مورد نظر روی آن موجود باشد و یک موتور پشتیبانی‌شده فعال باشد. PAIR ترجیح می‌دهد از گره‌هایی استفاده کند که می‌داند مدل را در اختیار دارند. از آنجایی که مدل‌ها مجبور نیستند در سراسر خوشه یکسان باشند، بارگذاری یک تگ مدل مشابه روی گره‌های بیشتر، صرفاً استخر گره‌های واجد شرایط را برای زمان‌بند بزرگتر می‌کند.

زمان‌بند PAIR تصمیمات خود را در لحظه و بر اساس چندین عامل می‌گیرد:

  • آنلاین بودن و آمادگی گره جفت‌شده.
  • فعال بودن یک موتور استنتاج پشتیبانی‌شده.
  • وجود مدل درخواستی روی آن گره خاص.
  • بار کاری فعلی، شامل وظایف فعال.
  • میزان بهره‌برداری فعلی از GPU، مانند اجرای یک اپلیکیشن گرافیکی سنگین.

این ساختار اجازه می‌دهد دستگاه‌ها در صورت در دسترس بودن ظرفیت خود را ارائه دهند و در صورت نیاز (مثلاً هنگام خواب رفتن لپ‌تاپ، بسته شدن درب آن یا خروج از شبکه) از چرخه خارج شوند.

عملکرد در بارهای کاری عامل‌محور

انویدیا PAIR را به‌طور خاص برای کاربردهای عامل‌محور (Agentic) معرفی کرده است؛ جایی که یک عامل پیشرو، یک وظیفه پیچیده را به چندین شغل کوچک و مستقل تقسیم می‌کند. این رویکرد با تحولاتی که در سامانه‌های خرید خودکار و عامل‌های هوشمند آمازون مشاهده می‌شود، هم‌سو است که در آن‌ها عامل‌ها وظایف پیچیده را مدیریت می‌کنند. در یک نمایش غیررسمی با استفاده از عامل Hermes Desktop و Ollama، انویدیا یک لپ‌تاپ RTX Spark را در برابر خوشه‌ای متشکل از یک لپ‌تاپ RTX Spark، یک DGX Spark و یک RTX 5090 قرار داد.

طبق گزارش انویدیا، هنگام استفاده از مدل Qwen 3.6 35B A3B، لپ‌تاپ تک‌دستگاهه به‌طور متوسط ۱۸ دقیقه برای تکمیل یک وظیفه پنج‌عاملی زمان برد، در حالی که خوشه PAIR همین کار را در ۸ دقیقه و ۴۸ ثانیه به پایان رساند. البته انویدیا هشدار داده که این یک بنچمارک کلی یا وعده‌ای برای مقیاس‌پذیری خطی نیست، زیرا نتایج به مدل، تنظیمات موتور، سخت‌افزار و میزان موازی‌سازی بار کاری بستگی دارد. این توانایی در پردازش موازی، می‌تواند تأثیر بسزایی در دقت تصمیم‌گیری عامل‌ها داشته باشد، مشابه آنچه در مطالعات مربوط به تغییر تصمیمات خرید توسط عامل‌های هوش مصنوعی بررسی شده است.

انویدیا خاطرنشان کرد که برخی وظایف ممکن است بهره کمتری از این سیستم ببرند؛ به‌ویژه وظایفی که شدیداً متوالی (Sequential) هستند، بارهای کاری که توسط یک فراخوانی طولانی مدل تسلط می‌یابند، یا پیکربندی‌هایی که در آن‌ها تنها یک گره مدل مورد نظر را دارد.

یکپارچگی توسعه‌دهندگان و حریم خصوصی

برای توسعه‌دهندگان، یکپارچگی بسیار ساده است. PAIR نقاط انتهایی (Endpoints) پروکسی سازگار با OpenAI و Ollama ایجاد می‌کند و پورت‌های پیش‌فرضی را که این موتورها استفاده می‌کنند، در اختیار می‌گیرد. این یعنی چارچوب‌های عامل‌محور می‌توانند بدون نیاز به یک API جدید برای خوشه، از همان رابط‌هایی که می‌شناسند استفاده کنند.

انویدیا کد منبع PAIR را تحت مجوز Apache 2.0 منتشر کرده است. توسعه‌دهندگان تشویق شده‌اند تا در بهبود شناسایی، جفت‌سازی، مسیریابی، یکپارچگی موتورها، نقاط انتهایی و تجربه کاربری مشارکت کنند. سیاست فعلی زمان‌بندی، کارهای صف‌بندی شده را با یک سیگنال کلی از بهره‌برداری GPU ترکیب می‌کند؛ موضوعی که انویدیا اعتراف می‌کند آن را برای ماشین‌های مشابه، مناسب‌تر از خوشه‌هایی با سخت‌افزارهای بسیار متنوع می‌کند.

از منظر حریم خصوصی، PAIR برای استنتاج محلی و خصوصی طراحی شده است. پرامپت‌ها، فایل‌ها و زمینه (Context) عامل‌ها در شبکه خانگی کاربر باقی می‌مانند و به هیچ سرویس ابری ارسال نمی‌شوند. با این حال، کاربران هشدار یافته‌اند که پیش از استقرار PAIR در شبکه‌های غیرقابل اعتماد یا مشترک، یادداشت‌های امنیتی را مطالعه کنند، زیرا این سیستم شامل شناسایی LAN و نقاط انتهایی HTTP محلی است.

گام بعدی شما

  • اگر چندین سیستم با GPU انویدیا در خانه دارید، نسخه بتای PAIR را برای توزیع بارهای کاری مدل‌های محلی نصب کنید.
  • برای کاهش زمان پاسخ‌دهی در سیستم‌های چندعاملی، مدل‌های مورد نیاز را روی چندین گره کپی کنید تا فضای مانور زمان‌بند افزایش یابد.
  • توسعه‌دهندگان می‌توانند از API سازگار با OpenAI برای اتصال اپلیکیشن‌های خود به این خوشه محلی استفاده کنند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار مهندسی انویدیا، سد ورود به دنیای خوشه‌های محاسباتی را برای کاربران خانگی می‌شکند. در نتیجه، اجرای سیستم‌های چندعاملی پیچیده دیگر نیازمند سرمایه‌گذاری در یک ایستگاه کاری گران‌قیمت نیست و با استفاده از منابع پراکنده ممکن می‌شود.

تأثیر برای ایران

به دلیل متن‌باز بودن PAIR و عدم نیاز به اتصال دائمی به اینترنت برای استنتاج، این ابزار برای توسعه‌دهندگان ایرانی که با محدودیت‌های API و تحریم‌های ابری مواجه‌اند، راهکاری ایده‌آل برای ایجاد زیرساخت‌های محلی قدرتمند است.

·نگاه ما
تحریریه دات‌هوش

تمرکز انویدیا بر مسیریابی درخواست‌ها به‌جای ترکیب حافظه (Memory Pooling)، نشان می‌دهد که آینده استنتاج محلی نه در مدل‌های غول‌آسای تک‌درخواست، بلکه در ارتش‌های کوچک از عامل‌های تخصصی است. این رویکرد هزینه پیچیدگی سخت‌افزاری را حذف می‌کند و اجازه می‌دهد سخت‌افزارهای ناهمگون (Heterogeneous) بدون نیاز به استانداردهای سخت‌گیرانه مرکز داده، با هم همکاری کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.