تصور کنید مجموعهای از لپتاپها و دسکتاپهای قدیمی در خانه را به یک ابرکامپیوتر کوچک برای اجرای مدلهای زبانی تبدیل کنید. انویدیا با انتشار نسخه بتای Personal AI Router یا همان PAIR در ۳ سپتامبر ۲۰۲۶، این تخیل را به واقعیت تبدیل کرده است. این نرمافزار در واقع یک لایه متنباز است که به کامپیوترهای سازگار اجازه میدهد به عنوان یک خوشه (Cluster) واحد برای استنتاج (Inference) محلی عمل کنند.
برای اکثر کاربران، اجرای مدلهای بزرگ در محیط خانه به دلیل محدودیت حافظه ویدیویی (VRAM) یک دستگاه متوقف میشود. در حالی که مراکز داده حرفهای از اتصالات پیچیده و گرانقیمت برای حل این مشکل استفاده میکنند، کاربران خانگی معمولاً با یک سقف سخت مواجه هستند. PAIR با مسیریابی درخواستهای مستقل هوش مصنوعی در هر ماشین در دسترس در شبکه محلی، این سقف را میشکند و مجموعهای از لپتاپها و دسکتاپها را به یک استخر منابع مشترک تبدیل میکند.
به نقل از مستندات فنی انویدیا، PAIR یک مسیریاب مجازی است، نه یک سختافزار جدید یا یک موتور استنتاج مجزا. این ابزار در کنار نرمافزارهای موجود مانند Ollama و LM Studio کار میکند، به طوری که این ابزارها همچنان مسئولیت اجرای واقعی مدل را بر عهده دارند. وظیفه PAIR صرفاً شناسایی سیستمهای شرکتکننده، ردیابی آمادگی آنها و زمانبندی وظایف برای مناسبترین گره (Node) است و در نهایت هر پاسخ را به اپلیکیشنی که درخواست را ارسال کرده بود، بازمیگرداند.
مشخصات فنی و سازگاری
بر اساس اعلام انویدیا، نسخه بتای PAIR از طیف گستردهای از محیطها و سختافزارها پشتیبانی میکند:
- سیستمعاملها: ویندوز ۱۱، DGX OS، اوبونتو ۱۴.۰۴ و macOS Tahoe (معماریهای x64 و arm64). لازم به ذکر است که ویندوز روی ARM در حال حاضر در لیست حالت آزمایشی (Experimental) قرار دارد.
- پشتیبانی از GPU: تمامی پردازندههای GeForce RTX سری ۲۰ به بعد، پردازندههای ایستگاه کاری RTX PRO (معماری تورینگ و جدیدتر)، سیستمهای DGX Spark و GB10.
- سیلیکون اپل: مکهای مجهز به تراشههای Apple M4 یا جدیدتر.
- حداقل نیازمندیها: ۸ گیگابایت رم و حداقل ۲۰ گیگابایت فضای دیسک توصیه شده.
اتصال دستگاهها از طریق پروتکل mDNS برای شناسایی محلی انجام میشود. جفتسازی امن از طریق یک کد ۶ رقمی مدیریت میگردد که روی ماشین دعوتکننده نمایش داده شده و در ماشین دعوتشده وارد میشود. تمام ارتباطات گره-به-گره تا زمان برقراری این جفتسازی امن مسدود است و پس از آن، ترافیک با استفاده از MTLS و گواهینامههای تولید شده، رمزنگاری و ایمن میشود.
نکته کلیدی این است که این نرمافزار به هیچ کابل خاص یا رکهای سرور نیاز ندارد و کاملاً روی شبکه استاندارد خانه اجرا میشود. اگرچه برای دانلود مدلها به اتصال اینترنت نیاز است، اما برای عملیات واقعی خوشه و استنتاج محلی، هیچ اتصال اینترنتی مورد نیاز نیست.
سازوکار مسیریابی
باید به این نکته مهم توجه داشت که PAIR حافظه GPUها را با هم ترکیب نمیکند و یک مدل واحد را بین چندین ماشین تکهتکه (Shard) نمیکند. این نرمافزار GPUها را به یک شتابدهنده منطقی بزرگتر تبدیل نمیکند و یک درخواست استنتاج در حال اجرا را بین گرهها تقسیم نمیکند. در عوض، هر درخواست را برای تمام مدت عمرش به یک گره واجد شرایط اختصاص میدهد.
یک گره تنها زمانی واجد شرایط است که مدل مورد نظر روی آن موجود باشد و یک موتور پشتیبانیشده فعال باشد. PAIR ترجیح میدهد از گرههایی استفاده کند که میداند مدل را در اختیار دارند. از آنجایی که مدلها مجبور نیستند در سراسر خوشه یکسان باشند، بارگذاری یک تگ مدل مشابه روی گرههای بیشتر، صرفاً استخر گرههای واجد شرایط را برای زمانبند بزرگتر میکند.
زمانبند PAIR تصمیمات خود را در لحظه و بر اساس چندین عامل میگیرد:
- آنلاین بودن و آمادگی گره جفتشده.
- فعال بودن یک موتور استنتاج پشتیبانیشده.
- وجود مدل درخواستی روی آن گره خاص.
- بار کاری فعلی، شامل وظایف فعال.
- میزان بهرهبرداری فعلی از GPU، مانند اجرای یک اپلیکیشن گرافیکی سنگین.
این ساختار اجازه میدهد دستگاهها در صورت در دسترس بودن ظرفیت خود را ارائه دهند و در صورت نیاز (مثلاً هنگام خواب رفتن لپتاپ، بسته شدن درب آن یا خروج از شبکه) از چرخه خارج شوند.
عملکرد در بارهای کاری عاملمحور
انویدیا PAIR را بهطور خاص برای کاربردهای عاملمحور (Agentic) معرفی کرده است؛ جایی که یک عامل پیشرو، یک وظیفه پیچیده را به چندین شغل کوچک و مستقل تقسیم میکند. این رویکرد با تحولاتی که در سامانههای خرید خودکار و عاملهای هوشمند آمازون مشاهده میشود، همسو است که در آنها عاملها وظایف پیچیده را مدیریت میکنند. در یک نمایش غیررسمی با استفاده از عامل Hermes Desktop و Ollama، انویدیا یک لپتاپ RTX Spark را در برابر خوشهای متشکل از یک لپتاپ RTX Spark، یک DGX Spark و یک RTX 5090 قرار داد.
طبق گزارش انویدیا، هنگام استفاده از مدل Qwen 3.6 35B A3B، لپتاپ تکدستگاهه بهطور متوسط ۱۸ دقیقه برای تکمیل یک وظیفه پنجعاملی زمان برد، در حالی که خوشه PAIR همین کار را در ۸ دقیقه و ۴۸ ثانیه به پایان رساند. البته انویدیا هشدار داده که این یک بنچمارک کلی یا وعدهای برای مقیاسپذیری خطی نیست، زیرا نتایج به مدل، تنظیمات موتور، سختافزار و میزان موازیسازی بار کاری بستگی دارد. این توانایی در پردازش موازی، میتواند تأثیر بسزایی در دقت تصمیمگیری عاملها داشته باشد، مشابه آنچه در مطالعات مربوط به تغییر تصمیمات خرید توسط عاملهای هوش مصنوعی بررسی شده است.
انویدیا خاطرنشان کرد که برخی وظایف ممکن است بهره کمتری از این سیستم ببرند؛ بهویژه وظایفی که شدیداً متوالی (Sequential) هستند، بارهای کاری که توسط یک فراخوانی طولانی مدل تسلط مییابند، یا پیکربندیهایی که در آنها تنها یک گره مدل مورد نظر را دارد.
یکپارچگی توسعهدهندگان و حریم خصوصی
برای توسعهدهندگان، یکپارچگی بسیار ساده است. PAIR نقاط انتهایی (Endpoints) پروکسی سازگار با OpenAI و Ollama ایجاد میکند و پورتهای پیشفرضی را که این موتورها استفاده میکنند، در اختیار میگیرد. این یعنی چارچوبهای عاملمحور میتوانند بدون نیاز به یک API جدید برای خوشه، از همان رابطهایی که میشناسند استفاده کنند.
انویدیا کد منبع PAIR را تحت مجوز Apache 2.0 منتشر کرده است. توسعهدهندگان تشویق شدهاند تا در بهبود شناسایی، جفتسازی، مسیریابی، یکپارچگی موتورها، نقاط انتهایی و تجربه کاربری مشارکت کنند. سیاست فعلی زمانبندی، کارهای صفبندی شده را با یک سیگنال کلی از بهرهبرداری GPU ترکیب میکند؛ موضوعی که انویدیا اعتراف میکند آن را برای ماشینهای مشابه، مناسبتر از خوشههایی با سختافزارهای بسیار متنوع میکند.
از منظر حریم خصوصی، PAIR برای استنتاج محلی و خصوصی طراحی شده است. پرامپتها، فایلها و زمینه (Context) عاملها در شبکه خانگی کاربر باقی میمانند و به هیچ سرویس ابری ارسال نمیشوند. با این حال، کاربران هشدار یافتهاند که پیش از استقرار PAIR در شبکههای غیرقابل اعتماد یا مشترک، یادداشتهای امنیتی را مطالعه کنند، زیرا این سیستم شامل شناسایی LAN و نقاط انتهایی HTTP محلی است.
گام بعدی شما
- اگر چندین سیستم با GPU انویدیا در خانه دارید، نسخه بتای PAIR را برای توزیع بارهای کاری مدلهای محلی نصب کنید.
- برای کاهش زمان پاسخدهی در سیستمهای چندعاملی، مدلهای مورد نیاز را روی چندین گره کپی کنید تا فضای مانور زمانبند افزایش یابد.
- توسعهدهندگان میتوانند از API سازگار با OpenAI برای اتصال اپلیکیشنهای خود به این خوشه محلی استفاده کنند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو