NVIDIA PAIR, 집에 있는 여러 PC를 로컬 AI 작업에 연결한다
AI를 활용하여 생성한 이미지입니다.
컴퓨팅 · 해외 이슈
집에 있는 PC가 한 대뿐일 때 로컬 AI 에이전트를 여러 개 돌리면 요청이 한 GPU에 몰려 대기열이 길어져요. NVIDIA가 이 문제를 겨냥한 Personal AI Router(PAIR) 베타를 공개했어요. 여러 컴퓨터를 하나의 거대한 GPU처럼 합치는 도구는 아니고, 동시에 들어온 독립 요청을 준비된 컴퓨터로 나눠 보내는 라우터에 가까워요.[1]
PAIR가 하는 일
PAIR는 Ollama와 LM Studio가 쓰는 기존 인터페이스 앞에 놓여요. 에이전트는 평소처럼 한 로컬 주소로 요청을 보내고, PAIR가 어떤 컴퓨터에서 처리할지 정해요. NVIDIA는 에이전트나 오케스트레이션 도구를 새 API에 맞춰 다시 만들 필요가 없다고 설명해요.[1]
라우터는 노드가 온라인인지, 엔진이 켜져 있는지, 요청한 모델이 있는지, GPU가 바쁜지를 확인해요. 조건을 만족하는 한 대가 요청 하나를 처음부터 끝까지 맡아요. 한 요청을 여러 GPU에 쪼개 실행하지는 않아요.[1]
지원 대상과 구조
NVIDIA가 안내한 대상은 GeForce RTX 20 시리즈 이상, RTX PRO 워크스테이션 GPU, DGX Spark, Apple M4 이상 실리콘을 쓰는 시스템이에요. Windows, macOS, Linux에서 사용할 수 있고 각 노드에는 Ollama나 LM Studio 같은 로컬 추론 엔진이 필요해요.[1]
모든 컴퓨터가 같은 모델을 가져야 하는 것도 아니에요. 요청한 모델이 설치된 노드만 후보가 되고, 같은 모델을 여러 대에 설치하면 처리 가능한 풀이 넓어져요. 모델이 한 대에만 있다면 다른 PC의 GPU가 비어 있어도 그 요청은 옮겨갈 수 없어요.[1]
시연 수치는 참고용이에요
NVIDIA의 예시에서는 Hermes Desktop이 다섯 개의 하위 작업을 만들고 Ollama가 추론을 맡았어요. RTX Spark 노트북 한 대 구성은 평균 18분, RTX Spark 노트북·DGX Spark·RTX 5090을 묶은 세 장치 구성은 평균 8분 48초였다고 해요.[1]
이 수치를 일반 성능표처럼 읽으면 안 돼요. NVIDIA도 특정 모델과 구성, 네트워크, 작업 병렬성, 노드 상태에 의존하는 비공식 시연이라고 명시했어요. 하위 작업이 충분히 독립적이지 않거나 노드가 절전 상태라면 효과가 작을 수 있어요.[1]
집에서 먼저 확인할 것
- 여러 요청이 동시에 생기는 작업인지 확인해요. 단일 요청 한 건의 속도를 높이는 도구는 아니에요.
- 각 PC에 필요한 모델이 설치돼 있는지 확인해요.
- 게임이나 영상 편집 중인 PC를 노드로 쓸 때 GPU 부하 변화를 살펴봐요.[1]
- 처음 연결할 때 같은 사설 네트워크 안에서 보안 페어링과 인증서 상태를 확인해요. NVIDIA는 mDNS 탐색과 mTLS 통신을 사용한다고 설명해요.[1]
기대와 한계
로컬 AI를 여러 에이전트와 함께 쓰는 사람에게는 대기열을 줄일 방법이 하나 더 생겼어요. 주력 PC를 계속 점유하지 않고 사용하지 않는 다른 컴퓨터의 추론 능력을 보태는 방식이에요. 조사·코딩·정리처럼 작은 요청이 동시에 많이 생기는 흐름과 잘 맞아요.[1]
VRAM이 합쳐지는 것은 아니에요. 한 대에 들어가지 않는 모델을 여러 PC의 메모리를 모아 실행할 수 없고, 한 번의 요청을 여러 장치가 나누지도 않아요. 한국어 모델별 호환성과 베타 라이선스 조건은 이번 공개 내용만으로 확정하기 어려우니 설치 전에 지원 버전과 모델 요구 사항을 확인하는 편이 안전해요.
로컬 컴퓨팅의 다른 흐름은 GPU와 QPU를 잇는 국내 양자컴퓨팅 협력 글에서도 이어서 볼 수 있어요.