그래픽카드 VRAM vs 통합 메모리|LLM은 어디서 더 잘 돌아갈까?

LLM을 설치하려고 보면 어떤 사람은 “그래픽카드 VRAM이 중요하다”고 하고, 어떤 사람은 “맥은 통합 메모리가 커서 잘 돌아간다”고 말합니다. 둘 다 맞는 말이지만, 메모리를 쓰는 방식이 다릅니다. 여기서 말하는 RAM은 PC의 일반 RAM, 그래픽카드의 VRAM, Apple Silicon의 통합 메모리를 구분해서 봐야 합니다.

그래픽카드 VRAM과 통합 메모리에서 로컬 LLM을 실행하는 구조를 표현한 이미지
※ 이미지는 글의 이해를 돕기 위해 로컬 AI로 제작했습니다.

LLM이 메모리를 많이 먹는 이유

LLM은 질문을 받을 때 모델의 가중치라는 숫자 묶음을 메모리에 올립니다. 여기에 대화가 길어질수록 이전 내용을 보관하는 KV 캐시와 실행 중 필요한 작업 공간이 추가됩니다. 따라서 모델 파일의 크기만 보고 “16GB면 무조건 된다”고 판단하면 실제 실행에서 부족할 수 있습니다.

대략적인 감으로는 4비트 양자화 모델의 가중치만 계산했을 때 파라미터 수에 0.5를 곱한 GB가 나옵니다. 7B는 약 3.5GB, 14B는 약 7GB, 32B는 약 16GB, 70B는 약 35GB입니다. 이것은 가중치만 계산한 값이며 KV 캐시와 런타임 여유 공간은 포함하지 않은 참고치입니다.

VRAM은 전용 작업대다

그래픽카드의 VRAM은 GPU가 바로 사용하는 전용 메모리입니다. NVIDIA 그래픽카드는 제품별로 정해진 전용 메모리 용량을 제공하며, 모델 가중치와 일부 실행 작업을 VRAM에 올릴 수 있습니다.[9] VRAM 안에 필요한 데이터가 충분히 들어가면 GPU의 병렬 연산을 제대로 활용하기 쉽습니다.

반대로 VRAM이 부족하면 일부 층을 시스템 RAM이나 CPU 쪽으로 넘기는 오프로딩이 일어날 수 있습니다. 실행 자체는 가능해도 데이터가 오가는 시간이 늘어 속도가 떨어질 수 있습니다. llama.cpp처럼 CPU와 GPU를 함께 활용할 수 있는 실행기는 이런 선택지를 제공하지만, 실제 속도는 모델·빌드·하드웨어에 따라 달라집니다.[6]

VRAM의 장점과 한계

  • GPU가 전용 메모리를 빠르게 사용하기 좋음
  • 게임·3D·영상 작업과 메모리를 나눠 쓸 수 있음
  • 용량이 부족하면 다른 메모리로 넘기는 비용이 커짐
  • 그래픽카드 교체 전에는 VRAM을 늘리기 어려움

통합 메모리는 하나의 큰 창고다

Apple Silicon의 통합 메모리는 CPU와 GPU가 별도의 복사본을 각각 만드는 대신 하나의 메모리 풀을 공유하는 구조입니다. Apple은 이 구조가 CPU와 GPU가 데이터를 공유할 때 복사 비용을 줄일 수 있다고 설명합니다.[8]

그래서 통합 메모리 32GB 맥에서는 시스템 RAM과 별도 VRAM을 합쳐 생각하는 것이 아니라, 운영체제와 앱이 쓰는 공간을 제외한 나머지를 LLM이 함께 사용하는 방식으로 이해해야 합니다. 32GB가 전부 모델 전용은 아닙니다.

통합 메모리의 장점과 한계

  • CPU와 GPU가 같은 메모리 풀을 공유
  • 별도 그래픽카드 없이도 큰 모델을 시도할 여지가 있음
  • 시스템·앱·LLM이 같은 메모리를 나눠 씀
  • 메모리가 부족하면 저장장치 스왑으로 체감 속도가 크게 떨어질 수 있음

VRAM과 통합 메모리 비교

기준 전용 VRAM 통합 메모리
메모리 구조 GPU 전용 CPU·GPU 공유
유리한 상황 GPU 가속과 높은 처리량 큰 모델을 한 메모리 풀에 올리는 구성
부족할 때 CPU/RAM 오프로딩으로 속도 저하 앱과 나눠 쓰거나 스왑 발생
구매 포인트 VRAM 용량과 GPU 연산 성능 통합 메모리 용량과 메모리 대역폭
주의할 점 VRAM이 모델보다 작으면 설정 조정 필요 표시된 용량 전체를 LLM에 쓸 수 없음

모델이 돌아간다고 쓸 만한 것은 아니다

가장 흔한 착각은 “실행 성공”과 “편하게 사용”을 같은 것으로 보는 것입니다. 작은 모델은 8GB 시스템에서도 실행될 수 있지만 답변 속도와 컨텍스트 길이가 만족스럽지 않을 수 있습니다. 반대로 큰 통합 메모리 맥에서 30B급 모델이 실행되어도 긴 문서와 여러 앱을 함께 열면 여유가 줄어듭니다.

구매 전에 확인할 순서: 모델의 양자화 파일 크기 → 내 메모리에서 운영체제와 앱이 차지할 공간 → 컨텍스트 길이 → GPU 가속 또는 오프로딩 지원 → 실제 토큰 처리 속도 순서로 보세요.

어떤 구성이 누구에게 맞을까?

  • 게임도 하고 빠른 로컬 AI도 원함 → VRAM이 넉넉한 그래픽카드
  • 맥에서 조용히 큰 모델을 시험 → 통합 메모리 용량이 큰 Apple Silicon
  • 7B~14B 모델부터 시작 → 16GB 전후 시스템도 가능하지만 여유를 확인
  • 긴 문서·큰 모델·여러 앱을 동시에 사용 → 숫자상 최소 용량보다 한 단계 큰 메모리

결론

VRAM은 GPU가 빠르게 쓰는 전용 작업대이고, 통합 메모리는 CPU와 GPU가 함께 사용하는 큰 창고에 가깝습니다. LLM에서는 메모리 용량만큼 메모리 구조와 대역폭, 모델 양자화, 컨텍스트 길이가 중요합니다. 결국 “어느 쪽이 무조건 우수한가”보다 원하는 모델을 여유 있게 올리고, 실제 속도로 계속 쓸 수 있는가가 기준입니다.

공식 자료

최종 확인일: 2026년 8월 30일. 실제 지원 모델과 속도는 하드웨어·양자화·실행기 버전에 따라 달라집니다.

Haechi

컴퓨팅·AI·스마트기기 정보를 공식 자료 중심으로 확인하고 쉽게 정리합니다.

저자 소개 · AI 활용 정책

Haechi

컴퓨터와 AI, 디지털기기에 관심을 가지고 새로운 기술과 제품을 직접 확인하여 초보자도 쉽게 이해할 수 있도록 정리합니다.

You may also like...

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다