Ollama로 로컬 AI 시작하기, 첫 모델을 실행하고 지우는 순서

컴팩트한 데스크톱 PC와 외장 SSD가 놓인 로컬 AI 작업 책상 1

AI를 활용하여 생성한 이미지입니다.

Ollama를 처음 설치하면 모델 이름과 명령어가 한꺼번에 보여서 어디서부터 손대야 할지 막막할 수 있습니다. 실제 첫걸음은 간단합니다. 앱 또는 서버가 실행 중인지 확인하고, 작은 모델 하나를 내려받아 짧은 질문을 해 본 뒤, 목록과 실행 상태를 확인하면 됩니다. 로컬 실행은 API 키 없이 시작할 수 있지만 모델 파일이 컴퓨터에 저장되고 메모리와 저장 공간을 사용한다는 점은 먼저 이해해야 합니다.[1]

설치 직후 확인할 것

Ollama 공식 문서는 macOS, Windows, Linux용 설치 경로와 빠른 시작 방법을 안내합니다. 설치를 끝낸 뒤 macOS나 Windows에서는 앱이 실행 중인지 확인하세요. Linux에서는 서버가 자동으로 시작되지 않았다면 터미널에서 ollama serve를 실행해야 할 수 있습니다.[1] 터미널에서 ollama 명령이 인식되는지도 함께 확인하면 설치와 실행 문제를 구분하기 쉽습니다.

처음부터 가장 큰 모델을 고를 필요는 없습니다. 모델 파일이 크면 내려받는 시간과 저장 공간이 늘고, 실행 중에는 메모리 부담도 커집니다. 동시에 브라우저 탭, 편집기, 영상 프로그램을 많이 열어 두었다면 같은 모델도 더 느리게 반응할 수 있습니다. 첫 목표는 최고 품질이 아니라 내 환경에서 다운로드부터 응답까지 한 번 완주하는 것입니다.

첫 모델을 실행하는 순서

  1. 터미널을 열고 ollama run gemma4:e2b를 입력합니다.
  2. 모델 다운로드가 끝날 때까지 기다립니다.
  3. 대화 입력란에 짧은 질문을 넣어 응답을 확인합니다.
  4. 대화를 끝낼 때는 /bye를 입력합니다.

공식 빠른 시작 문서는 예시 모델의 다운로드 크기를 약 7.2GB로 안내하고, 8GB 정도의 VRAM 또는 Mac 통합 메모리를 권장합니다.[1] 메모리가 부족하면 시스템 RAM을 사용할 수 있지만 응답이 느려질 수 있습니다. 이 수치를 모든 모델의 절대 기준으로 받아들이면 안 됩니다. 모델 크기, 컨텍스트 길이, 운영체제, 다른 프로그램의 메모리 사용량에 따라 결과가 달라집니다.

목적 명령 사용 시점
모델 내려받기 ollama pull gemma4 모델만 저장하고 나중에 실행할 때
모델 목록 ollama ls 저장된 모델 이름과 보유 여부를 볼 때
실행 상태 ollama ps 현재 메모리에 올라온 모델을 볼 때
모델 종료 ollama stop gemma4 실행을 멈추고 자원을 비울 때
모델 삭제 ollama rm gemma4 파일을 지워 저장 공간을 확보할 때

CLI 문서에는 실행, 다운로드, 목록 조회, 삭제 명령이 구분되어 있습니다.[2] ollama ls는 저장된 모델을 보여주고 ollama ps는 현재 실행 중인 모델을 보여주는 명령입니다. 이름이 비슷해도 역할이 다르므로 삭제 전에는 반드시 ollama ls로 정확한 이름을 복사하세요. 모델을 삭제하면 다음 실행 때 다시 내려받아야 합니다.

느리거나 실행되지 않을 때의 판단 순서

  1. ollama ps로 이미 실행 중인 모델이 있는지 확인합니다.
  2. 사용하지 않는 모델과 무거운 앱을 종료합니다.
  3. 저장 공간과 메모리 여유를 확인합니다.
  4. 긴 대화나 큰 파일 입력을 줄여 다시 시도합니다.
  5. 여전히 어렵다면 더 작은 모델로 바꿉니다.

Ollama FAQ는 기본 컨텍스트 길이를 4096토큰으로 안내하며, 컨텍스트를 늘리면 더 많은 메모리가 필요하다고 설명합니다.[3] 긴 문서나 대화를 넣은 뒤 갑자기 느려졌다면 모델 고장보다 입력 길이와 메모리 조건이 달라진 상황일 수 있습니다. 답변 품질을 높이겠다며 컨텍스트를 무작정 늘리기보다, 필요한 부분만 나누어 넣는 편이 현실적입니다.

로컬 실행과 클라우드 요청은 다릅니다

로컬 모델은 파일을 내 컴퓨터에 저장하고 컴퓨터 자원으로 실행합니다. 반면 클라우드 요청은 서비스 계정과 API 키를 사용하는 방식입니다. 공식 문서는 API 키를 브라우저 코드나 소스 관리 저장소에 넣지 말고 애플리케이션 서버에 보관하라고 안내합니다.[1] 여러 기기에서 웹앱으로 쓰거나 자동화를 만들 때는 로컬 대화와 API 운영을 같은 것으로 생각하지 마세요. 키가 필요 없는 로컬 실습을 하다가 테스트 코드를 공개 저장소에 올려 키를 노출하는 실수가 생길 수 있습니다.

업데이트와 다음 단계

macOS와 Windows용 Ollama는 메뉴 막대나 작업 표시줄에서 업데이트 후 재시작하는 방식이 안내되어 있고, Linux는 설치 스크립트를 다시 실행하는 방법이 제시됩니다.[3] 업데이트 전에 사용하는 모델 이름과 필요한 설정을 기록해 두면 문제가 생겼을 때 원인을 추적하기 쉽습니다. 모델 파일을 지우는 작업과 프로그램 업데이트는 다른 일입니다.

기본 실행이 익숙해진 다음에는 Modelfile을 사용할 수 있습니다. 기본 모델과 시스템 지침, 답변 형식을 정해 ollama create로 맞춤 모델을 만드는 방식입니다.[2] 처음부터 맞춤 설정을 추가하면 다운로드 문제와 프롬프트 문제를 구분하기 어려우므로, 먼저 기본 모델의 실행·목록 확인·삭제를 익히는 편이 좋습니다. 설정 예시는 Ollama Modelfile 설정 글에서 이어서 확인할 수 있습니다.

저장 공간과 메모리를 먼저 계산하는 습관

모델을 내려받기 전에 운영체제의 저장 공간을 확인하세요. 다운로드 크기만큼만 비워 두면 업데이트나 임시 파일 때문에 설치가 중단될 수 있습니다. 모델을 여러 개 보관하면 각 파일이 차지하는 공간이 누적되므로, 자주 쓰는 모델과 시험용 모델을 구분하는 편이 관리하기 쉽습니다. ollama ls로 목록을 보고 오래 쓰지 않은 모델을 골라 삭제하되, 이름이 비슷한 모델을 잘못 지우지 않도록 전체 이름을 확인하세요.

메모리도 저장 공간과 다르게 생각해야 합니다. 모델 파일이 디스크에 있어도 실행 순간에는 모델과 대화 컨텍스트가 메모리를 사용합니다. 긴 문서, 긴 대화, 여러 모델의 동시 실행은 부담을 늘립니다. 응답이 느려졌을 때 모델을 바로 삭제하거나 프로그램을 다시 설치하기보다, 실행 중인 모델과 입력 길이를 먼저 줄이는 이유가 여기에 있습니다.

증상 먼저 확인할 것 다음 선택
다운로드 중단 네트워크와 저장 공간 여유 공간을 확보하고 다시 시도
실행 직후 종료 앱·서버 실행 여부와 메모리 작은 모델로 바꾸기
첫 답변은 되지만 점점 느림 대화 길이와 컨텍스트 대화를 나누거나 입력을 줄이기
명령어를 찾지 못함 설치와 터미널 환경 앱을 재실행하고 설치 안내 확인

명령어를 외우기보다 흐름을 확인하기

처음에는 명령어를 모두 외우려 하지 않아도 됩니다. “내려받기”, “저장된 모델 보기”, “지금 실행 중인지 보기”, “실행 중지”, “파일 삭제”의 다섯 역할만 구분하면 됩니다. 모델 이름 뒤에 태그가 붙은 경우에는 ollama run에 사용한 이름과 삭제할 이름이 정확히 같은지 확인하세요. 다른 이름을 입력하면 원하는 모델이 실행되지 않거나 삭제되지 않을 수 있습니다.

짧은 질문으로 시작하는 것도 중요합니다. 첫 실행부터 긴 PDF나 수천 줄의 코드를 넣으면 다운로드 문제, 메모리 문제, 응답 품질 문제를 한꺼번에 만나게 됩니다. “이 문장을 세 문장으로 요약해 줘”처럼 입력과 기대 결과가 작은 작업으로 출발한 뒤, 속도와 품질을 확인하면서 파일과 대화를 조금씩 늘리세요.

삭제와 업데이트 전에 남길 기록

업데이트나 모델 삭제 전에는 현재 사용하는 모델 이름, Modelfile을 만들었다면 그 내용, 자주 쓰는 시스템 지침을 별도 메모에 남기세요. 모델 파일 자체를 백업하라는 뜻이 아니라 어떤 구성을 사용했는지 기록하라는 의미입니다. 그래야 업데이트 뒤 답변이 달라졌을 때 프로그램 버전, 모델, 프롬프트 중 무엇이 바뀌었는지 비교할 수 있습니다. 문제가 생기면 한 번에 여러 조건을 바꾸지 말고 하나씩 되돌려 확인하세요.

자주 묻는 질문

모델을 삭제하면 계정이나 대화도 함께 없어지나요?

ollama rm은 선택한 모델 파일을 삭제하는 명령입니다. 계정 데이터나 다른 모델까지 지운다고 확대해석하지 말고, 삭제 전에 모델 이름을 확인하세요. 필요한 모델은 다시 내려받아야 합니다.

작은 모델부터 시작해야 하나요?

처음에는 그렇습니다. 목적은 실행 구조를 익히는 것이므로 메모리 여유와 응답 속도를 확인한 뒤 더 큰 모델을 비교하는 순서가 실패 원인을 찾기 쉽습니다.

API 키 없이 모든 기능을 쓸 수 있나요?

로컬 모델을 실행하는 데 API 키가 필요하지 않을 수 있지만, 클라우드 요청이나 별도 서비스 연동은 인증 방식이 다릅니다. 사용할 기능의 공식 문서를 따로 확인하세요.

Sources

  1. [1] Ollama Quickstart
  2. [2] Ollama CLI Reference
  3. [3] Ollama FAQ

함께 읽을 글