Ollama 설치 후 첫 모델 고르는 법 | Mac 초보자를 위한 로컬 AI 입문

저도 처음에는 로컬 AI라는 말을 들었을 때 조금 막막했습니다.

ChatGPT처럼 인터넷에서 바로 쓰는 AI는 어느 정도 익숙한데요. 내 Mac 안에 AI 모델을 직접 내려받아서 실행한다는 건 또 다른 이야기더라고요.

그래서 호기심에 Ollama를 설치하고 모델을 받아봤습니다.

그런데요. 처음부터 너무 큰 모델을 받았다가 Mac이 엄청 느려졌습니다. 활성 상태 보기에서 스왑이 크게 잡히는 것도 처음 봤고요.

그때 알았습니다.

로컬 AI는 “큰 모델이면 무조건 좋다”가 아니라, 내 컴퓨터 사양에 맞는 모델을 고르는 게 먼저입니다.

오늘은 제가 직접 겪은 내용을 기준으로, Ollama 설치 후 첫 모델 고르는 법을 초보자 눈높이로 정리해 보겠습니다.

저처럼 처음 시작하시는 분이라면 이 글이 꽤 도움이 되실 듯합니다. 특히 Mac에서 Ollama를 처음 써보는 분이라면, 어떤 모델을 받아야 할지 먼저 감을 잡는 데 도움이 되실 거예요.

그럼, 바로 시작해 볼까요.

이 글에는 이런 내용이 들어 있습니다

  • Ollama가 무엇인지
  • Mac에서 로컬 AI 모델을 실행할 때 봐야 할 것
  • 8B, 14B, 35B 같은 모델 이름의 의미
  • qwen3:8b와 qwen3:14b 직접 테스트 결과
  • Mac에서 AI 모델이 느려지는 이유
  • 처음 테스트할 때 쓰기 좋은 Ollama 명령어
  • think 옵션과 stream 옵션의 쉬운 설명

이 외에도 제가 테스트하면서 알게 된 내용들을 같이 정리해 보겠습니다.

Ollama는 무엇인가요?

Ollama는 쉽게 말하면 내 컴퓨터에서 AI 모델을 실행할 수 있게 해주는 도구입니다.

ChatGPT는 보통 OpenAI 서버에 접속해서 답변을 받는 방식인데요. Ollama는 모델을 내 Mac에 내려받고, 그 모델이 내 컴퓨터 자원을 사용해서 답변을 만들어냅니다.

이게 재미있기도 하고, 무섭기도 합니다.

왜냐하면 인터넷 연결 없이도 로컬에서 모델을 돌릴 수 있다는 장점이 있지만, 반대로 내 컴퓨터 성능이 부족하면 답변이 아주 느려질 수 있기 때문입니다.

Ollama 공식 문서에 따르면 macOS에서는 Sonoma 버전 이상이 필요하고, Apple M 시리즈는 CPU와 GPU를 지원합니다. 설치는 보통 ollama.dmg 파일을 열고 Applications 폴더로 옮기는 방식입니다.

다만 모델 파일은 생각보다 큽니다. 공식 문서에서도 대형 언어 모델을 저장하려면 수십 GB에서 수백 GB까지 공간이 필요할 수 있다고 안내하고 있습니다.

그래서 Ollama를 처음 쓸 때는 “설치가 됐느냐”보다 “어떤 모델을 받을 것이냐”가 더 중요할 수 있습니다.

Ollama 설치 후 첫 모델 고르는 법은 사양 확인부터였습니다

솔직히 처음에는 저도 이렇게 생각했습니다.

모델 숫자가 크면 더 똑똑하겠지?

그래서 처음에는 35B급 모델을 실행해 봤습니다. 그런데 제 Mac에서는 너무 느렸습니다.

답변이 나오는 속도도 느렸고, 중간에 끊기는 느낌도 있었고요. 활성 상태 보기에서 확인해 보니 스왑이 크게 잡혀 있었습니다.

저는 이때 “아, 로컬 AI는 모델 크기보다 내 컴퓨터 메모리를 먼저 봐야 하는구나” 하고 느꼈습니다.

MacBook Pro M3 Pro 18GB Ollama 로컬 AI 테스트 사양 화면
MacBook Pro M3 Pro 18GB 환경에서 Ollama 모델 테스트를 진행한 사양 화면

제가 테스트한 환경은 MacBook Pro 14형, Apple M3 Pro, 메모리 18GB입니다.

이 정도면 일반 작업에는 충분한 사양이라고 생각했는데요. Mac 로컬 AI 모델을 돌릴 때는 이야기가 조금 달랐습니다.

그래서 Ollama 설치 후 첫 모델 고르는 법에서 가장 먼저 봐야 할 것은 모델 이름이 아니라 내 Mac의 메모리와 저장 공간이라고 생각합니다.

8B, 14B, 35B는 무슨 뜻인가요?

Ollama에서 모델을 보면 이런 이름이 보입니다.

qwen3:8b
qwen3:14b
35B급 모델

여기서 B는 billion, 즉 10억 단위를 뜻합니다. 아주 쉽게 말하면 모델의 크기를 나타내는 숫자라고 보면 됩니다.

대체로 숫자가 커질수록 더 많은 정보를 담을 수 있고, 답변 품질도 좋아질 가능성이 있습니다. 하지만 그만큼 메모리와 저장 공간도 많이 씁니다.

Ollama 공식 qwen3 모델 페이지를 보면 qwen3:8b는 5.2GB, qwen3:14b는 9.3GB로 표시됩니다.

이 숫자만 봐도 차이가 꽤 납니다. 8B는 5.2GB, 14B는 9.3GB입니다. 여기에 실제 실행할 때 필요한 메모리, 대화 내용, 답변 생성 공간까지 더해집니다.

그러니 Ollama 모델 추천을 찾을 때도 “제일 큰 모델”만 볼 것이 아니라, 내 컴퓨터에서 꾸준히 쓸 수 있는지를 같이 봐야 합니다.

모델공식 표시 크기초보자 기준 느낌제 Mac 기준 판단
qwen3:8b5.2GB가볍게 시작하기 좋음기본 사용 후보
qwen3:14b9.3GB품질은 더 기대되지만 느릴 수 있음품질 비교용
35B급 모델모델에 따라 다름초보자 Mac에는 부담될 수 있음제 환경에서는 비추천

Mac에서 AI 모델이 느려지는 이유

제가 직접 겪어보니, 로컬 AI가 느려지는 이유는 크게 세 가지로 볼 수 있었습니다.

1. 모델 자체가 너무 큽니다

큰 모델은 더 많은 메모리를 필요로 합니다. 그런데 Mac은 메모리가 정해져 있잖아요.

제 Mac은 18GB 메모리인데, 여기에 macOS, 브라우저, Ollama, 모델까지 모두 같이 올라갑니다. 그러면 큰 모델을 실행할 때 여유 공간이 부족해질 수 있습니다.

2. 스왑이 생기면 확 느려집니다

스왑은 쉽게 말하면 메모리가 부족할 때 SSD를 임시 메모리처럼 쓰는 것입니다.

책상 위에 올려놓고 바로 작업해야 빠른데, 책상이 부족해서 창고를 왔다 갔다 하는 느낌입니다. 그러니 당연히 느려집니다.

Ollama 설치 후 첫 모델 고르는 법 - Ollama 모델 실행 중 Mac 활성 상태 보기에서 메모리와 스왑 사용량을 확인한 화면
Ollama 모델 실행 중 Mac 활성 상태 보기에서 메모리와 스왑 사용량을 확인한 화면

저는 처음 큰 모델을 실행했을 때 스왑이 크게 잡히는 것을 보고 바로 중단했습니다.

3. context 길이를 크게 잡으면 메모리를 더 씁니다

Ollama에는 context length라는 개념이 있습니다.

쉽게 말하면 모델이 한 번에 참고할 수 있는 대화나 문서의 길이입니다. 길게 잡으면 긴 문서 분석에는 좋을 수 있지만, 그만큼 메모리도 더 필요합니다.

Ollama 공식 문서에서도 context length를 크게 설정하면 모델 실행에 필요한 메모리가 증가한다고 설명합니다. 그래서 처음에는 너무 크게 잡지 않는 것이 좋습니다.

Ollama Mac 모델 추천 기준은 8B부터였습니다

큰 모델은 잠시 내려놓고, 다시 현실적인 모델부터 테스트해 봤습니다.

제가 받은 모델은 아래 두 개입니다.

qwen3:8b
qwen3:14b

제 환경 기준으로 Ollama Mac 모델 추천을 한다면, 처음은 qwen3:8b부터가 더 현실적이었습니다. qwen3:14b는 비교용으로는 괜찮지만, 매번 쓰기에는 속도 부담이 있었습니다.

Ollama list 명령어로 qwen3 8b와 qwen3 14b 설치 확인 화면
ollama list 명령어로 qwen3:8b와 qwen3:14b 설치 상태를 확인한 화면

설치 후에는 터미널에서 ollama list 명령어로 모델 목록을 확인할 수 있습니다.

ollama list

이렇게 보면 어떤 모델이 설치되어 있는지, 모델 크기가 어느 정도인지 확인할 수 있습니다.

qwen3 8b 14b 차이: 기본 응답 테스트

먼저 짧은 한국어 답변을 요청해 봤습니다.

이 테스트는 모델이 얼마나 빠르게 반응하는지 대략적인 감을 보기 위한 것이었습니다.

qwen3 8b 14b 차이를 숫자로만 보면 모델 크기 차이인데요. 실제로 써보면 속도 차이도 꽤 체감됩니다.

제 테스트에서는 qwen3:8b의 짧은 답변이 약 13초, qwen3:14b의 짧은 답변이 약 20초 정도 걸렸습니다.

물론 이 시간은 질문 길이, Mac 상태, 실행 중인 앱, context 설정에 따라 달라질 수 있습니다. 그래도 제 Mac에서는 8B가 기본 사용 후보로 더 현실적이라는 느낌이었습니다.

qwen3:8b 블로그 목차 테스트 결과

이번에는 블로그 목차 작성 요청을 해봤습니다.

로컬 AI를 블로그 글쓰기 보조로 쓰려면 단순 자기소개보다 이런 테스트가 더 현실적이니까요.

Ollama qwen3 모델을 블로그 보조로 쓸 수 있을지 보려면, 이런 목차 작성 테스트를 한 번 해보는 것도 괜찮았습니다.

qwen3 8b Ollama 블로그 목차 작성 속도 테스트 결과 화면
qwen3:8b 모델로 블로그 목차 작성 속도를 테스트한 화면

qwen3:8b는 블로그 목차 작성 테스트에서 약 29초 정도 걸렸습니다.

답변 품질이 완벽하다고 말할 수는 없지만, 초안이나 아이디어를 잡는 용도로는 충분히 활용 가능해 보였습니다.

qwen3:14b 블로그 목차 테스트 결과

그다음은 qwen3:14b입니다.

14B는 8B보다 모델이 큽니다. 그래서 조금 더 차분하고 정리된 답변을 기대할 수 있지만, 속도는 확실히 느려질 수 있습니다.

qwen3 14b Ollama 블로그 목차 작성 속도 테스트 결과 화면
qwen3:14b 모델로 블로그 목차 작성 속도를 테스트한 화면

제 테스트에서는 qwen3:14b의 블로그 목차 작성이 약 65초 정도 걸렸습니다.

8B와 비교하면 꽤 차이가 났습니다.

테스트qwen3:8bqwen3:14b느낌
짧은 한국어 답변약 13초약 20초14B가 조금 더 느림
블로그 목차 작성약 29초약 65초14B가 체감상 많이 느림
용도기본 사용품질 비교상황에 따라 선택

그래서 제 기준에서는 이렇게 정리했습니다.

qwen3:8b는 기본 사용 후보, qwen3:14b는 품질이 필요할 때 비교용.

ollama ps로 GPU 사용 여부도 확인해 보세요

Ollama 모델이 실행 중일 때는 아래 명령어로 현재 상태를 확인할 수 있습니다.

ollama ps

여기서 중요한 것은 PROCESSOR 부분입니다.

Ollama 공식 문서에서도 ollama ps를 통해 context length와 모델 offloading 상태를 확인하라고 안내합니다. 예를 들어 100% GPU로 표시되면 모델이 GPU 쪽에서 잘 실행되고 있다는 뜻으로 볼 수 있습니다.

제 테스트에서는 qwen3:8b와 qwen3:14b 모두 100% GPU로 올라가는 것을 확인했습니다.

다만 100% GPU로 올라간다고 해서 무조건 빠른 것은 아닙니다. 모델이 크면 여전히 느릴 수 있고, Mac 전체 메모리 상태도 함께 봐야 합니다.

Ollama 실행 중 Mac 활성 상태 보기 프로세스별 메모리 사용량 화면
Ollama 실행 중 Mac 활성 상태 보기에서 프로세스별 메모리 사용량을 확인한 화면

처음 테스트할 때 쓴 명령어

처음 시작하시는 분이라면 아래 명령어 정도만 알아도 충분합니다.

설치된 모델 확인

ollama list

내 Mac에 어떤 모델이 받아져 있는지 확인합니다.

qwen3:8b 실행

ollama run qwen3:8b

처음에는 8B 모델부터 시작하는 것을 추천합니다.

qwen3:14b 실행

ollama run qwen3:14b

8B가 괜찮다면 14B도 비교해 볼 수 있습니다.

실행 중인 모델 확인

ollama ps

현재 실행 중인 모델, 모델 크기, GPU 사용 여부, context 길이 등을 확인할 수 있습니다.

모델 중지

ollama stop qwen3:8b
ollama stop qwen3:14b

테스트가 끝나면 모델을 내려주는 것이 좋습니다. 그래야 메모리 부담을 줄일 수 있습니다.

스트리밍 테스트는 이렇게 해볼 수 있습니다

Ollama는 API로도 사용할 수 있습니다. 특히 채팅 화면을 만들거나 AI SDK 같은 도구와 연결하려면 스트리밍 응답이 중요합니다.

스트리밍은 답변을 다 만든 뒤 한 번에 보여주는 것이 아니라, 생성되는 대로 조금씩 보여주는 방식입니다.

아래는 qwen3:8b 모델로 스트리밍 응답을 테스트하는 예시입니다.

curl -N http://localhost:11434/api/chat \
  -d '{
    "model": "qwen3:8b",
    "messages": [
      {
        "role": "user",
        "content": "한국어로 블로그 글 제목 5개를 추천해 주세요. 주제는 Ollama 입문입니다."
      }
    ],
    "stream": true,
    "think": false,
    "options": {
      "num_ctx": 4096,
      "num_predict": 500
    }
  }'

여기서 stream은 응답을 스트리밍으로 받을지 정하는 옵션입니다. Ollama Chat API 문서 기준으로 stream의 기본값은 true입니다.

num_ctx는 context 길이, num_predict는 생성할 답변 길이를 제한하는 설정으로 이해하면 됩니다.

think 옵션은 켜야 할까요, 꺼야 할까요?

이 부분도 처음에는 헷갈렸습니다.

qwen3 계열은 thinking 기능을 지원합니다. Ollama Chat API 문서에서도 think를 켜면 최종 답변과 별도로 thinking output을 반환할 수 있다고 설명합니다.

그런데 제가 테스트해보니, 처음부터 think:true로 쓰면 답변보다 thinking 출력이 길게 나오는 경우가 있었습니다. 특히 num_predict를 작게 잡으면 최종 답변이 나오기 전에 길이가 끝날 수도 있겠더라고요.

Ollama qwen3 thinking 스트리밍 출력 테스트 화면
qwen3 모델에서 thinking 출력이 길게 이어지는 스트리밍 테스트 화면

그래서 초보자 기준으로는 이렇게 나누면 좋겠습니다.

설정추천 상황느낌
think:false블로그 제목, 목차, 짧은 요약, 간단한 질문빠르고 실무적
think:true복잡한 비교, 코드 오류 분석, 깊은 추론느리지만 더 생각함

그러니까 think:false가 무조건 멍청한 모드는 아닙니다.

제 느낌으로는 빠른 실무 모드에 가깝습니다. 블로그 목차를 잡거나 짧은 초안을 만드는 정도라면 think:false로도 충분히 쓸 만했습니다.

Mac 로컬 AI 초보자라면 처음 추천하는 설정

제가 다시 처음으로 돌아간다면 이렇게 시작할 것 같습니다.

model: qwen3:8b
num_ctx: 4096
num_predict: 500
think: false
stream: true

왜냐하면 처음부터 큰 모델, 긴 context, thinking 모드를 모두 켜면 Mac이 버거워질 수 있기 때문입니다.

먼저 가볍게 테스트하고, 내 Mac에서 어느 정도까지 괜찮은지 확인한 뒤에 모델을 키우는 게 좋습니다.

제 결론: 처음은 qwen3:8b부터가 좋았습니다

정리해 보면 이렇습니다.

  • 처음부터 30B, 35B급 모델을 받으면 Mac이 많이 느려질 수 있습니다.
  • Mac 메모리가 18GB라면 8B부터 시작하는 것이 현실적입니다.
  • 14B는 품질 비교용으로 써볼 수 있지만 속도 차이가 꽤 납니다.
  • 모델 실행 중에는 ollama ps로 GPU 사용 여부를 확인하는 것이 좋습니다.
  • 활성 상태 보기에서 메모리 압력과 스왑도 같이 확인해야 합니다.
  • 블로그 목차나 짧은 요약은 think:false로도 충분히 테스트할 수 있습니다.

저도 처음에는 큰 모델이 무조건 좋은 줄 알았는데요.

막상 직접 돌려보니, 로컬 AI는 “내 컴퓨터에 맞는 모델을 고르는 것”이 가장 먼저였습니다.

정리하면, Ollama 설치 후 첫 모델 고르는 법은 생각보다 단순했습니다. 처음부터 큰 모델을 받기보다 내 Mac에서 무리 없이 돌아가는 8B급 모델부터 확인하는 것이 좋았습니다.

혹시 이제 막 Ollama를 설치하셨다면, 처음부터 무리하지 말고 qwen3:8b 정도부터 천천히 테스트해 보셔요.

저도 앞으로 qwen3.5, Gemma, Obsidian 기록 방식, AI SDK 스트리밍 연결까지 하나씩 테스트하면서 정리해 보겠습니다.

처음엔 조금 헷갈리지만요. 하나씩 해보면 생각보다 재미있습니다. ^^

참고한 공식 자료

함께 보면 좋은 글

아래 글은 이어서 정리할 예정입니다. 발행 후 내부링크로 연결해 두겠습니다.

  • qwen3 8B 14B 차이 직접 테스트 | Mac M3 Pro 18GB 기준 속도와 메모리 비교
  • Mac에서 Ollama가 느릴 때 확인할 7가지
  • Obsidian으로 AI 공부 기록하기 | Ollama 테스트와 블로그 아이디어 정리법
  • Ollama streaming API 테스트 방법 | 초보자용 curl 예시

Ollama 설치 후 첫 모델 고르는 법은 무엇인가요?

처음에는 8B급 모델부터 테스트하고, Mac 메모리와 스왑 사용량을 확인한 뒤 14B 이상으로 비교하는 것이 좋습니다. 처음부터 큰 모델을 받으면 속도와 메모리 부담이 커질 수 있습니다.

Ollama Mac 모델 추천은 무엇부터 시작하면 좋나요?

Mac 메모리가 18GB 정도라면 qwen3:8b처럼 8B급 모델부터 시작하는 것이 현실적입니다. qwen3:14b는 품질 비교용으로 테스트해 볼 수 있지만 속도는 느릴 수 있습니다.

qwen3 8b 14b 차이는 무엇인가요?

qwen3:8b는 더 가볍고 빠르게 쓰기 좋고, qwen3:14b는 더 큰 모델이라 답변 품질을 기대할 수 있지만 속도와 메모리 부담이 커질 수 있습니다.

Mac 로컬 AI를 처음 쓸 때 가장 먼저 확인할 것은 무엇인가요?

모델 이름보다 먼저 Mac의 메모리, 저장 공간, 스왑 사용량을 확인하는 것이 좋습니다. 큰 모델은 Mac 전체 성능을 느리게 만들 수 있습니다.

Ollama qwen3의 think 옵션은 항상 켜야 하나요?

항상 켤 필요는 없습니다. 블로그 제목, 목차, 짧은 요약처럼 빠른 작업은 think:false로 충분할 수 있습니다. 복잡한 비교나 코드 분석처럼 깊게 생각해야 하는 작업에서는 think:true를 테스트해 볼 수 있습니다.

댓글 남기기

댓글 남기기