저도 처음에는 로컬 AI라는 말을 들었을 때 조금 막막했습니다.
ChatGPT처럼 인터넷에서 바로 쓰는 AI는 어느 정도 익숙한데요. 내 Mac 안에 AI 모델을 직접 내려받아서 실행한다는 건 또 다른 이야기더라고요.
그래서 호기심에 Ollama를 설치하고 모델을 받아봤습니다.
그런데요. 처음부터 너무 큰 모델을 받았다가 Mac이 엄청 느려졌습니다. 활성 상태 보기에서 스왑이 크게 잡히는 것도 처음 봤고요.
그때 알았습니다.
로컬 AI는 “큰 모델이면 무조건 좋다”가 아니라, 내 컴퓨터 사양에 맞는 모델을 고르는 게 먼저입니다.
오늘은 제가 직접 겪은 내용을 기준으로, Ollama 설치 후 첫 모델 고르는 법을 초보자 눈높이로 정리해 보겠습니다.
저처럼 처음 시작하시는 분이라면 이 글이 꽤 도움이 되실 듯합니다. 특히 Mac에서 Ollama를 처음 써보는 분이라면, 어떤 모델을 받아야 할지 먼저 감을 잡는 데 도움이 되실 거예요.
그럼, 바로 시작해 볼까요.
이 글에는 이런 내용이 들어 있습니다
- Ollama가 무엇인지
- Mac에서 로컬 AI 모델을 실행할 때 봐야 할 것
- 8B, 14B, 35B 같은 모델 이름의 의미
- qwen3:8b와 qwen3:14b 직접 테스트 결과
- Mac에서 AI 모델이 느려지는 이유
- 처음 테스트할 때 쓰기 좋은 Ollama 명령어
- think 옵션과 stream 옵션의 쉬운 설명
이 외에도 제가 테스트하면서 알게 된 내용들을 같이 정리해 보겠습니다.
Ollama는 무엇인가요?
Ollama는 쉽게 말하면 내 컴퓨터에서 AI 모델을 실행할 수 있게 해주는 도구입니다.
ChatGPT는 보통 OpenAI 서버에 접속해서 답변을 받는 방식인데요. Ollama는 모델을 내 Mac에 내려받고, 그 모델이 내 컴퓨터 자원을 사용해서 답변을 만들어냅니다.
이게 재미있기도 하고, 무섭기도 합니다.
왜냐하면 인터넷 연결 없이도 로컬에서 모델을 돌릴 수 있다는 장점이 있지만, 반대로 내 컴퓨터 성능이 부족하면 답변이 아주 느려질 수 있기 때문입니다.
Ollama 공식 문서에 따르면 macOS에서는 Sonoma 버전 이상이 필요하고, Apple M 시리즈는 CPU와 GPU를 지원합니다. 설치는 보통 ollama.dmg 파일을 열고 Applications 폴더로 옮기는 방식입니다.
다만 모델 파일은 생각보다 큽니다. 공식 문서에서도 대형 언어 모델을 저장하려면 수십 GB에서 수백 GB까지 공간이 필요할 수 있다고 안내하고 있습니다.
그래서 Ollama를 처음 쓸 때는 “설치가 됐느냐”보다 “어떤 모델을 받을 것이냐”가 더 중요할 수 있습니다.
Ollama 설치 후 첫 모델 고르는 법은 사양 확인부터였습니다
솔직히 처음에는 저도 이렇게 생각했습니다.
모델 숫자가 크면 더 똑똑하겠지?
그래서 처음에는 35B급 모델을 실행해 봤습니다. 그런데 제 Mac에서는 너무 느렸습니다.
답변이 나오는 속도도 느렸고, 중간에 끊기는 느낌도 있었고요. 활성 상태 보기에서 확인해 보니 스왑이 크게 잡혀 있었습니다.
저는 이때 “아, 로컬 AI는 모델 크기보다 내 컴퓨터 메모리를 먼저 봐야 하는구나” 하고 느꼈습니다.

제가 테스트한 환경은 MacBook Pro 14형, Apple M3 Pro, 메모리 18GB입니다.
이 정도면 일반 작업에는 충분한 사양이라고 생각했는데요. Mac 로컬 AI 모델을 돌릴 때는 이야기가 조금 달랐습니다.
그래서 Ollama 설치 후 첫 모델 고르는 법에서 가장 먼저 봐야 할 것은 모델 이름이 아니라 내 Mac의 메모리와 저장 공간이라고 생각합니다.
8B, 14B, 35B는 무슨 뜻인가요?
Ollama에서 모델을 보면 이런 이름이 보입니다.
qwen3:8b qwen3:14b 35B급 모델
여기서 B는 billion, 즉 10억 단위를 뜻합니다. 아주 쉽게 말하면 모델의 크기를 나타내는 숫자라고 보면 됩니다.
대체로 숫자가 커질수록 더 많은 정보를 담을 수 있고, 답변 품질도 좋아질 가능성이 있습니다. 하지만 그만큼 메모리와 저장 공간도 많이 씁니다.
Ollama 공식 qwen3 모델 페이지를 보면 qwen3:8b는 5.2GB, qwen3:14b는 9.3GB로 표시됩니다.
이 숫자만 봐도 차이가 꽤 납니다. 8B는 5.2GB, 14B는 9.3GB입니다. 여기에 실제 실행할 때 필요한 메모리, 대화 내용, 답변 생성 공간까지 더해집니다.
그러니 Ollama 모델 추천을 찾을 때도 “제일 큰 모델”만 볼 것이 아니라, 내 컴퓨터에서 꾸준히 쓸 수 있는지를 같이 봐야 합니다.
| 모델 | 공식 표시 크기 | 초보자 기준 느낌 | 제 Mac 기준 판단 |
|---|---|---|---|
| qwen3:8b | 5.2GB | 가볍게 시작하기 좋음 | 기본 사용 후보 |
| qwen3:14b | 9.3GB | 품질은 더 기대되지만 느릴 수 있음 | 품질 비교용 |
| 35B급 모델 | 모델에 따라 다름 | 초보자 Mac에는 부담될 수 있음 | 제 환경에서는 비추천 |
Mac에서 AI 모델이 느려지는 이유
제가 직접 겪어보니, 로컬 AI가 느려지는 이유는 크게 세 가지로 볼 수 있었습니다.
1. 모델 자체가 너무 큽니다
큰 모델은 더 많은 메모리를 필요로 합니다. 그런데 Mac은 메모리가 정해져 있잖아요.
제 Mac은 18GB 메모리인데, 여기에 macOS, 브라우저, Ollama, 모델까지 모두 같이 올라갑니다. 그러면 큰 모델을 실행할 때 여유 공간이 부족해질 수 있습니다.
2. 스왑이 생기면 확 느려집니다
스왑은 쉽게 말하면 메모리가 부족할 때 SSD를 임시 메모리처럼 쓰는 것입니다.
책상 위에 올려놓고 바로 작업해야 빠른데, 책상이 부족해서 창고를 왔다 갔다 하는 느낌입니다. 그러니 당연히 느려집니다.

저는 처음 큰 모델을 실행했을 때 스왑이 크게 잡히는 것을 보고 바로 중단했습니다.
3. context 길이를 크게 잡으면 메모리를 더 씁니다
Ollama에는 context length라는 개념이 있습니다.
쉽게 말하면 모델이 한 번에 참고할 수 있는 대화나 문서의 길이입니다. 길게 잡으면 긴 문서 분석에는 좋을 수 있지만, 그만큼 메모리도 더 필요합니다.
Ollama 공식 문서에서도 context length를 크게 설정하면 모델 실행에 필요한 메모리가 증가한다고 설명합니다. 그래서 처음에는 너무 크게 잡지 않는 것이 좋습니다.
Ollama Mac 모델 추천 기준은 8B부터였습니다
큰 모델은 잠시 내려놓고, 다시 현실적인 모델부터 테스트해 봤습니다.
제가 받은 모델은 아래 두 개입니다.
qwen3:8b qwen3:14b
제 환경 기준으로 Ollama Mac 모델 추천을 한다면, 처음은 qwen3:8b부터가 더 현실적이었습니다. qwen3:14b는 비교용으로는 괜찮지만, 매번 쓰기에는 속도 부담이 있었습니다.

설치 후에는 터미널에서 ollama list 명령어로 모델 목록을 확인할 수 있습니다.
ollama list
이렇게 보면 어떤 모델이 설치되어 있는지, 모델 크기가 어느 정도인지 확인할 수 있습니다.
qwen3 8b 14b 차이: 기본 응답 테스트
먼저 짧은 한국어 답변을 요청해 봤습니다.
이 테스트는 모델이 얼마나 빠르게 반응하는지 대략적인 감을 보기 위한 것이었습니다.
qwen3 8b 14b 차이를 숫자로만 보면 모델 크기 차이인데요. 실제로 써보면 속도 차이도 꽤 체감됩니다.

제 테스트에서는 qwen3:8b의 짧은 답변이 약 13초, qwen3:14b의 짧은 답변이 약 20초 정도 걸렸습니다.
물론 이 시간은 질문 길이, Mac 상태, 실행 중인 앱, context 설정에 따라 달라질 수 있습니다. 그래도 제 Mac에서는 8B가 기본 사용 후보로 더 현실적이라는 느낌이었습니다.
qwen3:8b 블로그 목차 테스트 결과
이번에는 블로그 목차 작성 요청을 해봤습니다.
로컬 AI를 블로그 글쓰기 보조로 쓰려면 단순 자기소개보다 이런 테스트가 더 현실적이니까요.
Ollama qwen3 모델을 블로그 보조로 쓸 수 있을지 보려면, 이런 목차 작성 테스트를 한 번 해보는 것도 괜찮았습니다.

qwen3:8b는 블로그 목차 작성 테스트에서 약 29초 정도 걸렸습니다.
답변 품질이 완벽하다고 말할 수는 없지만, 초안이나 아이디어를 잡는 용도로는 충분히 활용 가능해 보였습니다.
qwen3:14b 블로그 목차 테스트 결과
그다음은 qwen3:14b입니다.
14B는 8B보다 모델이 큽니다. 그래서 조금 더 차분하고 정리된 답변을 기대할 수 있지만, 속도는 확실히 느려질 수 있습니다.

제 테스트에서는 qwen3:14b의 블로그 목차 작성이 약 65초 정도 걸렸습니다.
8B와 비교하면 꽤 차이가 났습니다.
| 테스트 | qwen3:8b | qwen3:14b | 느낌 |
|---|---|---|---|
| 짧은 한국어 답변 | 약 13초 | 약 20초 | 14B가 조금 더 느림 |
| 블로그 목차 작성 | 약 29초 | 약 65초 | 14B가 체감상 많이 느림 |
| 용도 | 기본 사용 | 품질 비교 | 상황에 따라 선택 |
그래서 제 기준에서는 이렇게 정리했습니다.
qwen3:8b는 기본 사용 후보, qwen3:14b는 품질이 필요할 때 비교용.
ollama ps로 GPU 사용 여부도 확인해 보세요
Ollama 모델이 실행 중일 때는 아래 명령어로 현재 상태를 확인할 수 있습니다.
ollama ps
여기서 중요한 것은 PROCESSOR 부분입니다.
Ollama 공식 문서에서도 ollama ps를 통해 context length와 모델 offloading 상태를 확인하라고 안내합니다. 예를 들어 100% GPU로 표시되면 모델이 GPU 쪽에서 잘 실행되고 있다는 뜻으로 볼 수 있습니다.
제 테스트에서는 qwen3:8b와 qwen3:14b 모두 100% GPU로 올라가는 것을 확인했습니다.
다만 100% GPU로 올라간다고 해서 무조건 빠른 것은 아닙니다. 모델이 크면 여전히 느릴 수 있고, Mac 전체 메모리 상태도 함께 봐야 합니다.

처음 테스트할 때 쓴 명령어
처음 시작하시는 분이라면 아래 명령어 정도만 알아도 충분합니다.
설치된 모델 확인
ollama list
내 Mac에 어떤 모델이 받아져 있는지 확인합니다.
qwen3:8b 실행
ollama run qwen3:8b
처음에는 8B 모델부터 시작하는 것을 추천합니다.
qwen3:14b 실행
ollama run qwen3:14b
8B가 괜찮다면 14B도 비교해 볼 수 있습니다.
실행 중인 모델 확인
ollama ps
현재 실행 중인 모델, 모델 크기, GPU 사용 여부, context 길이 등을 확인할 수 있습니다.
모델 중지
ollama stop qwen3:8b ollama stop qwen3:14b
테스트가 끝나면 모델을 내려주는 것이 좋습니다. 그래야 메모리 부담을 줄일 수 있습니다.
스트리밍 테스트는 이렇게 해볼 수 있습니다
Ollama는 API로도 사용할 수 있습니다. 특히 채팅 화면을 만들거나 AI SDK 같은 도구와 연결하려면 스트리밍 응답이 중요합니다.
스트리밍은 답변을 다 만든 뒤 한 번에 보여주는 것이 아니라, 생성되는 대로 조금씩 보여주는 방식입니다.
아래는 qwen3:8b 모델로 스트리밍 응답을 테스트하는 예시입니다.
curl -N http://localhost:11434/api/chat \
-d '{
"model": "qwen3:8b",
"messages": [
{
"role": "user",
"content": "한국어로 블로그 글 제목 5개를 추천해 주세요. 주제는 Ollama 입문입니다."
}
],
"stream": true,
"think": false,
"options": {
"num_ctx": 4096,
"num_predict": 500
}
}'
여기서 stream은 응답을 스트리밍으로 받을지 정하는 옵션입니다. Ollama Chat API 문서 기준으로 stream의 기본값은 true입니다.
num_ctx는 context 길이, num_predict는 생성할 답변 길이를 제한하는 설정으로 이해하면 됩니다.
think 옵션은 켜야 할까요, 꺼야 할까요?
이 부분도 처음에는 헷갈렸습니다.
qwen3 계열은 thinking 기능을 지원합니다. Ollama Chat API 문서에서도 think를 켜면 최종 답변과 별도로 thinking output을 반환할 수 있다고 설명합니다.
그런데 제가 테스트해보니, 처음부터 think:true로 쓰면 답변보다 thinking 출력이 길게 나오는 경우가 있었습니다. 특히 num_predict를 작게 잡으면 최종 답변이 나오기 전에 길이가 끝날 수도 있겠더라고요.

그래서 초보자 기준으로는 이렇게 나누면 좋겠습니다.
| 설정 | 추천 상황 | 느낌 |
|---|---|---|
think:false | 블로그 제목, 목차, 짧은 요약, 간단한 질문 | 빠르고 실무적 |
think:true | 복잡한 비교, 코드 오류 분석, 깊은 추론 | 느리지만 더 생각함 |
그러니까 think:false가 무조건 멍청한 모드는 아닙니다.
제 느낌으로는 빠른 실무 모드에 가깝습니다. 블로그 목차를 잡거나 짧은 초안을 만드는 정도라면 think:false로도 충분히 쓸 만했습니다.
Mac 로컬 AI 초보자라면 처음 추천하는 설정
제가 다시 처음으로 돌아간다면 이렇게 시작할 것 같습니다.
model: qwen3:8b num_ctx: 4096 num_predict: 500 think: false stream: true
왜냐하면 처음부터 큰 모델, 긴 context, thinking 모드를 모두 켜면 Mac이 버거워질 수 있기 때문입니다.
먼저 가볍게 테스트하고, 내 Mac에서 어느 정도까지 괜찮은지 확인한 뒤에 모델을 키우는 게 좋습니다.
제 결론: 처음은 qwen3:8b부터가 좋았습니다
정리해 보면 이렇습니다.
- 처음부터 30B, 35B급 모델을 받으면 Mac이 많이 느려질 수 있습니다.
- Mac 메모리가 18GB라면 8B부터 시작하는 것이 현실적입니다.
- 14B는 품질 비교용으로 써볼 수 있지만 속도 차이가 꽤 납니다.
- 모델 실행 중에는
ollama ps로 GPU 사용 여부를 확인하는 것이 좋습니다. - 활성 상태 보기에서 메모리 압력과 스왑도 같이 확인해야 합니다.
- 블로그 목차나 짧은 요약은
think:false로도 충분히 테스트할 수 있습니다.
저도 처음에는 큰 모델이 무조건 좋은 줄 알았는데요.
막상 직접 돌려보니, 로컬 AI는 “내 컴퓨터에 맞는 모델을 고르는 것”이 가장 먼저였습니다.
정리하면, Ollama 설치 후 첫 모델 고르는 법은 생각보다 단순했습니다. 처음부터 큰 모델을 받기보다 내 Mac에서 무리 없이 돌아가는 8B급 모델부터 확인하는 것이 좋았습니다.
혹시 이제 막 Ollama를 설치하셨다면, 처음부터 무리하지 말고 qwen3:8b 정도부터 천천히 테스트해 보셔요.
저도 앞으로 qwen3.5, Gemma, Obsidian 기록 방식, AI SDK 스트리밍 연결까지 하나씩 테스트하면서 정리해 보겠습니다.
처음엔 조금 헷갈리지만요. 하나씩 해보면 생각보다 재미있습니다. ^^
참고한 공식 자료
- Ollama macOS 공식 문서
- Ollama qwen3 모델 페이지
- Ollama context length 공식 문서
- Ollama Chat API 공식 문서
- Google Search Central – helpful content 안내
함께 보면 좋은 글
아래 글은 이어서 정리할 예정입니다. 발행 후 내부링크로 연결해 두겠습니다.
- qwen3 8B 14B 차이 직접 테스트 | Mac M3 Pro 18GB 기준 속도와 메모리 비교
- Mac에서 Ollama가 느릴 때 확인할 7가지
- Obsidian으로 AI 공부 기록하기 | Ollama 테스트와 블로그 아이디어 정리법
- Ollama streaming API 테스트 방법 | 초보자용 curl 예시
Ollama 설치 후 첫 모델 고르는 법은 무엇인가요?
처음에는 8B급 모델부터 테스트하고, Mac 메모리와 스왑 사용량을 확인한 뒤 14B 이상으로 비교하는 것이 좋습니다. 처음부터 큰 모델을 받으면 속도와 메모리 부담이 커질 수 있습니다.
Ollama Mac 모델 추천은 무엇부터 시작하면 좋나요?
Mac 메모리가 18GB 정도라면 qwen3:8b처럼 8B급 모델부터 시작하는 것이 현실적입니다. qwen3:14b는 품질 비교용으로 테스트해 볼 수 있지만 속도는 느릴 수 있습니다.
qwen3 8b 14b 차이는 무엇인가요?
qwen3:8b는 더 가볍고 빠르게 쓰기 좋고, qwen3:14b는 더 큰 모델이라 답변 품질을 기대할 수 있지만 속도와 메모리 부담이 커질 수 있습니다.
Mac 로컬 AI를 처음 쓸 때 가장 먼저 확인할 것은 무엇인가요?
모델 이름보다 먼저 Mac의 메모리, 저장 공간, 스왑 사용량을 확인하는 것이 좋습니다. 큰 모델은 Mac 전체 성능을 느리게 만들 수 있습니다.
Ollama qwen3의 think 옵션은 항상 켜야 하나요?
항상 켤 필요는 없습니다. 블로그 제목, 목차, 짧은 요약처럼 빠른 작업은 think:false로 충분할 수 있습니다. 복잡한 비교나 코드 분석처럼 깊게 생각해야 하는 작업에서는 think:true를 테스트해 볼 수 있습니다.
댓글 남기기