Ollama는 이제 "로컬에서 LLM 돌리는 도구"만이 아닙니다. 2026년에는 클라우드 모델, 웹 검색 API, Apple Silicon MLX 가속, 코딩 에이전트 연동까지 붙어 로컬 우선 AI 플랫폼으로 넓어졌습니다. 설치·모델 선택·VRAM 계산을 한 번에 정리합니다.
요약 (Quick Answer) — Ollama 2026
3분 시작
# macOS
brew install ollama
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows: ollama.com 에서 설치 프로그램 다운로드
ollama run qwen3.6:27b # 24GB 이상
ollama run gpt-oss:20b # 16GB
ollama run gemma4:12b # 8GB
내 램에 맞는 모델 (Q4 기준)
| 메모리 | 권장 모델 | 용도 |
|---|---|---|
| 8GB | gemma4:12b, mellum2 |
일반 대화, 가벼운 코딩 |
| 16GB | gpt-oss:20b |
추론, 균형 |
| 24GB | qwen3.6:27b ⭐ |
소비자 하드웨어 최강 |
| 32GB+ | qwen3-coder:30b, gemma4:31b |
코딩, 비전 |
| 64GB+ | deepseek-r1:70b, gpt-oss:120b |
워크스테이션 |
| VRAM 부족 | gpt-oss:120b-cloud |
클라우드로 우회 |
VRAM 계산 공식: Q4 기준 파라미터 10억당 약 0.60.7GB + 컨텍스트용 2030% 여유
2026년에 추가된 것
| 기능 | 명령 / 엔드포인트 |
|---|---|
| 클라우드 모델 | ollama run gpt-oss:120b-cloud |
| 웹 검색 API | POST https://ollama.com/api/web_search |
| 코딩 에이전트 연동 | ollama launch claude --model qwen3.6:27b |
| MLX 가속 (Apple Silicon) | 자동 적용 |
| 이미지 생성 (macOS) | ollama run x/z-image-turbo "프롬프트" |
| OpenAI · Anthropic API 호환 | localhost:11434 |
검증 환경: macOS Sequoia 15.x / Apple Silicon M2 Pro / Ollama v0.32.0
마지막 업데이트: 2026-07-27

Ollama란 무엇인가
Ollama는 내 컴퓨터에서 LLM을 실행하는 도구입니다. 2023년에 처음 나왔습니다.
"도커의 로컬 LLM 버전"이라는 비유가 자주 쓰입니다. ollama pull로 모델을 받고 ollama run으로 띄우는 방식이 docker pull·docker run과 닮아서입니다. 모델 파일 형식, 양자화 설정, GPU 할당 같은 걸 직접 만질 필요가 없습니다.
2026년의 Ollama는 조금 다릅니다
"로컬에서 LLM 돌리는 도구"라는 정의는 여전히 맞습니다. 다만 커버 범위가 계속 줄고 있습니다.
| 시기 | 무엇이었나 |
|---|---|
| 2023~2024 | 로컬 모델 실행기 |
| 2025 | + 클라우드 모델, 웹 검색 API |
| 2026 | + MLX 가속, 코딩 에이전트 연동, 이미지 생성, Anthropic API 호환 |
Wikipedia는 2025~2026년에 Ollama가 호스팅 클라우드 모델, 웹 검색 지원, 도구·코딩 에이전트 연동을 추가했다고 정리합니다. 로컬 실행기가 아니라 로컬 우선 AI 플랫폼으로 보는 편이 실제에 가깝습니다.
핵심은 API가 하나라는 점입니다. 어떤 모델이 내 GPU에서 돌고 어떤 모델이 Ollama 인프라로 라우팅되든, 명령도 포트도 똑같습니다. 로컬로 프로토타이핑하다가 큰 모델이 필요하면 -cloud 접미사만 붙이면 됩니다. 코드는 그대로입니다.
왜 로컬인가
- 비용: 로컬 실행은 토큰 요금이 0원입니다. 구독료도 없습니다.
- 프라이버시: 데이터가 내 기기를 벗어나지 않습니다. 사내 코드나 개인 문서를 다룰 때 결정적입니다.
- 오프라인: 비행기, 지하, 폐쇄망에서도 돌아갑니다.
- 속도: 짧은 요청은 네트워크 왕복이 없어 클라우드보다 빠를 때도 있습니다.
어디까지 안 되나
정직하게 짚습니다.
- 동시 요청에 약합니다. vLLM은 같은 하드웨어에서 초당 토큰 기준 약 2.6배를 냅니다. 동시성으로 가면 격차가 훨씬 커집니다. PagedAttention과 연속 배칭이 없어서 요청 대여섯 개가 동시에 들어오면 P99 지연이 튑니다.
- 팀·프로덕션 서빙에는 부적합합니다. 개인 개발 환경이나 단일 사용자 에이전트가 맞는 자리입니다.
- Ollama Cloud에 SLA가 없습니다. 2026년 4월에 실패율이 크게 치솟은 구간이 보고됐습니다. 업무 크리티컬 경로에 두면 곤란합니다.
설치
macOS
brew install ollama
또는 ollama.com에서 앱을 받습니다. 2026년에는 macOS·Windows용 공식 데스크톱 앱이 있어서 채팅 GUI로 파일·이미지를 끌어다 놓을 수 있습니다. 터미널을 안 쓰는 사람에게는 이쪽이 편합니다.
Linux
curl -fsSL https://ollama.com/install.sh | sh
설치 후 데몬이 자동으로 뜹니다. systemd 관리 명령은 다음과 같습니다.
systemctl status ollama
systemctl restart ollama
journalctl -u ollama -f # 로그 확인
Windows
ollama.com에서 설치 프로그램을 받아 실행합니다. 데몬이 부팅 시 자동 시작됩니다.
Docker
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
# NVIDIA GPU 사용
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
macOS에서는 컨테이너 안에서 GPU에 접근하지 못합니다. 맥이라면 네이티브 설치를 쓰세요. 이유는 macOS Docker에서 GPU 사용 가능한가? (410)에 정리해뒀습니다.
설치 확인
ollama --version
ollama list # 설치된 모델 목록
curl http://localhost:11434/api/tags # API 응답 확인
첫 실행
ollama run qwen3.6:27b
모델을 내려받고 >>> 프롬프트가 뜹니다. 그다음부터는 ChatGPT에 쓰듯 입력하면 됩니다.
대화 모드 단축키
| 입력 | 동작 |
|---|---|
/bye |
종료 |
/clear |
대화 기록 초기화 |
/set parameter temperature 0.3 |
파라미터 조정 |
/show info |
모델 정보 확인 |
/? |
전체 명령 목록 |
Ctrl + D |
종료 |
한 번만 물어보기
프롬프트에 들어가지 않고 바로 답만 받을 수 있습니다.
ollama run qwen3.6:27b "쿠버네티스 파드와 디플로이먼트 차이를 3줄로"
파이프도 됩니다.
cat error.log | ollama run qwen3.6:27b "이 로그에서 원인을 찾아줘"
한국어
2024년 초 기록에는 "영어만 지원한다"는 이야기가 남아 있는데, 지금은 사정이 다릅니다. Qwen 3.5/3.6, Gemma 4 같은 최신 모델은 한국어를 상당히 잘 다룹니다. 시스템 프롬프트로 한국어 응답을 명시하면 더 안정적입니다.
ollama run qwen3.6:27b "한국어로만 답변해. 파이썬 데코레이터를 설명해줘"
한국어 품질이 중요하다면 Modelfile로 시스템 프롬프트를 박아두는 편이 낫습니다. 방법은 Ollama에 Hugging Face GGUF 모델 등록·실행하기 (411)에 있습니다.

자주 쓰는 명령
ollama list # 설치된 모델
ollama ps # 현재 메모리에 올라간 모델
ollama pull qwen3.6:27b # 다운로드만
ollama rm llama3 # 삭제
ollama cp qwen3.6:27b my-model # 복제
ollama show qwen3.6:27b # 모델 정보
ollama serve # 데몬 수동 실행
ollama stop qwen3.6:27b # 메모리에서 내리기
모델이 어디 저장되나
| OS | 경로 |
|---|---|
| macOS | ~/.ollama/models |
| Linux | /usr/share/ollama/.ollama/models |
| Windows | C:\Users\<사용자>\.ollama\models |
디스크가 빠듯하면 OLLAMA_MODELS 환경변수로 옮길 수 있습니다.
export OLLAMA_MODELS=/Volumes/External/ollama-models
모델 하나가 수 GB에서 수십 GB입니다. 여러 개 받다 보면 금세 100GB를 넘깁니다. ollama list로 주기적으로 확인하고 안 쓰는 건 지우세요.
어떤 모델을 골라야 하나
Ollama 라이브러리에 수백 개 모델이 있습니다. 문제는 찾기가 아니라 고르기입니다.
먼저 VRAM을 계산하세요
Q4 양자화 기준 공식은 간단합니다.
필요 메모리 ≈ (파라미터 수 × 0.6~0.7GB) + 컨텍스트용 20~30%7B 모델이면 약 4GB, 13B면 약 8GB, 70B면 40GB 이상입니다. 맥의 통합 메모리도 같은 방식으로 계산합니다.
VRAM이 모자라면 Ollama가 레이어 일부를 시스템 RAM으로 내리는데(PCIe 경유), 이때 처리량이 급격히 떨어집니다. RTX 4090 24GB에서 Llama 3.1 70B를 돌린 사례에서 총 39.3GB가 필요했고 부분 오프로딩 때문에 속도가 크게 하락했습니다. 모델을 통째로 올릴 수 있는 크기를 고르는 게 첫 번째 원칙입니다.
메모리 구간별 추천 (2026년 7월)
| 메모리 | 추천 | 특징 |
|---|---|---|
| 8GB | gemma4:12b |
Gemma 4의 12B가 16GB RAM에서 돌도록 나왔습니다. 8GB에서는 Q4로 빠듯하게 가능 |
| 8GB (코딩) | mellum2:12b |
JetBrains 제작, LiveCodeBench 69.9 |
| 16GB | gpt-oss:20b ⭐ |
OpenAI 오픈웨이트. 21B 총 / 3.6B 활성 MoE, 추론 강도 조절 가능 |
| 24GB | qwen3.6:27b ⭐⭐ |
소비자 하드웨어 최강. SWE-bench 77.2%, LiveCodeBench 83.9 |
| 24~32GB (코딩) | qwen3-coder:30b |
30B MoE / 3.3B 활성, 256K 컨텍스트 |
| 24GB (에이전트) | devstral:24b |
SWE-bench Verified 46.8%, Apache 2.0 |
| 24GB (비전) | gemma4:31b |
비전 + 140개 이상 언어 |
| 64GB+ | deepseek-r1:70b, gpt-oss:120b |
워크스테이션 |
| 서버 | kimi-k2.6 |
오픈웨이트 최고점이지만 Q4에서 약 600GB 필요 |
용도별
| 용도 | 추천 |
|---|---|
| 종합 대화 | qwen3.6:27b / qwen3:30b |
| 코딩 완성 | qwen3-coder:30b |
| 에이전트 코딩 | devstral:24b, laguna-xs:2.1 |
| 추론 | deepseek-r1 (8B·14B·32B·70B 증류판) |
| 비전·멀티모달 | gemma4:e4b 이상 |
| 롱컨텍스트 | llama4:scout (10M 컨텍스트) |
| 임베딩 (RAG) | nomic-embed-text (274MB) |
| 무검열 | dolphin3.0 |
:latest를 믿지 마세요
Ollama에서 :latest는 "가장 좋은 태그"가 아니라 기본 태그를 가리키는 경우가 많습니다. qwen3:latest가 가장 강한 Qwen3가 아니고, gemma4:latest도 마찬가지입니다.
ollama run qwen3.6:27b # 이렇게 크기를 명시하세요
ollama run gemma4:31b
라이선스도 확인하세요
Apache 2.0(Qwen)과 MIT(GLM-5.1)는 상업적 사용이 자유롭습니다. Gemma는 자체 약관이 있고, 일부 모델은 연구용 제한 라이선스로 나옵니다. 회사에서 쓸 거라면 모델 페이지에서 라이선스를 먼저 보세요.
Apple Silicon — MLX 가속
맥 사용자에게 2026년 가장 큰 변화입니다.
무슨 일이 있었나
Ollama가 Apple의 머신러닝 프레임워크 MLX 위에서 동작하도록 바뀌었습니다. MLX는 M 시리즈 칩의 통합 메모리 구조에 맞춰 만들어진 프레임워크라 기존 Metal 백엔드보다 효율이 좋습니다.
측정된 변화는 이렇습니다.
- M3/M4에서 7B 모델 기준 순수 llama.cpp 대비 약 2배 처리량
- Ollama 0.31에서 Gemma 4가 MTP(multi-token prediction)로 Apple Silicon에서 최대 90% 빨라짐 (Aider polyglot 벤치마크, 코딩 에이전트 사용 시)
- M5·M5 Pro·M5 Max의 GPU Neural Accelerator를 활용해 TTFT와 생성 속도 모두 개선
Ollama가 Qwen3.5-35B-A3B로 2026년 3월 29일 진행한 테스트에서 0.19 기준 프리필 1851 tok/s, 디코드 134 tok/s(int4 양자화)를 보고했습니다.
설정할 게 있나
없습니다. 최신 Ollama를 설치하면 Apple Silicon에서 MLX 엔진이 알아서 붙습니다.
brew upgrade ollama
ollama run qwen3.6:27b
MLX 러너는 메인 서버와 HTTP로 통신하는 별도 서브프로세스로 동작합니다. 모든 모델이 MLX 경로를 타는 건 아니고, 커버리지가 릴리스마다 넓어지고 있습니다. MLX가 지원하지 않는 모델은 기존 llama.cpp/Metal 백엔드로 떨어집니다.
맥에서 권장하는 조합
| 맥 사양 | 권장 모델 |
|---|---|
| M1/M2 16GB | gpt-oss:20b |
| M2/M3 24~32GB | qwen3.6:27b |
| M3/M4 Max 64GB | deepseek-r1:70b, gpt-oss:120b |
| Mac Studio 128GB+ | 대형 MoE 모델 |
통합 메모리라 시스템 메모리 전체가 GPU 메모리이기도 합니다. 모델을 돌릴 때 Chrome 탭 50개와 Slack이 떠 있으면 그만큼 손해입니다.
클라우드 모델 — 로컬에 안 들어가는 모델 쓰기
내 GPU에 안 들어가는 모델을 Ollama 인프라에서 돌립니다. CLI도 API도 로컬과 완전히 동일합니다.
사용법
ollama signin # 최초 1회 인증
ollama run gpt-oss:120b-cloud
모델명 끝에 -cloud를 붙이는 게 전부입니다. ls·pull·cp 모두 로컬 모델처럼 동작합니다.
% ollama ls
NAME ID SIZE MODIFIED
gpt-oss:120b-cloud 569662207105 - 5 seconds ago
qwen3-coder:480b-cloud 11483b8f8765 - 2 days ago
deepseek-v3.1:671-cloud d3749919e45f - 2 days ago크기가 -로 표시되는 게 클라우드 모델입니다. 로컬 디스크를 쓰지 않습니다.
코드에서
import ollama
response = ollama.chat(
model='gpt-oss:120b-cloud',
messages=[{'role': 'user', 'content': '왜 하늘은 파란가요?'}],
)
print(response['message']['content'])
curl https://ollama.com/api/chat \
-H "Authorization: Bearer $OLLAMA_API_KEY" \
-d '{
"model": "gpt-oss:120b",
"messages": [{"role": "user", "content": "왜 하늘은 파란가요?"}],
"stream": false
}'
요금 (2026년 7월 기준)
| 플랜 | 가격 | 동시 클라우드 모델 |
|---|---|---|
| Free | $0 | 1개, 가벼운 사용 |
| Pro | 월 $20 | 3개, Free 대비 50배 사용량 |
| Max | 월 $100 | 10개, Pro 대비 5배 |
로컬 모델은 항상 무제한입니다. 플랜은 클라우드 사용량만 제한합니다.
과금은 토큰이 아니라 GPU 시간 기준입니다. 모델 크기와 요청 지속 시간에 따라 달라집니다.
쓰기 전에 알아야 할 것
- SLA가 없습니다. 서비스는 "as is"로 제공되고 가동률 보장이 없습니다. 2026년 4월에 실패율이 크게 치솟은 구간이 보고됐습니다.
- 모델이 은퇴합니다. 더 나은 오픈소스 모델이 나오면 오래된 클라우드 모델을 폐기합니다. 사전 공지는 이메일과 웹사이트로 옵니다. 로컬 모델은 영향받지 않습니다.
- 데이터는 보관하지 않습니다. 프롬프트와 응답을 로깅하거나 학습에 쓰지 않고, 호스팅 파트너에게도 무보존 정책을 요구한다고 밝히고 있습니다.
완전 로컬로만 쓰고 싶다면
클라우드 기능을 꺼서 로컬 전용 모드로 실행할 수 있습니다. 폐쇄망이나 규제 환경이라면 이 설정을 확인하세요.
실무 패턴
클라우드로 프로토타이핑하고 로컬로 배포하는 흐름이 자연스럽습니다.
# 개발: 큰 모델로 품질 확인
ollama run qwen3-coder:480b-cloud
# 배포: -cloud 떼고 작은 로컬 모델로
ollama run qwen3-coder:30b
코드 변경이 없습니다.
웹 검색 API — 모델에 최신 정보 물리기
로컬 모델의 가장 큰 한계는 학습 시점 이후를 모른다는 점입니다. Ollama가 이 문제를 자체 검색 API로 풉니다.
엔드포인트
| API | 용도 |
|---|---|
POST https://ollama.com/api/web_search |
검색 결과 (제목·URL·스니펫), 기본 최대 10건 |
POST https://ollama.com/api/web_fetch |
특정 URL 본문 가져오기 |
둘 다 Ollama 계정의 API 키가 필요합니다. 개인 사용자를 위한 무료 구간이 있습니다.
curl
curl https://ollama.com/api/web_search \
-H "Authorization: Bearer $OLLAMA_API_KEY" \
-d '{"query": "Ollama 최신 버전", "max_results": 5}'
Python
from ollama import Ollama
client = Ollama()
results = client.webSearch("2026년 파이썬 패키지 관리자 동향")
MCP 서버로도 씁니다
Ollama가 웹 검색 MCP 서버를 함께 제공합니다. Claude Code나 다른 MCP 클라이언트에 붙이면 도구로 노출됩니다.
흔한 함정 — DuckDuckGo 무료 API
인터넷에 돌아다니는 Ollama 웹 검색 튜토리얼 상당수가 DuckDuckGo 무료 API를 씁니다. 동작하지 않습니다. 해당 엔드포인트는 개발 상태의 테스트용이고 오프라인으로 표시돼 있어 거의 모든 쿼리에서 빈 결과를 돌려줍니다.
Ollama 공식 API를 쓰거나, 자체 호스팅이 필요하면 SearXNG를 세우세요. 프라이버시 우선이나 오프라인 배포라면 SearXNG 쪽이 낫습니다.
또 하나 — 타임아웃
검색을 붙이면 모델이 생각하고, 검색하고, 생성하는 데 시간이 걸립니다. 60초 타임아웃으로는 부족합니다. 스트리밍을 켜서 출력이 오는 대로 받으세요.
with requests.post(OLLAMA_API, json=payload, stream=True) as response:
for line in response.iter_lines():
...
코딩 에이전트 연동 — ollama launch
2026년 6월에 들어온 명령입니다. 환경변수도 설정 파일도 없이 코딩 도구를 로컬 모델로 띄웁니다.
ollama launch claude --model qwen3.6:27b
ollama launch codex --model gpt-oss:20b
ollama launch opencode --model qwen3-coder:30b
ollama launch openclaw --model qwen3.6:27b
모델이 없으면 알아서 내려받고, 필요한 설정을 잡고, 도구를 실행합니다.
지원 대상은 Claude Code, Codex, Copilot CLI, Droid, OpenCode, OpenClaw입니다.
왜 되나 — API 호환성
Ollama가 두 가지 API 스펙을 모두 흉내 냅니다.
| 호환 | 용도 |
|---|---|
| OpenAI Chat Completions | Codex CLI, LangChain, LlamaIndex 등 대부분의 도구 |
| Anthropic Messages | Claude Code |
즉 Claude Code를 열어놓고 백엔드만 로컬 Qwen으로 바꿔 쓸 수 있습니다. 토큰 요금이 0원이 됩니다.
Claude Code에서 서브에이전트와 웹 검색도 Ollama를 통해 동작합니다.
직접 붙일 때
OpenAI 호환 엔드포인트를 그대로 씁니다.
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama", # 아무 값이나
)
response = client.chat.completions.create(
model="qwen3.6:27b",
messages=[{"role": "user", "content": "안녕"}],
)
기존 OpenAI SDK 코드에서 base_url 한 줄만 바꾸면 됩니다.
이미지 생성 (macOS)
2026년 1월에 추가됐습니다. 현재 macOS 전용이고 Windows·Linux는 예정입니다.
ollama run x/z-image-turbo "우주 헬멧을 쓴 시바견"
ollama run x/flux2-klein "네온 사이버펑크 도시 풍경"
0.16.0과 0.16.1에 버그가 있었고 0.16.2에서 고쳐졌습니다. 최신 버전을 쓰세요.
Modelfile — 모델 커스터마이징
시스템 프롬프트, 온도, stop 토큰을 박아둔 나만의 모델을 만들 수 있습니다.
FROM qwen3.6:27b
PARAMETER temperature 0.3
PARAMETER num_ctx 8192
SYSTEM """
너는 한국어로만 답하는 시니어 백엔드 개발자다.
코드 예시를 먼저 보여주고 설명은 뒤에 짧게 붙인다.
확실하지 않으면 모른다고 말한다.
"""
ollama create my-korean-dev -f Modelfile
ollama run my-korean-dev
Hugging Face에서 받은 GGUF 파일을 등록하는 방법은 별도 글로 정리해뒀습니다.
→ Ollama에 Hugging Face GGUF 모델 등록·실행하기 (411)
성능 튜닝
환경변수
export OLLAMA_HOST=0.0.0.0:11434 # 외부 접근 허용 (주의)
export OLLAMA_MODELS=/path/to/models # 모델 저장 위치
export OLLAMA_KEEP_ALIVE=30m # 모델을 메모리에 유지할 시간
export OLLAMA_NUM_PARALLEL=2 # 동시 요청 수
export OLLAMA_MAX_LOADED_MODELS=2 # 동시 로드 모델 수
export OLLAMA_FLASH_ATTENTION=1 # Flash Attention
OLLAMA_KEEP_ALIVE가 체감 차이가 큽니다. 기본값은 5분인데, 자주 쓴다면 늘려두면 매번 로딩을 기다리지 않아도 됩니다. 반대로 메모리가 빠듯하면 0으로 줄이세요.
KV 캐시 양자화
Ollama 0.17부터 8비트 KV 캐시 양자화를 지원합니다. 이전 토큰의 키-값 쌍을 저장하는 캐시가 절반 크기로 압축되고 품질 손실은 크지 않습니다. 대화가 길어질수록 VRAM을 먹는 게 이 캐시라 효과가 큽니다.
컨텍스트 길이
ollama run qwen3.6:27b
>>> /set parameter num_ctx 16384
컨텍스트를 늘리면 VRAM도 함께 늘어납니다. 무작정 키우지 말고 실제로 필요한 만큼만 잡으세요.
자주 발생하는 문제
모델이 너무 느립니다
VRAM에 모델이 다 안 올라갔을 가능성이 큽니다. ollama ps로 확인하세요. 100% GPU가 아니라 60% GPU / 40% CPU 식으로 나오면 부분 오프로딩 상태입니다. 더 작은 모델이나 더 낮은 양자화를 고르세요.
Error: model requires more system memory
말 그대로 메모리 부족입니다. Q4보다 낮은 양자화를 쓰거나 파라미터가 작은 모델로 내려가세요.
응답이 중간에 끊깁니다num_predict 기본값에 걸린 경우입니다. /set parameter num_predict 4096으로 늘려보세요.
한국어 응답이 이상합니다
모델을 바꾸는 게 가장 빠릅니다. Qwen 3.5/3.6, Gemma 4가 한국어에 강합니다. 그다음 시스템 프롬프트로 "한국어로만 답변"을 명시하세요.
qwen3 계열이 자꾸 장황하게 생각합니다
qwen3는 확장 추론 모드가 기본으로 켜져 있습니다. 짧고 빠른 답이 필요하면 프롬프트에 /no_think를 붙이거나 다른 모델을 쓰세요.
외부에서 접속이 안 됩니다
Ollama는 기본적으로 127.0.0.1만 듣습니다. OLLAMA_HOST=0.0.0.0:11434로 열어야 하는데, 인증이 없으므로 반드시 방화벽이나 리버스 프록시를 앞에 두세요.
여러 사람이 쓰니 느려집니다
Ollama의 한계입니다. 스케줄러가 단순해서 PagedAttention이나 연속 배칭이 없습니다. 요청 대여섯 개가 동시에 들어오면 P99 지연이 급등합니다. 팀 서빙이나 프로덕션은 vLLM으로 가세요.
디스크가 꽉 찼습니다
ollama list # 뭐가 있는지 확인
ollama rm <안 쓰는 모델>
du -sh ~/.ollama/models # 총량 확인
클라우드 모델이 사라졌습니다
Ollama가 오래된 클라우드 모델을 주기적으로 은퇴시킵니다. 사전 공지가 이메일로 오지만 놓치기 쉽습니다. 자동화 스크립트에 클라우드 모델을 쓰고 있다면 정기 점검이 필요합니다.
자주 묻는 질문 (FAQ)
Q. 2026년 Ollama에서 가장 추천하는 모델은?
소비자 하드웨어 기준 qwen3.6:27b입니다. SWE-bench Verified 77.2%로 24GB GPU나 32GB 맥에 Q4로 들어갑니다. 16GB라면 gpt-oss:20b, 8GB라면 gemma4:12b가 현실적입니다.
Q. 내 컴퓨터에서 몇 B 모델까지 돌아가나요?
Q4 기준 파라미터 10억당 약 0.60.7GB에 컨텍스트용 2030%를 더하면 됩니다. 8GB는 712B, 16GB는 1420B, 24GB는 27~31B가 적정선입니다. 맥의 통합 메모리도 같은 계산입니다.
Q. GPU가 없어도 되나요?
CPU로도 돌아가지만 매우 느립니다. 3B 이하 소형 모델로 제한하는 게 현실적입니다. 큰 모델을 쓰고 싶다면 클라우드 모델(-cloud)이 대안입니다.
Q. Ollama 클라우드 모델은 무료인가요?
Free 플랜에 클라우드 모델 1개를 가벼운 사용량으로 쓸 수 있습니다. Pro가 월 $20(3개), Max가 월 $100(10개)입니다. 로컬 모델은 어느 플랜에서든 무제한입니다. 과금은 토큰이 아니라 GPU 시간 기준입니다.
Q. 프로덕션에 Ollama를 써도 되나요?
개인 개발 환경이나 단일 사용자 에이전트라면 좋습니다. 다중 사용자 서빙에는 부적합합니다. vLLM이 같은 하드웨어에서 약 2.6배 처리량을 내고, 동시성으로 가면 격차가 훨씬 큽니다. Ollama Cloud에는 SLA도 없습니다.
Q. Apple Silicon에서 MLX 가속을 켜려면 뭘 해야 하나요?
아무것도 안 해도 됩니다. 최신 Ollama를 설치하면 자동으로 붙습니다. Ollama 0.31에서 Gemma 4가 MTP로 Apple Silicon에서 최대 90% 빨라진 사례가 보고됐습니다.
Q. Ollama와 LM Studio 중 뭐가 낫나요?
CLI와 API 중심이면 Ollama, GUI가 편하면 LM Studio입니다. 다만 Ollama도 2026년에 macOS·Windows용 데스크톱 앱을 내놔서 격차가 줄었습니다. 코딩 에이전트 연동은 Ollama가 앞섭니다.
Q. Claude Code를 로컬 모델로 쓸 수 있나요?
가능합니다. Ollama가 Anthropic Messages API와 호환되고, ollama launch claude --model qwen3.6:27b 한 줄로 설정됩니다. 서브에이전트와 웹 검색도 동작합니다.
Q. 웹 검색은 어떻게 붙이나요?
Ollama 공식 웹 검색 API를 쓰세요. https://ollama.com/api/web_search에 POST하면 제목·URL·스니펫이 최대 10건 옵니다. API 키가 필요하고 개인용 무료 구간이 있습니다. 인터넷 튜토리얼에 자주 나오는 DuckDuckGo 무료 API는 빈 결과만 돌려주니 쓰지 마세요.
Q. :latest 태그를 써도 되나요?
권장하지 않습니다. Ollama에서 :latest는 가장 좋은 태그가 아니라 기본 태그를 가리킬 때가 많습니다. qwen3.6:27b처럼 크기를 명시하세요.
Q. 회사 코드로 써도 되나요?
로컬 실행이면 데이터가 기기를 벗어나지 않으니 프라이버시 측면에서는 안전합니다. 모델 라이선스는 별개로 확인하세요. Qwen은 Apache 2.0, GLM-5.1은 MIT라 상업적 사용이 자유롭지만 일부 모델은 제한 라이선스입니다.
Q. 한국어를 잘하는 모델은?
Qwen 3.5/3.6과 Gemma 4가 한국어에 강한 편입니다. 시스템 프롬프트로 한국어를 명시하면 더 안정적입니다. 한국어 특화 모델은 Hugging Face의 GGUF를 직접 등록해서 씁니다.
이 글의 핵심 메트릭
- Ollama 최신 버전: v0.32.0 (2026-07-11)
- VRAM 공식: Q4 기준 파라미터 10억당 0.6
0.7GB + 컨텍스트 2030% - 소비자 최강 모델: Qwen 3.6 27B (SWE-bench 77.2%, 24GB Q4)
- 16GB 최적: gpt-oss:20b (21B 총 / 3.6B 활성 MoE)
- MLX 효과: M3/M4 7B 기준 llama.cpp 대비 약 2배, Gemma 4는 최대 90% 개선
- 클라우드 요금: Free / Pro $20 / Max $100 (GPU 시간 과금)
- 동시성 한계: vLLM 대비 약 2.6배 처리량 열세, 요청 5~6개부터 P99 급등
- 검증 환경: macOS Sequoia 15.x / Apple Silicon M2 Pro
로컬 LLM 시리즈
📚 chan7ee 로컬 AI 개발 환경 (2026)
- Ollama 완벽 가이드 ← 현재 글 (시작점)
- Ollama에 Hugging Face GGUF 모델 등록·실행하기 (411) — 커스텀 모델, Modelfile
- macOS Docker에서 GPU 사용 가능한가? (410) — Apple Silicon GPU와 컨테이너
- Colima 사용법 완벽 가이드 (415) — Docker Desktop 대안
- LLM 위키 만들기 완벽 가이드 (418) — 로컬 AI로 지식 관리
- False Positive와 False Negative 차이 (396) — 모델 평가 기초
공식 문서는 docs.ollama.com, 모델 목록은 ollama.com/library에 있습니다.
'머신러닝' 카테고리의 다른 글
| False Positive와 False Negative 차이 완벽 정리 (2026) — Confusion Matrix·Precision·Recall·F1 Score까지 (0) | 2026.05.20 |
|---|---|
| [issue] tensorflow, keras, transformer 버전 문제 (0) | 2024.03.29 |
| ensemble - 모델의 조합 (0) | 2020.08.13 |
| Voting / Equation - 보팅/평균화 (0) | 2020.08.11 |
| Blending - 블렌딩 (0) | 2020.08.10 |
댓글