이 글에는 제휴(어필리에이트) 링크가 포함되어 있으며, 이를 통해 일정액의 수수료를 제공받을 수 있습니다.
매달 LLM API 비용으로 수십 달러씩 결제하고 계신가요? 혹은 보안이 중요한 프로젝트인데 코드를 클라우드로 보내기 망설여지시나요? 그렇다면 정답은 로컬 LLM입니다. 내 컴퓨터 사양만 충분하다면 Ollama를 통해 Kimi K3, Llama 3 같은 최신 모델을 완전 무료로 돌릴 수 있습니다.
설치 5분 만에 내 PC를 AI 서버로 만들고, Claude Code 같은 전문 도구와 연결하는 방법을 정리했습니다.
전체 내용은 카드뉴스로도 정리했다 (인스타 캐러셀용).
Ollama가 무엇인가요?
Ollama는 복잡한 LLM 설치 과정을 명령어 한 줄로 줄여준 오픈소스 툴입니다. 과거에는 로컬에서 AI를 돌리려면 수많은 라이브러리와 충돌을 견뎌야 했지만, 이제는 ollama run 한 번이면 모델 다운로드부터 실행까지 끝납니다. GitHub 10만 스타가 증명하듯 현재 가장 대중적인 로컬 AI 실행 도구입니다.
이런 소식, 남들보다 먼저 받으실 분?
직접 돌려보고 되는 것만 골라 매주 보내드립니다. 광고성 하이프는 거릅니다.
어떤 모델을 골라야 하나? (내 사양에 맞는 추천)
로컬 AI 성능은 결국 내 PC의 RAM(메모리)에 달려 있습니다. 모델 크기에 따라 필요한 메모리가 다르니 아래 표를 참고해 보세요.
| 내 PC RAM | 추천 모델 | 특징 |
|---|---|---|
| 8GB | Phi-3 mini, Gemma 2B | 매우 빠름, 가벼운 채팅/요약용 |
| 16GB | Llama 3.1 8B, Mistral | 가장 무난한 범용·코딩 모델 |
| 32GB+ | Kimi K3 (양자화), Llama 70B | 전문가급 코딩 및 복잡한 추론 |
GPU(NVIDIA RTX 등)나 Apple Silicon(M1~M4) 칩이 있다면 훨씬 빠른 속도로 응답을 받을 수 있습니다.
Claude Code와 연결하기
단순 채팅을 넘어 전문적인 코딩 에이전트를 무료로 쓰고 싶다면 Claude Code와 Ollama를 연결하세요. Anthropic의 Messages API와 호환되기 때문에 환경변수 3줄만 설정하면 됩니다.
export ANTHROPIC_BASE_URL=http://localhost:11434
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
claude --model kimi-k3
이제 Claude Code가 Anthropic 서버 대신 내 PC의 Ollama 서버에 요청을 보냅니다. 토큰 비용 걱정 없이 무제한으로 코드를 작성하고 수정할 수 있습니다.
바이브코딩으로 만든 앱, 테스트는 어떻게?
로컬 모델은 비용이 들지 않기 때문에 무한한 반복 테스트와 디버깅에 최적입니다. 특히 처음 코딩을 배우거나 AI 에이전트를 실험해볼 때 부담 없이 사용할 수 있죠.
바이브코딩을 더 체계적으로 배우고 싶다면, 조태호 저 혼자 공부하는 바이브 코딩 with 클로드 코드 (한빛미디어)가 실용적인 출발점이에요. Claude Code 기반으로 실제 앱을 만들어가는 과정을 기초부터 차근차근 다룹니다.
1인 개발자 관점에서
현실적으로 로컬 모델이 Claude Opus나 GPT-4o만큼 똑똑하지는 않습니다. 하지만 단순한 코드 리팩토링, 단위 테스트 작성, 지루한 문서화 작업에는 로컬 모델로도 충분합니다. 비싼 클라우드 AI는 '어려운 기획과 아키텍처'에만 쓰고, '반복적인 구현'은 내 PC에서 돌리는 믹스 매치 전략이 지갑을 지키는 가장 똑똑한 방법입니다.
출처: Ollama 공식 사이트(ollama.com), Ollama GitHub(github.com/ollama/ollama)