내 PC에서 AI를 무료로 돌리는 방법을 찾아보면 하나같이 RTX 4090이나 맥북 M4 Max 기준입니다. 정작 궁금한 건 이거였어요 — 그래픽카드가 없는 평범한 사무용 PC에서도 되나? 된다면 몇 초 걸리나?
그래서 2017년에 나온 i3에 직접 깔고, 모델 네 개를 같은 질문으로 돌려 쟀습니다. 설치 화면과 사양별(RAM·VRAM·맥) 추천 모델까지 아래에 다 넣었습니다. 결과가 예상과 달랐습니다 — 가장 용량이 큰 모델이 가장 빨랐고, 답도 제일 정확했습니다.
- 2B는 못 씁니다. 한국어에 중국어 한자가 섞여 나옵니다.
- 4B는 문장은 되는데 상식이 틀립니다. 찌개를 끓이는데 불판이 등장해요.
- 9B는 맞는 말을 하지만 답 하나에 40초가 걸립니다.
- 그런데 7.2GB짜리 gemma4:e2b가 18.5초 만에, 가장 정확하게 답했습니다. 더 큰데 3.4배 빠릅니다.
그리고 모델과 무관하게 함정이 하나 따로 있었습니다. 이걸 모르면 같은 질문에 8분을 기다리게 됩니다.
테스트한 기계 (숨길 것 없이)
CPU Intel Core i3-8100 @ 3.60GHz (4코어, 2017년)
RAM 23.9 GB
GPU Intel UHD 630 내장 · 전용 VRAM 1GB ← 그래픽카드 없음
OS Windows 11
설치 winget install Ollama.Ollama (v0.33.0)
2017년 보급형 CPU에 내장 그래픽입니다. 사무실에서 문서 작업하는 PC와 비슷하거나 그보다 낮습니다.
질문은 이 한 줄로 고정했습니다. 그대로 복사해서 확인해 보셔도 됩니다.
김치찌개를 맛있게 끓이는 핵심 세 가지만 알려줘. 각각 한 문장으로.
일부러 한국 사람이면 다 아는 것을 골랐습니다. 번역투로 얼버무리면 바로 티가 나거든요.
함정 하나 — 이걸 모르면 8분을 기다립니다
처음 돌렸을 때 7분 51초가 걸렸습니다. 김치찌개 세 줄 물어봤는데요.
이유는 속도가 아니었습니다. 생성 속도는 초당 8.72토큰으로 정상이었는데, 토큰을 4,066개나 뱉었습니다. 요청한 건 세 문장인데요.
최신 모델 상당수가 추론(thinking) 모델이라 답하기 전에 혼자 고민하는 과정을 통째로 출력합니다. 그것도 영어로 이런 식이에요.
Okay, I will stick to the 3 points of Aromatics, Heat/Simmering, and Balance.
(Too specific on saute.) Let's try to generalize: -> Too weak.
이 과정을 끄니 7분 51초가 9.46초가 됐습니다. 50배입니다. 속도는 그대로고 뱉는 양만 91토큰으로 줄었습니다.
끄는 법 — 대화창에서는 /set nothink, API로 부를 때는 요청에 "think": false를 넣습니다. 그래픽카드가 없다면 이건 선택이 아니라 필수입니다.
크기별로 실제로 이렇게 나옵니다
2B — 중국어가 섞입니다
채소를 넣고 바로 삶지 말고 수분기를 이용해 천천히 물기를沥쳐…
김이 살짝 올랐고 면발이 생기면 바로 비빔밥이나 소스까지 넣어…
沥는 중국어 한자입니다. 김치찌개에 면발과 비빔밥도 등장하고요. 빠르지만(9.5초) 믿고 쓸 수가 없습니다.
4B — 한국어는 되는데 한국을 모릅니다
양파와 배를 미리 굽어 단맛을 내어…
불판에 두툼하게 올린 돼지고기나 생선을 팬에서 기름을 뺀 뒤…
한자는 사라졌고 문법도 정상입니다. 그런데 찌개인데 불판이 나옵니다. 한국어를 쓸 줄 아는 것과 한국 사정을 아는 건 다른 문제더군요.
9B — 여기서 선을 넘습니다
채소를 다 자른 뒤 무를 조금 더 작게 다져서 김치의 아삭한 식감을 살려야 합니다.
마지막에 참기름 한 두 방울과 쪽파, 통깨를 뿌려 은은한 향을 더해야 완성도가 높아집니다.
세 번째 문장은 그대로 따라 해도 되는 조언입니다. 나머지도 틀린 말이 없고요. 4B와 9B 사이엔 "조금 나아짐"이 아니라 "쓸 수 있느냐"의 선이 있습니다.
여기까지가 예상했던 결과였습니다. 크면 똑똑하고 느리다. 그런데 계열을 하나 더 넣어보니 이 전제가 깨졌습니다.
gemma4:e2b — 더 큰데 3.4배 빠릅니다
1. 잘 익은 김치를 사용하세요: 신맛이 적절히 배어 깊은 맛을 냅니다.
2. 고기를 먼저 볶아 깊은 맛을 내세요: 고기와 김치를 함께 볶으면 감칠맛이 극대화됩니다.
3. 육수를 충분히 우려내고 간을 맞추세요: 맹물 대신 멸치나 사골 육수를 사용하고…
네 개 중 가장 정확합니다. 잘 익은 김치, 고기 먼저 볶기, 멸치·사골 육수 — 한국 사람이 실제로 하는 말이에요. 서식까지 깔끔하게 정리해서 내놓습니다.
그런데 놀라운 건 속도입니다. 용량은 7.2GB로 9B(6.6GB)보다 큰데, 18.5초 만에 끝났습니다. 초당 12.30토큰 — 9B의 3.4배이고, 제일 작은 2B보다도 빠릅니다.
왜 더 큰데 빠른가 — 요즘 모델은 안에 여러 전문가를 두고 질문마다 일부만 깨우는 구조(MoE)를 씁니다. 메모리에는 전부 올려야 해서 용량은 크지만, 실제 계산은 일부만 하니 CPU에서 훨씬 빠릅니다. 그래픽카드가 없을수록 이 차이가 크게 벌어집니다.
그래서 저사양에서 진짜 기준은 이겁니다. 내려받는 용량(GB)이 아니라, 한 번 답할 때 실제로 계산하는 양입니다. 용량만 보고 "작은 걸 깔아야지" 하면 오히려 느리고 부정확한 걸 고르게 됩니다.
이런 실측, 매주 보내드립니다.
직접 돌려보고 되는 것만 골라 정리합니다. 광고성 하이프는 거릅니다.
대가는 속도입니다
| 모델 | 용량 | 답 하나 | 생성 속도 | 한국어 |
|---|---|---|---|---|
| qwen3.5:2b | 2.7GB | 9.5초 | 9.82 tok/s | ✕ 한자 혼입 |
| qwen3.5:4b | 3.4GB | 26초 | 6.10 tok/s | △ 상식 오류 |
| qwen3.5:9b | 6.6GB | 40초 | 3.65 tok/s | ✓ 쓸 만함 |
| gemma4:e2b | 7.2GB | 18.5초 | 12.30 tok/s | ★ 가장 정확 |
같은 qwen 계열 안에서는 예상대로입니다 — 클수록 똑똑하고 느립니다(9B는 2B의 37% 속도). 그런데 계열을 바꾸면 그 규칙이 통하지 않습니다. gemma4:e2b는 제일 무겁고 제일 빠릅니다.
참고로 표의 시간에는 모델을 메모리에 올리는 시간(9B는 9.4초, gemma4는 8.2초)이 포함돼 있습니다. 연달아 물어보면 그만큼 빨라져요.
그럼 내 사양엔 뭘 깔아야 하나
먼저 내 사양부터 — 30초면 됩니다
세 가지만 알면 됩니다. 전용 그래픽카드가 있는지, 있다면 VRAM이 몇 GB인지, 없다면 RAM이 몇 GB인지.
# 그래픽카드 이름과 VRAM (엔비디아면 이게 제일 정확합니다)
nvidia-smi
# nvidia-smi 가 "명령을 찾을 수 없다"면 = 엔비디아 그래픽카드가 없습니다
# 그때는 이걸로 확인하세요
wmic path win32_VideoController get name,AdapterRAM
wmic ComputerSystem get TotalPhysicalMemory
# 칩과 통합 메모리 — 맥은 RAM과 VRAM을 같이 씁니다
system_profiler SPHardwareDataType | grep -E "Chip|Memory"
더 쉬운 길도 있습니다. 윈도우는 작업 관리자 → 성능 → GPU에서 "전용 GPU 메모리"를 보면 되고, 맥은 왼쪽 위 사과 → 이 Mac에 관하여에 다 나옵니다.
"전용 GPU 메모리 1GB"는 그래픽카드가 있는 게 아닙니다. CPU에 딸린 내장 그래픽이 시스템 메모리를 조금 떼어 쓰는 겁니다. 저희 테스트 기계가 정확히 그 상태(Intel UHD 630 · 1GB)였고, 아래 표에서는 "그래픽카드 없음"으로 봐야 합니다.
용량 계산 — 내려받는 크기가 전부가 아닙니다
아래 표의 용량은 내려받는 크기입니다. 실제로 돌릴 때는 여기에 대화 내용을 담아두는 메모리(KV 캐시)가 더 붙습니다.
| 항목 | 얼마나 |
|---|---|
| 모델 파일 | 표에 적힌 크기 |
| KV 캐시 (기본 컨텍스트) | +2~6GB |
| 운영체제·브라우저 등 | +3~4GB |
| 그래서 실제 여유 | 모델 크기 × 약 1.5배 + 4GB |
예를 들어 gemma4:e2b(7.2GB)를 편하게 쓰려면 메모리 16GB는 있어야 합니다. 8GB에서도 돌긴 하지만 다른 프로그램을 다 닫아야 하고, 컨텍스트를 길게 잡으면 디스크로 밀려나 급격히 느려집니다.
① 그래픽카드가 없다면 (RAM 기준)
이 표만 저희가 직접 쟀습니다. 아래 ②③은 공식 크기 기준의 권장이고, 속도는 재지 않았습니다.
| RAM | 추천 | 용량 | 기대치 |
|---|---|---|---|
| 8GB | qwen3.5:4b | 3.4GB | 26초. 문장은 되는데 사실 확인 필수 |
| 8GB (더 가볍게) | qwen3.5:2b | 2.7GB | 9.5초. 한국어는 권하지 않습니다 — 한자가 섞입니다 |
| 16GB | gemma4:e2b | 7.2GB | 18.5초 · 우리 1순위. thinking도 안 뱉습니다 |
| 24GB | gemma4:e2b gemma4:12b | 7.2GB 7.6GB | 12b는 컨텍스트가 256K로 두 배 |
| 32GB+ | gpt-oss:20b | 14GB | 공식 권장이 메모리 16GB. CPU만으로는 느립니다 |
GPU가 없을 때 27B·30B급은 권하지 않습니다. 메모리가 남아도 CPU가 못 따라갑니다. 저희 기계에서 6.6GB짜리 9B가 답 하나에 40초였는데, 그보다 세 배 무거운 모델이면 산술적으로 분 단위입니다. 넣을 수 있는 것과 쓸 만한 것은 다릅니다.
② 그래픽카드가 있다면 (VRAM 기준)
기준은 하나입니다 — 모델이 VRAM에 통째로 들어가야 제 속도가 납니다. 반만 올라가면 나머지는 CPU가 처리해서 없느니만 못한 속도가 나옵니다.
| VRAM | 대표 카드 | 추천 | 용량 |
|---|---|---|---|
| 6GB | RTX 3060 노트북 · 2060 | qwen3.5:4b | 3.4GB |
| 8GB | RTX 4060 · 3070 | qwen3.5:9b gemma4:e2b | 6.6GB 7.2GB |
| 12GB | RTX 4070 · 3060 12GB | gemma4:12b | 7.6GB |
| 16GB | RTX 4080 · 4060 Ti 16GB | gpt-oss:20b | 14GB |
| 24GB | RTX 4090 · 3090 | qwen3.5:27b qwen3-coder:30b | 17GB 19GB |
| 32GB+ | RTX 5090 등 | gemma4:31b qwen3.5:35b | 20GB 24GB |
③ 맥이라면 (통합 메모리 기준)
맥은 RAM과 VRAM이 하나라 계산이 단순합니다. 대신 전체 메모리의 약 70%까지만 GPU가 쓸 수 있다고 보면 안전합니다.
| 통합 메모리 | 추천 | 용량 |
|---|---|---|
| 8GB | qwen3.5:4b-mlx | 3.4GB |
| 16GB | qwen3.5:9b-mlx | 8.9GB |
| 24GB | gemma4:12b-mlx | 7.7GB |
| 32GB | gpt-oss:20b | 14GB |
| 64GB+ | qwen3.5:35b | 24GB |
맥이면 -mlx 태그를 쓰세요. qwen3.5:9b가 아니라 qwen3.5:9b-mlx처럼 애플 실리콘에 맞춰 나온 버전이 따로 있습니다. 모르고 일반 태그를 쓰는 분이 많습니다. gemma4에도 있습니다.
④ 하려는 일로 고른다면
| 하려는 일 | 추천 | 왜 |
|---|---|---|
| 한국어 대화·요약 | gemma4:e2b | 같은 질문에서 한국어가 가장 정확했습니다 |
| 코딩 | qwen3-coder:30b | 30B 중 3.3B만 계산합니다. 컨텍스트 256K |
| 긴 문서 | gemma4:12b 이상 | 컨텍스트가 256K로 e2b(128K)의 두 배 |
| 이미지·음성까지 | gemma4:e2b / 31b | e2b는 소리도 읽습니다 |
| 일단 되는지만 확인 | qwen3.5:2b | 2.7GB. 단, 한국어 품질은 기대하지 마세요 |
용량 숫자는 전부 ollama.com 공식 페이지에서 확인한 값입니다(2026년 8월 27일 기준). 다만 속도는 우리 기계에서 잰 것이고, 다른 사양의 속도는 우리가 재지 않았습니다. ②③④는 크기와 공식 권장에 기반한 추천이지 실측이 아닙니다.
설치 — 화면 그대로 따라오세요
급하면 세 줄입니다. 아래에 화면과 함께 풀어 뒀으니 처음이면 그쪽을 보세요.
winget install Ollama.Ollama # 맥: brew install ollama
ollama pull gemma4:e2b
ollama run gemma4:e2b
1단계 · 받아서 설치합니다 (약 5분)
ollama.com/download에서 설치 파일을 받거나, 윈도우면 명령 프롬프트에 winget install Ollama.Ollama 한 줄이면 됩니다. 저희 기계에서 296초 걸렸습니다.
cuda_v13 파일들이 풀립니다 — 엔비디아 그래픽카드가 없어도 정상입니다. 있을 때 쓰려고 같이 넣어둘 뿐입니다.여기서 놀라시는 분이 있습니다. CUDA는 엔비디아 전용인데 왜 깔리냐고요. 설치 파일이 모든 경우를 대비해 한 벌을 통째로 담고 있어서 그렇습니다. 그래픽카드가 없으면 그냥 안 쓰입니다.
2단계 · 첫 실행 — 가입은 건너뜁니다
Continue를 누르면 계정 가입 화면이 나옵니다. 여기가 중요합니다.
가입하면 Ollama 클라우드의 큰 모델을 쓸 수 있게 되는 것뿐입니다. 내 컴퓨터에서 돌리는 데는 계정이 필요 없습니다. 버튼이 크고 건너뛰기는 작은 글씨라 그냥 가입하게 되기 쉬운데, 이 글의 내용은 전부 로그인 없이 됩니다.
3단계 · 모델을 받습니다 (제일 오래 걸립니다)
# GPU 없는 기계라면 이것 하나면 됩니다
ollama pull gemma4:e2b
# 받아둔 목록 확인
ollama list
저희 기준 실제 소요 시간입니다. 인터넷 속도에 따라 달라집니다.
| 모델 | 용량 | 내려받기 |
|---|---|---|
| qwen3.5:2b | 2.7GB | 254초 |
| qwen3.5:4b | 3.4GB | 322초 |
| qwen3.5:9b | 6.6GB | 약 11분 |
| gemma4:e2b | 7.2GB | 약 11분 |
중간에 멈춰도 다시 pull하면 이어받습니다. 저희도 10분 타임아웃에 두 번 끊겼는데 같은 명령을 다시 넣으니 받던 지점부터 이어졌습니다. 처음부터 다시 받지 마세요.
4단계 · 돌려봅니다
ollama run gemma4:e2b
>>> 김치찌개를 맛있게 끓이는 핵심 세 가지만 알려줘. 각각 한 문장으로.
이 글의 모든 숫자가 바로 이 질문으로 나온 값입니다. 같은 질문을 넣어보시면 본인 기계가 저희 기계보다 빠른지 느린지 바로 비교됩니다.
qwen 계열을 쓰신다면 실행하자마자 이것부터 치세요. 안 하면 답 하나에 8분을 기다립니다.
>>> /set nothink
대화를 끝낼 때는 /bye입니다. 모델은 잠시 메모리에 남아 있다가 알아서 내려갑니다 — 그래서 두 번째 질문부터는 로딩 시간(저희 기준 8~9초)이 빠집니다.
5단계 · 내가 쓰는 도구에 붙입니다
여기부터가 진짜입니다. 터미널에서만 쓰면 금방 안 쓰게 되거든요.
ollama launch claude # Claude Code (터미널)
ollama launch codex # OpenAI Codex
ollama launch opencode # OpenCode
ollama launch --help # 지원 목록 전체
깔아보고 알게 된 것 — ollama launch claude는 클로드 데스크톱이 아니라 Claude Code(터미널)입니다. --help를 보면 codex·opencode·cline·copilot·VS Code까지 19개 도구가 지원 목록에 있습니다. 공식 발표는 데스크톱 앱만 소개했는데, 실제로는 코딩 도구 전반이 대상이에요. 데스크톱 앱은 ollama launch claude-desktop으로 따로 있습니다.
클로드 데스크톱 쪽은 이 글에 토글 켜는 법과 데이터 정책까지 정리해뒀고, 설치를 더 앞단계부터 보고 싶으시면 Ollama 설치와 Claude Code 연동 가이드가 있습니다.
안 될 때 — 저희가 실제로 만난 것들
| 증상 | 원인과 해결 |
|---|---|
pull이 중간에 끊긴다 | 같은 명령을 다시 넣으면 이어받습니다. 처음부터 다시 받지 마세요 |
| 답 하나에 몇 분씩 걸린다 | 추론 모델의 thinking입니다. /set nothink |
| 답에 한자·엉뚱한 상식이 섞인다 | 모델이 작아서 그렇습니다. 2B·4B의 한계입니다 |
| 중간에 멈추거나 아주 느려진다 | 메모리 부족. 모델 크기 × 1.5배 + 4GB가 필요합니다 |
| 가입하라고만 나온다 | "No thanks, I'll use Ollama locally"를 누르세요 |
정리 — 세 줄로
- 그래픽카드 없어도 됩니다. 2017년 i3에서 18.5초면 답이 나옵니다.
- 용량이 아니라 구조를 보세요. 제일 무거운 7.2GB가 제일 빨랐습니다.
- 저사양 1순위는
gemma4:e2b, qwen 계열을 쓴다면 thinking부터 끄세요.
안 재본 것
- 두 계열(qwen·gemma)만 봤습니다. 다른 계열은 또 다를 수 있습니다.
- 코딩·긴 문서 요약 등 다른 유형의 과제는 이번에 안 했습니다.
- 그래픽카드가 있는 기계와 비교하지 못했습니다. 저희에게 그 기계가 없습니다.
- 질문 하나에 답 하나씩만 봤습니다. 여러 번 돌려 평균을 낸 값이 아닙니다.
그래도 두 가지는 분명합니다.
하나, 그래픽카드가 없어서 포기했다면 안 해도 될 걱정을 한 겁니다. 2017년 i3에서 18.5초면 답이 나옵니다.
둘, 용량만 보고 고르지 마세요. 저희도 "작은 걸 깔아야 빠르겠지" 하고 2B부터 받았는데, 제일 무거운 7.2GB짜리가 제일 빠르고 제일 정확했습니다. 안 재봤으면 계속 몰랐을 겁니다.