블로그 / 실측
실측

그래픽카드 없이 무료 AI 4종 비교 — 가장 큰 모델이 가장 빨랐습니다

2026.08.27 · 자비스스튜디오

내 PC에서 AI를 무료로 돌리는 방법을 찾아보면 하나같이 RTX 4090이나 맥북 M4 Max 기준입니다. 정작 궁금한 건 이거였어요 — 그래픽카드가 없는 평범한 사무용 PC에서도 되나? 된다면 몇 초 걸리나?

그래서 2017년에 나온 i3에 직접 깔고, 모델 네 개를 같은 질문으로 돌려 쟀습니다. 설치 화면과 사양별(RAM·VRAM·맥) 추천 모델까지 아래에 다 넣었습니다. 결과가 예상과 달랐습니다 — 가장 용량이 큰 모델이 가장 빨랐고, 답도 제일 정확했습니다.

qwen3.5 2b, 4b, 9b가 같은 질문에 답한 결과 비교 — 2b는 중국어 한자 혼입, 4b는 상식 오류, 9b는 정상
같은 질문, 같은 기계. 7.2GB 짜리가 6.6GB 짜리보다 3.4배 빠릅니다.
  • 2B는 못 씁니다. 한국어에 중국어 한자가 섞여 나옵니다.
  • 4B는 문장은 되는데 상식이 틀립니다. 찌개를 끓이는데 불판이 등장해요.
  • 9B는 맞는 말을 하지만 답 하나에 40초가 걸립니다.
  • 그런데 7.2GB짜리 gemma4:e2b가 18.5초 만에, 가장 정확하게 답했습니다. 더 큰데 3.4배 빠릅니다.

그리고 모델과 무관하게 함정이 하나 따로 있었습니다. 이걸 모르면 같은 질문에 8분을 기다리게 됩니다.

테스트한 기계 (숨길 것 없이)

CPU   Intel Core i3-8100 @ 3.60GHz  (4코어, 2017년)
RAM   23.9 GB
GPU   Intel UHD 630 내장 · 전용 VRAM 1GB   ← 그래픽카드 없음
OS    Windows 11
설치  winget install Ollama.Ollama  (v0.33.0)

2017년 보급형 CPU에 내장 그래픽입니다. 사무실에서 문서 작업하는 PC와 비슷하거나 그보다 낮습니다.

질문은 이 한 줄로 고정했습니다. 그대로 복사해서 확인해 보셔도 됩니다.

김치찌개를 맛있게 끓이는 핵심 세 가지만 알려줘. 각각 한 문장으로.

일부러 한국 사람이면 다 아는 것을 골랐습니다. 번역투로 얼버무리면 바로 티가 나거든요.

함정 하나 — 이걸 모르면 8분을 기다립니다

thinking을 켰을 때 7분 51초, 껐을 때 9.46초로 줄어드는 비교 화면
같은 모델, 같은 질문. thinking 설정 하나 차이입니다.

처음 돌렸을 때 7분 51초가 걸렸습니다. 김치찌개 세 줄 물어봤는데요.

이유는 속도가 아니었습니다. 생성 속도는 초당 8.72토큰으로 정상이었는데, 토큰을 4,066개나 뱉었습니다. 요청한 건 세 문장인데요.

최신 모델 상당수가 추론(thinking) 모델이라 답하기 전에 혼자 고민하는 과정을 통째로 출력합니다. 그것도 영어로 이런 식이에요.

Okay, I will stick to the 3 points of Aromatics, Heat/Simmering, and Balance.
(Too specific on saute.) Let's try to generalize:  -> Too weak.

이 과정을 끄니 7분 51초가 9.46초가 됐습니다. 50배입니다. 속도는 그대로고 뱉는 양만 91토큰으로 줄었습니다.

끄는 법 — 대화창에서는 /set nothink, API로 부를 때는 요청에 "think": false를 넣습니다. 그래픽카드가 없다면 이건 선택이 아니라 필수입니다.

크기별로 실제로 이렇게 나옵니다

2B — 중국어가 섞입니다

채소를 넣고 바로 삶지 말고 수분기를 이용해 천천히 물기를쳐…
김이 살짝 올랐고 면발이 생기면 바로 비빔밥이나 소스까지 넣어…

는 중국어 한자입니다. 김치찌개에 면발과 비빔밥도 등장하고요. 빠르지만(9.5초) 믿고 쓸 수가 없습니다.

4B — 한국어는 되는데 한국을 모릅니다

양파와 배를 미리 굽어 단맛을 내어…
불판에 두툼하게 올린 돼지고기나 생선을 팬에서 기름을 뺀 뒤…

한자는 사라졌고 문법도 정상입니다. 그런데 찌개인데 불판이 나옵니다. 한국어를 쓸 줄 아는 것과 한국 사정을 아는 건 다른 문제더군요.

9B — 여기서 선을 넘습니다

채소를 다 자른 뒤 무를 조금 더 작게 다져서 김치의 아삭한 식감을 살려야 합니다.
마지막에 참기름 한 두 방울과 쪽파, 통깨를 뿌려 은은한 향을 더해야 완성도가 높아집니다.

세 번째 문장은 그대로 따라 해도 되는 조언입니다. 나머지도 틀린 말이 없고요. 4B와 9B 사이엔 "조금 나아짐"이 아니라 "쓸 수 있느냐"의 선이 있습니다.

여기까지가 예상했던 결과였습니다. 크면 똑똑하고 느리다. 그런데 계열을 하나 더 넣어보니 이 전제가 깨졌습니다.

gemma4:e2b — 더 큰데 3.4배 빠릅니다

1. 잘 익은 김치를 사용하세요: 신맛이 적절히 배어 깊은 맛을 냅니다.
2. 고기를 먼저 볶아 깊은 맛을 내세요: 고기와 김치를 함께 볶으면 감칠맛이 극대화됩니다.
3. 육수를 충분히 우려내고 간을 맞추세요: 맹물 대신 멸치나 사골 육수를 사용하고…

네 개 중 가장 정확합니다. 잘 익은 김치, 고기 먼저 볶기, 멸치·사골 육수 — 한국 사람이 실제로 하는 말이에요. 서식까지 깔끔하게 정리해서 내놓습니다.

그런데 놀라운 건 속도입니다. 용량은 7.2GB로 9B(6.6GB)보다 큰데, 18.5초 만에 끝났습니다. 초당 12.30토큰 — 9B의 3.4배이고, 제일 작은 2B보다도 빠릅니다.

왜 더 큰데 빠른가 — 요즘 모델은 안에 여러 전문가를 두고 질문마다 일부만 깨우는 구조(MoE)를 씁니다. 메모리에는 전부 올려야 해서 용량은 크지만, 실제 계산은 일부만 하니 CPU에서 훨씬 빠릅니다. 그래픽카드가 없을수록 이 차이가 크게 벌어집니다.

그래서 저사양에서 진짜 기준은 이겁니다. 내려받는 용량(GB)이 아니라, 한 번 답할 때 실제로 계산하는 양입니다. 용량만 보고 "작은 걸 깔아야지" 하면 오히려 느리고 부정확한 걸 고르게 됩니다.

이런 실측, 매주 보내드립니다.
직접 돌려보고 되는 것만 골라 정리합니다. 광고성 하이프는 거릅니다.

📮 뉴스레터 신청

대가는 속도입니다

모델용량답 하나생성 속도한국어
qwen3.5:2b2.7GB9.5초9.82 tok/s✕ 한자 혼입
qwen3.5:4b3.4GB26초6.10 tok/s△ 상식 오류
qwen3.5:9b6.6GB40초3.65 tok/s✓ 쓸 만함
gemma4:e2b7.2GB18.5초12.30 tok/s★ 가장 정확

같은 qwen 계열 안에서는 예상대로입니다 — 클수록 똑똑하고 느립니다(9B는 2B의 37% 속도). 그런데 계열을 바꾸면 그 규칙이 통하지 않습니다. gemma4:e2b는 제일 무겁고 제일 빠릅니다.

참고로 표의 시간에는 모델을 메모리에 올리는 시간(9B는 9.4초, gemma4는 8.2초)이 포함돼 있습니다. 연달아 물어보면 그만큼 빨라져요.

그럼 내 사양엔 뭘 깔아야 하나

먼저 내 사양부터 — 30초면 됩니다

세 가지만 알면 됩니다. 전용 그래픽카드가 있는지, 있다면 VRAM이 몇 GB인지, 없다면 RAM이 몇 GB인지.

윈도우 — 명령 프롬프트 / PowerShell
# 그래픽카드 이름과 VRAM (엔비디아면 이게 제일 정확합니다)
nvidia-smi

# nvidia-smi 가 "명령을 찾을 수 없다"면 = 엔비디아 그래픽카드가 없습니다
# 그때는 이걸로 확인하세요
wmic path win32_VideoController get name,AdapterRAM
wmic ComputerSystem get TotalPhysicalMemory
# 칩과 통합 메모리 — 맥은 RAM과 VRAM을 같이 씁니다
system_profiler SPHardwareDataType | grep -E "Chip|Memory"

더 쉬운 길도 있습니다. 윈도우는 작업 관리자 → 성능 → GPU에서 "전용 GPU 메모리"를 보면 되고, 맥은 왼쪽 위 사과 → 이 Mac에 관하여에 다 나옵니다.

"전용 GPU 메모리 1GB"는 그래픽카드가 있는 게 아닙니다. CPU에 딸린 내장 그래픽이 시스템 메모리를 조금 떼어 쓰는 겁니다. 저희 테스트 기계가 정확히 그 상태(Intel UHD 630 · 1GB)였고, 아래 표에서는 "그래픽카드 없음"으로 봐야 합니다.

용량 계산 — 내려받는 크기가 전부가 아닙니다

아래 표의 용량은 내려받는 크기입니다. 실제로 돌릴 때는 여기에 대화 내용을 담아두는 메모리(KV 캐시)가 더 붙습니다.

항목얼마나
모델 파일표에 적힌 크기
KV 캐시 (기본 컨텍스트)+2~6GB
운영체제·브라우저 등+3~4GB
그래서 실제 여유모델 크기 × 약 1.5배 + 4GB

예를 들어 gemma4:e2b(7.2GB)를 편하게 쓰려면 메모리 16GB는 있어야 합니다. 8GB에서도 돌긴 하지만 다른 프로그램을 다 닫아야 하고, 컨텍스트를 길게 잡으면 디스크로 밀려나 급격히 느려집니다.

① 그래픽카드가 없다면 (RAM 기준)

이 표만 저희가 직접 쟀습니다. 아래 ②③은 공식 크기 기준의 권장이고, 속도는 재지 않았습니다.

RAM추천용량기대치
8GBqwen3.5:4b3.4GB26초. 문장은 되는데 사실 확인 필수
8GB
(더 가볍게)
qwen3.5:2b2.7GB9.5초. 한국어는 권하지 않습니다 — 한자가 섞입니다
16GBgemma4:e2b7.2GB18.5초 · 우리 1순위. thinking도 안 뱉습니다
24GBgemma4:e2b
gemma4:12b
7.2GB
7.6GB
12b는 컨텍스트가 256K로 두 배
32GB+gpt-oss:20b14GB공식 권장이 메모리 16GB. CPU만으로는 느립니다

GPU가 없을 때 27B·30B급은 권하지 않습니다. 메모리가 남아도 CPU가 못 따라갑니다. 저희 기계에서 6.6GB짜리 9B가 답 하나에 40초였는데, 그보다 세 배 무거운 모델이면 산술적으로 분 단위입니다. 넣을 수 있는 것과 쓸 만한 것은 다릅니다.

② 그래픽카드가 있다면 (VRAM 기준)

기준은 하나입니다 — 모델이 VRAM에 통째로 들어가야 제 속도가 납니다. 반만 올라가면 나머지는 CPU가 처리해서 없느니만 못한 속도가 나옵니다.

VRAM대표 카드추천용량
6GBRTX 3060 노트북 · 2060qwen3.5:4b3.4GB
8GBRTX 4060 · 3070qwen3.5:9b
gemma4:e2b
6.6GB
7.2GB
12GBRTX 4070 · 3060 12GBgemma4:12b7.6GB
16GBRTX 4080 · 4060 Ti 16GBgpt-oss:20b14GB
24GBRTX 4090 · 3090qwen3.5:27b
qwen3-coder:30b
17GB
19GB
32GB+RTX 5090 등gemma4:31b
qwen3.5:35b
20GB
24GB

③ 맥이라면 (통합 메모리 기준)

맥은 RAM과 VRAM이 하나라 계산이 단순합니다. 대신 전체 메모리의 약 70%까지만 GPU가 쓸 수 있다고 보면 안전합니다.

통합 메모리추천용량
8GBqwen3.5:4b-mlx3.4GB
16GBqwen3.5:9b-mlx8.9GB
24GBgemma4:12b-mlx7.7GB
32GBgpt-oss:20b14GB
64GB+qwen3.5:35b24GB

맥이면 -mlx 태그를 쓰세요. qwen3.5:9b가 아니라 qwen3.5:9b-mlx처럼 애플 실리콘에 맞춰 나온 버전이 따로 있습니다. 모르고 일반 태그를 쓰는 분이 많습니다. gemma4에도 있습니다.

④ 하려는 일로 고른다면

하려는 일추천
한국어 대화·요약gemma4:e2b같은 질문에서 한국어가 가장 정확했습니다
코딩qwen3-coder:30b30B 중 3.3B만 계산합니다. 컨텍스트 256K
긴 문서gemma4:12b 이상컨텍스트가 256K로 e2b(128K)의 두 배
이미지·음성까지gemma4:e2b / 31be2b는 소리도 읽습니다
일단 되는지만 확인qwen3.5:2b2.7GB. 단, 한국어 품질은 기대하지 마세요

용량 숫자는 전부 ollama.com 공식 페이지에서 확인한 값입니다(2026년 8월 27일 기준). 다만 속도는 우리 기계에서 잰 것이고, 다른 사양의 속도는 우리가 재지 않았습니다. ②③④는 크기와 공식 권장에 기반한 추천이지 실측이 아닙니다.

설치 — 화면 그대로 따라오세요

급하면 세 줄입니다. 아래에 화면과 함께 풀어 뒀으니 처음이면 그쪽을 보세요.

터미널 (윈도우 · 맥 공통)
winget install Ollama.Ollama    # 맥: brew install ollama
ollama pull gemma4:e2b
ollama run gemma4:e2b

1단계 · 받아서 설치합니다 (약 5분)

ollama.com/download에서 설치 파일을 받거나, 윈도우면 명령 프롬프트에 winget install Ollama.Ollama 한 줄이면 됩니다. 저희 기계에서 296초 걸렸습니다.

Ollama 설치 마법사가 파일을 푸는 화면
설치 중에 cuda_v13 파일들이 풀립니다 — 엔비디아 그래픽카드가 없어도 정상입니다. 있을 때 쓰려고 같이 넣어둘 뿐입니다.

여기서 놀라시는 분이 있습니다. CUDA는 엔비디아 전용인데 왜 깔리냐고요. 설치 파일이 모든 경우를 대비해 한 벌을 통째로 담고 있어서 그렇습니다. 그래픽카드가 없으면 그냥 안 쓰입니다.

2단계 · 첫 실행 — 가입은 건너뜁니다

Ollama 첫 실행 환영 화면
첫 화면. "코딩 도구에 오픈 모델을 붙여서, 돈은 덜 쓰고 데이터는 내 것으로" — 이게 이 앱이 스스로 말하는 정체입니다.

Continue를 누르면 계정 가입 화면이 나옵니다. 여기가 중요합니다.

Ollama 계정 만들기 화면과 건너뛰기 링크
가입은 필수가 아닙니다. 아래 "No thanks, I'll use Ollama locally"를 누르면 로그인 없이 그대로 씁니다.

가입하면 Ollama 클라우드의 큰 모델을 쓸 수 있게 되는 것뿐입니다. 내 컴퓨터에서 돌리는 데는 계정이 필요 없습니다. 버튼이 크고 건너뛰기는 작은 글씨라 그냥 가입하게 되기 쉬운데, 이 글의 내용은 전부 로그인 없이 됩니다.

3단계 · 모델을 받습니다 (제일 오래 걸립니다)

터미널
# GPU 없는 기계라면 이것 하나면 됩니다
ollama pull gemma4:e2b

# 받아둔 목록 확인
ollama list

저희 기준 실제 소요 시간입니다. 인터넷 속도에 따라 달라집니다.

모델용량내려받기
qwen3.5:2b2.7GB254초
qwen3.5:4b3.4GB322초
qwen3.5:9b6.6GB약 11분
gemma4:e2b7.2GB약 11분

중간에 멈춰도 다시 pull하면 이어받습니다. 저희도 10분 타임아웃에 두 번 끊겼는데 같은 명령을 다시 넣으니 받던 지점부터 이어졌습니다. 처음부터 다시 받지 마세요.

4단계 · 돌려봅니다

터미널
ollama run gemma4:e2b

>>> 김치찌개를 맛있게 끓이는 핵심 세 가지만 알려줘. 각각 한 문장으로.

이 글의 모든 숫자가 바로 이 질문으로 나온 값입니다. 같은 질문을 넣어보시면 본인 기계가 저희 기계보다 빠른지 느린지 바로 비교됩니다.

qwen 계열을 쓰신다면 실행하자마자 이것부터 치세요. 안 하면 답 하나에 8분을 기다립니다.

대화창 안에서
>>> /set nothink

대화를 끝낼 때는 /bye입니다. 모델은 잠시 메모리에 남아 있다가 알아서 내려갑니다 — 그래서 두 번째 질문부터는 로딩 시간(저희 기준 8~9초)이 빠집니다.

5단계 · 내가 쓰는 도구에 붙입니다

여기부터가 진짜입니다. 터미널에서만 쓰면 금방 안 쓰게 되거든요.

Ollama 앱의 Apps 목록 — Claude Code, Codex, OpenClaw 등
Ollama 앱 → Apps. 도구마다 붙이는 명령이 하나씩 적혀 있고, 복사 버튼도 있습니다.
터미널
ollama launch claude       # Claude Code (터미널)
ollama launch codex        # OpenAI Codex
ollama launch opencode     # OpenCode
ollama launch --help       # 지원 목록 전체

깔아보고 알게 된 것ollama launch claude는 클로드 데스크톱이 아니라 Claude Code(터미널)입니다. --help를 보면 codex·opencode·cline·copilot·VS Code까지 19개 도구가 지원 목록에 있습니다. 공식 발표는 데스크톱 앱만 소개했는데, 실제로는 코딩 도구 전반이 대상이에요. 데스크톱 앱은 ollama launch claude-desktop으로 따로 있습니다.

클로드 데스크톱 쪽은 이 글에 토글 켜는 법과 데이터 정책까지 정리해뒀고, 설치를 더 앞단계부터 보고 싶으시면 Ollama 설치와 Claude Code 연동 가이드가 있습니다.

안 될 때 — 저희가 실제로 만난 것들

증상원인과 해결
pull이 중간에 끊긴다같은 명령을 다시 넣으면 이어받습니다. 처음부터 다시 받지 마세요
답 하나에 몇 분씩 걸린다추론 모델의 thinking입니다. /set nothink
답에 한자·엉뚱한 상식이 섞인다모델이 작아서 그렇습니다. 2B·4B의 한계입니다
중간에 멈추거나 아주 느려진다메모리 부족. 모델 크기 × 1.5배 + 4GB가 필요합니다
가입하라고만 나온다"No thanks, I'll use Ollama locally"를 누르세요

정리 — 세 줄로

  • 그래픽카드 없어도 됩니다. 2017년 i3에서 18.5초면 답이 나옵니다.
  • 용량이 아니라 구조를 보세요. 제일 무거운 7.2GB가 제일 빨랐습니다.
  • 저사양 1순위는 gemma4:e2b, qwen 계열을 쓴다면 thinking부터 끄세요.

안 재본 것

  • 두 계열(qwen·gemma)만 봤습니다. 다른 계열은 또 다를 수 있습니다.
  • 코딩·긴 문서 요약 등 다른 유형의 과제는 이번에 안 했습니다.
  • 그래픽카드가 있는 기계와 비교하지 못했습니다. 저희에게 그 기계가 없습니다.
  • 질문 하나에 답 하나씩만 봤습니다. 여러 번 돌려 평균을 낸 값이 아닙니다.

그래도 두 가지는 분명합니다.

하나, 그래픽카드가 없어서 포기했다면 안 해도 될 걱정을 한 겁니다. 2017년 i3에서 18.5초면 답이 나옵니다.

둘, 용량만 보고 고르지 마세요. 저희도 "작은 걸 깔아야 빠르겠지" 하고 2B부터 받았는데, 제일 무거운 7.2GB짜리가 제일 빠르고 제일 정확했습니다. 안 재봤으면 계속 몰랐을 겁니다.

실측 위주 AI 뉴스레터 — 직접 돌려보고 되는 것만 골라 매주 보내드립니다.

#무료AI #Ollama #올라마 #로컬AI #LLM #AI실측 #저사양 #자비스스튜디오