로컬 AI 실측 노트

6GB 그래픽카드 Qwen3 14B: 층 수 조절로 1.5배, 그래도 8B의 6분의 1

2026-09-27

6GB 그래픽카드에 14B 모델은 다 들어가지 않습니다. 그래서 Ollama는 모델의 일부를 CPU 쪽에 두는데, 얼마나 그래픽카드에 올릴지(num_gpu)를 직접 정하면 얼마나 빨라질까요? GTX 1660 SUPER 6GB에서 Qwen3 14B를 층 수만 바꿔 가며 두 번(순서대로 한 번, 거꾸로 한 번) 쟀습니다.

결론부터 정리하면 이렇습니다.

결과

Qwen3 14B 층 수별 답 속도 막대그래프. 기본값 4.2~4.3, 24~26층 6.4~6.9, 28층 5.7~6.0 tok/s
층 수별 답 쓰는 속도(각 3회 평균). 파란색은 1회차(적은 층부터), 주황색은 2회차(많은 층부터).
그래픽카드에 올린 층 (num_gpu) CPU / GPU 분담 (ollama ps) 1회차 2회차 측정 중 그래픽 메모리
자동 (기본값) 59% / 41% 4.20 4.34 약 4.4~5.1GB
16 59% / 41% 4.23 4.37 약 4.4~5.1GB
20 50% / 50% 4.70 4.65 약 5.3~5.5GB
22 46% / 54% 5.66 5.02 약 5.7GB
24 42% / 58% 6.64 6.37 약 5.7GB
26 37% / 63% 6.86 6.38 약 5.7GB
28 33% / 67% 6.01 5.68 약 5.7GB

단위는 tok/s(초당 토큰), 각 3회 평균입니다. 3회 안에서는 편차가 대부분 0.05 tok/s 안쪽이었습니다(1회차 22층 5.56~5.82, 24층 6.59~6.70 제외). 그래픽 메모리는 nvidia-smi로 본 전체 사용량이라, 바탕화면 등이 쓰는 몫이 들어 있습니다.

한국어로 보면, 26층일 때 초당 약 10자(한글만 세면 약 7자)입니다. 128토큰짜리 짧은 답 하나에 약 20초가 걸립니다. 기본값이면 약 30초입니다.

28층에서 느려진 이유 (추정)

28층에서는 그래픽카드 몫이 더 늘었는데(67%) 오히려 느려졌습니다. 측정 중 그래픽 메모리는 22~28층 모두 약 5.7GB(6,144MB 중)로 거의 꽉 차 있었고, 모델이 차지한 몫(전체에서 측정 전 사용량을 뺀 값)도 22층부터는 층을 더 올려도 약 5.2~5.3GB에서 거의 늘지 않았습니다. Windows는 그래픽 메모리가 모자라면 일반 메모리를 빌려 쓰는 "공유 GPU 메모리"를 쓰는데, 일부가 그쪽으로 갔을 수 있고 28층에서 그 몫이 커져 느려졌을 가능성이 있습니다. 다만 공유 메모리 사용량을 따로 재지 않아서 확인하지 못했습니다. 확실한 것은 "많이 올릴수록 빠르다"가 26층 근처에서 끝난다는 점입니다.

두 번 잰 이유

1회차 도중 측정 조건이 하나 바뀌었습니다. 측정 전 그래픽 메모리(모델을 내린 상태에서 쓰는 양)가 20층까지는 1,031MB였는데, 22층 측정 전에는 637MB, 24층부터는 약 380~400MB로 줄었습니다. 무엇이 메모리를 풀었는지는 확인하지 못했습니다. 그러면 22층 이상이 빨라진 게 층 수 때문인지, 여유 메모리가 늘어서인지 가를 수 없습니다.

그래서 곧바로 순서를 거꾸로(28층부터) 한 번 더 쟀습니다. 2회차는 처음부터 끝까지 측정 전 메모리가 359~445MB로 비슷했습니다. 그런데도 자동·16층·20층은 1회차와 거의 같은 4.3~4.7 tok/s가 나왔고, 24~26층이 가장 빠르다는 결과도 같았습니다. 층 수에 따른 차이가 메모리 여유 변화만으로 생긴 것은 아니라고 봅니다. 다만 여유 메모리 자체도 중요합니다. 22층 이상에서는 모델이 약 5.2~5.3GB를 차지하므로, 다른 프로그램이 1GB쯤 쓰고 있으면 6GB 안에 다 들어가지 않습니다.

참고로 전날 다른 작업이 돌던 중에 잰 첫 측정은 기본값이 3.1 tok/s(2회 평균)로 훨씬 낮게 나왔습니다(측정 전 그래픽 메모리 약 2GB). 이번 두 회차는 새벽 시간에, 측정 스크립트가 그래픽 메모리와 CPU 사용량이 낮은지 먼저 확인한 뒤 돌렸습니다.

답 품질: 느린 만큼 낫지는 않았다

속도 측정이 끝난 뒤, 같은 새벽에 두 모델로 한국어 과제 8개(이메일 다듬기·요약·번역·사실 질문·계산·코딩·맞춤법·설명)를 풀게 했습니다. 14B는 24층을 올렸고, 8B는 num_gpu 99로 전부 그래픽카드에 올렸습니다. 답은 과제마다 A·B 순서를 무작위로 섞고 모델 이름을 가린 뒤, 서로 결과를 보지 않는 채점자 둘(Claude)이 따로 1~5점을 매겼고 두 점수를 평균냈습니다.

과제 14B (24층) 8B
이메일 다듬기 3.0 4.0
요약 3.0 5.0
번역 4.0 5.0
사실 질문 1.0 2.0
계산 5.0 5.0
코딩 5.0 4.5
맞춤법 2.0 1.5
설명 4.0 3.5
평균 3.38 3.81

과제를 푸는 동안의 답 속도는 14B가 4.9~6.1 tok/s, 8B가 44~46 tok/s였습니다. 과제 답이 짧은 질문 측정보다 길어서(최대 약 300토큰) 14B는 위 속도 표보다 조금 느렸습니다.

따라 하기

Ollama API로 한 번 물을 때 num_gpu를 넣으면 됩니다. 아래는 Windows 명령 프롬프트(cmd)용입니다(PowerShell에서는 curl 대신 curl.exe).

curl http://localhost:11434/api/generate -d "{\"model\":\"qwen3:14b\",\"prompt\":\"hello\",\"stream\":false,\"think\":false,\"options\":{\"num_gpu\":24}}"

늘 이 값으로 쓰려면 Modelfile을 만들어 새 이름으로 등록합니다.

FROM qwen3:14b
PARAMETER num_gpu 24
ollama create qwen3-14b-gpu24 -f Modelfile

측정 환경과 방법

한계