로컬 AI 실측 노트

6GB 그래픽카드 8B 양자화 비교: Q3가 Q4보다 느렸다, Q4_K_M을 고르면 되는 이유

2026-09-27

같은 Qwen3 8B라도 양자화 단계(Q3·Q4·Q5)에 따라 파일 크기가 4.1~5.9GB로 달라집니다. 6GB 그래픽카드에서는 "작을수록 빠르고, 클수록 똑똑하다"고 생각하기 쉬운데, GTX 1660 SUPER에서 직접 재 보니 그렇게 단순하지 않았습니다.

결론부터 정리하면 이렇습니다.

한눈에 보는 결과

모두 Ollama 0.34.4, num_gpu 99(모든 층을 그래픽카드에 올리는 설정)로 잰 값입니다.

양자화 파일 크기 짧은 질문 생성 속도 초당 한글 긴 문서(약 3,500토큰) 읽기 긴 문서 뒤 답 속도 품질 (5점 만점)
Q3_K_M 4.1GB 38.4 tok/s 약 38자 35.1~36.1초 25.7~25.8 tok/s 3.50
Q4_K_M 5.0GB 42.8 tok/s 약 41자 36.7~37.6초 21.9~22.0 tok/s 3.69
Q5_K_M 5.9GB 37.7 tok/s 약 39자 37.8~38.7초 18.5~18.6 tok/s 3.88
(참고) Ollama 공식 qwen3:8b Q4_K_M 5.2GB — — — — 3.75

테스트 환경과 방법

한 번에 한 가지(양자화 단계)만 바꿨습니다. 측정 순서는 Q3 → Q4 → Q5이고, 각 단계에서 속도·품질·긴 문서를 이어서 쟀습니다.

Q3가 Q4보다 느린 이유

파일이 작으면 그래픽 메모리에서 읽을 양이 줄어드니 빨라질 것 같지만, 짧은 질문에서는 Q3_K_M(38.4 tok/s)이 Q4_K_M(42.8 tok/s)보다 느렸습니다.

같은 파일을 llama.cpp CUDA 빌드(b11193)의 llama-bench -p 0 -n 256 -r 3 -ngl 99로 재 봐도 순서가 같았습니다.

양자화 llama-bench 표시 크기 생성 속도 (256토큰) 크기만으로 예상한 속도
Q3_K_M 3.84GiB 38.8 tok/s 약 57.5 tok/s
Q4_K_M 4.68GiB 47.2 tok/s (기준)
Q5_K_M 5.44GiB 39.8 tok/s 약 40.6 tok/s

크기만으로 예상한 속도는 대략적인 추정으로, "토큰 하나를 만들 때마다 모델 파일 전체를 한 번 읽는다"고 보고 Q4_K_M 속도에 파일 크기 비율을 곱한 값입니다. 생성 속도가 그래픽 메모리를 읽는 속도에 묶여 있다면 이렇게 나와야 합니다.

Ollama에서도 Q5_K_M은 6GB 카드에 거의 꽉 찼습니다. 측정 중 그래픽 메모리 사용량은 5,767MB(측정 직전 바탕화면 등이 쓰던 약 630MB 포함)였고, ollama ps는 "100% GPU"로 표시했습니다.

긴 문서에서는 작은 파일이 유리

약 3,500토큰짜리 문서를 넣으면 순서가 바뀌었습니다. 답 쓰는 속도가 Q3 25.8, Q4 21.9, Q5 18.5 tok/s로, 파일이 작을수록 빨랐습니다(Q3가 Q4보다 약 17% 빠름). 문서를 읽는 시간은 35~39초로 큰 차이가 없었습니다.

긴 문서 글에서 본 것처럼, 긴 문서에서는 모델 파일 외에 문맥을 기억할 공간이 그래픽 메모리를 차지합니다. 파일이 작으면 그 공간이 더 남아서 덜 느려지는 것으로 보입니다. 측정 중 윈도우의 "공유 GPU 메모리" 사용량도 Q3 약 1,540MB, Q4 약 2,380MB, Q5 약 2,970MB로 파일 크기 순서였습니다. 다만 앞 글에 적었듯 이 공유 메모리 값은 해석이 어려워서, 원인을 확정하지는 못했습니다.

품질: 8개 과제로는 단계 차이가 안 갈렸다

과제 Q3_K_M Q4_K_M Q5_K_M Ollama 공식 Q4_K_M
이메일 다듬기 4.5 3.0 4.5 4.0
요약 (세 문장) 3.0 5.0 5.0 5.0
번역 4.0 5.0 4.0 5.0
사실 질문 2.0 2.0 2.0 2.0
계산 4.5 5.0 5.0 5.0
코딩 5.0 3.5 4.5 4.0
맞춤법 3.0 2.0 2.0 2.0
설명 2.0 4.0 4.0 3.0
평균 3.50 3.69 3.88 3.75

6GB 그래픽카드라면 이렇게 고르세요

한계