6GB 그래픽카드 8B 양자화 비교: Q3가 Q4보다 느렸다, Q4_K_M을 고르면 되는 이유
같은 Qwen3 8B라도 양자화 단계(Q3·Q4·Q5)에 따라 파일 크기가 4.1~5.9GB로 달라집니다. 6GB 그래픽카드에서는 "작을수록 빠르고, 클수록 똑똑하다"고 생각하기 쉬운데, GTX 1660 SUPER에서 직접 재 보니 그렇게 단순하지 않았습니다.
결론부터 정리하면 이렇습니다.
- 짧은 질문에서는 Q4_K_M이 가장 빨랐습니다. 42.8 tok/s로, 파일이 더 작은 Q3_K_M(38.4 tok/s)보다 12% 빨랐습니다. Q5_K_M은 37.7 tok/s였습니다.
- 긴 문서(약 3,500토큰)를 넣으면 순서가 파일 크기대로 바뀌었습니다. 답 쓰는 속도가 Q3 25.8, Q4 21.9, Q5 18.5 tok/s였습니다.
- 답변 품질은 8개 과제로는 차이를 가르기 어려웠습니다. 5점 만점에 Q3 3.50, Q4 3.69, Q5 3.88점이었지만, 과제 하나에서 1점만 달라져도 평균이 0.125점 움직이는 규모라 순위를 믿기 어렵습니다. 같은 Q4_K_M인 다른 파일(Ollama 공식)도 과제 8개 중 3개에서 점수가 갈렸습니다.
- 그래서 6GB에서는 Q4_K_M이 무난한 선택입니다. 긴 문서를 자주 넣는다면 Q3_K_M도 고려할 만합니다.
한눈에 보는 결과
모두 Ollama 0.34.4, num_gpu 99(모든 층을 그래픽카드에 올리는 설정)로 잰 값입니다.
| 양자화 | 파일 크기 | 짧은 질문 생성 속도 | 초당 한글 | 긴 문서(약 3,500토큰) 읽기 | 긴 문서 뒤 답 속도 | 품질 (5점 만점) |
|---|---|---|---|---|---|---|
| Q3_K_M | 4.1GB | 38.4 tok/s | 약 38자 | 35.1~36.1초 | 25.7~25.8 tok/s | 3.50 |
| Q4_K_M | 5.0GB | 42.8 tok/s | 약 41자 | 36.7~37.6초 | 21.9~22.0 tok/s | 3.69 |
| Q5_K_M | 5.9GB | 37.7 tok/s | 약 39자 | 37.8~38.7초 | 18.5~18.6 tok/s | 3.88 |
(참고) Ollama 공식 qwen3:8b Q4_K_M |
5.2GB | — | — | — | — | 3.75 |
- 세 단계 모두 같은 저장소(unsloth/Qwen3-8B-GGUF)에서 받은 파일이라, 양자화 단계 외의 차이는 적을 것으로 봤습니다. Ollama에서
ollama pull hf.co/unsloth/Qwen3-8B-GGUF:Q4_K_M처럼 바로 받을 수 있습니다. 파일 크기는 내려받을 때 표시된 값입니다(Ollama 공식 파일만ollama list값). - 짧은 질문 생성 속도는 한국어 질문 하나에 최대 256토큰까지 답하게 한 3회 평균입니다. 세 단계 모두 256토큰 전에 답을 끝내서, 실제 답 길이는 199~246토큰이었습니다. 3회 안의 편차는 ±0.1 tok/s 이내였습니다.
- 초당 한글은 답변의 한글 글자만 센 값입니다(공백·기호·영문 제외). 저장한 답변 하나의 한글 비율로 계산했습니다.
- 긴 문서는 긴 문서 글에서 쓴 약 4,800자 한국어 문서를
num_ctx 16384로 넣고 2번 잰 값입니다. 문서 한가운데 숨긴 네 자리 숫자를 묻고 숫자만 답하게 했으니, "답 속도"는 짧은 답을 쓸 때의 속도입니다. 숨긴 숫자는 세 단계 모두 2번 다 찾았습니다. - 품질은 한국어 과제 8개(이메일 다듬기·요약·번역·사실 질문·계산·코딩·맞춤법·설명)의 답을 모델 이름을 가리고 AI 채점자 두 명(Claude)이 따로 매긴 점수의 평균입니다. 과제마다 정해 둔 기준(들어가야 할 내용)에 따라 답 하나에 1~5점 종합 점수를 줬고, 사실·계산·코드·맞춤법은 정답과 대조했습니다. 이전 글처럼 항목을 나누지 않고 종합 점수 하나만 줬습니다. 두 채점자의 점수는 32개 답 중 27개가 같았고, 2점 이상 차이 난 답은 없었습니다.
테스트 환경과 방법
- CPU: Intel Core i9-10900K, RAM: 32GB (3200MHz)
- 그래픽카드: NVIDIA GeForce GTX 1660 SUPER 6GB (6,144MB), 드라이버 591.86, Windows 11 Home
- 실행기: Ollama 0.34.4, 모델은 Qwen3 8B(공식 모델 카드)의 GGUF 양자화 파일
- 공통 설정:
num_gpu 99, temperature 0, seed 고정, 생각 기능 끔(think: false). 모델을 불러오는 첫 실행은 빼고 쟀습니다.
한 번에 한 가지(양자화 단계)만 바꿨습니다. 측정 순서는 Q3 → Q4 → Q5이고, 각 단계에서 속도·품질·긴 문서를 이어서 쟀습니다.
Q3가 Q4보다 느린 이유
파일이 작으면 그래픽 메모리에서 읽을 양이 줄어드니 빨라질 것 같지만, 짧은 질문에서는 Q3_K_M(38.4 tok/s)이 Q4_K_M(42.8 tok/s)보다 느렸습니다.
같은 파일을 llama.cpp CUDA 빌드(b11193)의 llama-bench -p 0 -n 256 -r 3 -ngl 99로 재 봐도 순서가 같았습니다.
| 양자화 | llama-bench 표시 크기 | 생성 속도 (256토큰) | 크기만으로 예상한 속도 |
|---|---|---|---|
| Q3_K_M | 3.84GiB | 38.8 tok/s | 약 57.5 tok/s |
| Q4_K_M | 4.68GiB | 47.2 tok/s | (기준) |
| Q5_K_M | 5.44GiB | 39.8 tok/s | 약 40.6 tok/s |
크기만으로 예상한 속도는 대략적인 추정으로, "토큰 하나를 만들 때마다 모델 파일 전체를 한 번 읽는다"고 보고 Q4_K_M 속도에 파일 크기 비율을 곱한 값입니다. 생성 속도가 그래픽 메모리를 읽는 속도에 묶여 있다면 이렇게 나와야 합니다.
- Q5_K_M은 예상(40.6)과 비슷했습니다(39.8). 읽을 양이 16% 많은 것으로 대부분 설명됩니다. 다만 Q5는 그래픽 메모리가 빠듯해서, 일부가 그래픽 메모리 밖에 있었을 가능성은 배제하지 못했습니다.
- Q3_K_M은 예상(57.5)보다 한참 느렸습니다(38.8). 파일이 작아 그래픽 메모리 여유도 충분했으니, 메모리가 아니라 Q3 형식을 풀어서 계산하는 과정이 이 그래픽카드에서 더 오래 걸리는 것으로 보입니다. 원인을 직접 확인한 것은 아닙니다.
Ollama에서도 Q5_K_M은 6GB 카드에 거의 꽉 찼습니다. 측정 중 그래픽 메모리 사용량은 5,767MB(측정 직전 바탕화면 등이 쓰던 약 630MB 포함)였고, ollama ps는 "100% GPU"로 표시했습니다.
긴 문서에서는 작은 파일이 유리
약 3,500토큰짜리 문서를 넣으면 순서가 바뀌었습니다. 답 쓰는 속도가 Q3 25.8, Q4 21.9, Q5 18.5 tok/s로, 파일이 작을수록 빨랐습니다(Q3가 Q4보다 약 17% 빠름). 문서를 읽는 시간은 35~39초로 큰 차이가 없었습니다.
긴 문서 글에서 본 것처럼, 긴 문서에서는 모델 파일 외에 문맥을 기억할 공간이 그래픽 메모리를 차지합니다. 파일이 작으면 그 공간이 더 남아서 덜 느려지는 것으로 보입니다. 측정 중 윈도우의 "공유 GPU 메모리" 사용량도 Q3 약 1,540MB, Q4 약 2,380MB, Q5 약 2,970MB로 파일 크기 순서였습니다. 다만 앞 글에 적었듯 이 공유 메모리 값은 해석이 어려워서, 원인을 확정하지는 못했습니다.
품질: 8개 과제로는 단계 차이가 안 갈렸다
| 과제 | Q3_K_M | Q4_K_M | Q5_K_M | Ollama 공식 Q4_K_M |
|---|---|---|---|---|
| 이메일 다듬기 | 4.5 | 3.0 | 4.5 | 4.0 |
| 요약 (세 문장) | 3.0 | 5.0 | 5.0 | 5.0 |
| 번역 | 4.0 | 5.0 | 4.0 | 5.0 |
| 사실 질문 | 2.0 | 2.0 | 2.0 | 2.0 |
| 계산 | 4.5 | 5.0 | 5.0 | 5.0 |
| 코딩 | 5.0 | 3.5 | 4.5 | 4.0 |
| 맞춤법 | 3.0 | 2.0 | 2.0 | 2.0 |
| 설명 | 2.0 | 4.0 | 4.0 | 3.0 |
| 평균 | 3.50 | 3.69 | 3.88 | 3.75 |
- 네 파일 모두 같은 곳에서 틀렸습니다. 사실 질문에서 훈민정음 반포 연도는 모두 맞혔지만 세종시 출범 연도는 넷 다 틀렸고, 맞춤법 교정에서는 다른 곳은 고쳤지만 넷 다 "몇일"을 "며칠"로 고치지 못했습니다. 이런 약점은 양자화 단계를 올려도 그대로였습니다.
- Q3_K_M은 지시를 어기거나 문장이 꼬인 답이 있었습니다. 요약을 세 문장이 아니라 네 문장으로 썼고, 설명 과제에서는 "컴퓨터에 있는 컴퓨터가"처럼 문장이 꼬였습니다. 대신 코딩과 맞춤법(시제를 지킴)은 가장 좋았습니다.
- 같은 Q4_K_M인데도 파일마다 답이 달랐습니다. unsloth 파일과 Ollama 공식 파일은 과제 8개 중 3개(이메일·코딩·설명)에서 최대 1점씩 점수가 갈렸습니다. Q4와 Q5도 3개 과제에서 최대 1.5점씩 갈린 정도입니다. 과제 하나에서 1점 차이가 평균을 0.125점 움직이니, 과제 8개, 과제당 답 하나로는 평균 0.2~0.4점 차이를 "단계 차이"라고 말하기 어렵습니다.
- Ollama 공식 파일의 답은 한국어 LLM 비교 글에서 만든 답(
qwen3:8b+num_gpu 99)을 그대로 다시 채점한 것입니다. 그 글에서 4.15점이던 같은 답이 이번에는 3.75점이 나왔습니다. 채점자와 함께 비교하는 답이 달라지면 점수 기준도 달라지니, 글 사이의 점수는 비교하지 마세요. 참고로 이 파일은 이름은 같은 Q4_K_M이지만 크기가 unsloth 파일보다 약 0.2GB 큽니다(llama-bench표시 4.86GiB 대 4.68GiB).
6GB 그래픽카드라면 이렇게 고르세요
- 기본은 Q4_K_M. 짧은 질문에서 가장 빨랐고, 품질도 Q5와 뚜렷한 차이가 없었습니다. Ollama 기본 태그(
qwen3:8b)도 Q4_K_M입니다. 다만num_gpu 99는 꼭 넣으세요(num_gpu 설정 글). - 긴 문서를 자주 넣는다면 Q3_K_M도 선택지. 약 3,500토큰 문서 뒤의 답이 Q4보다 약 17% 빨랐습니다. 다만 짧은 질문은 오히려 느리고, 지시를 어긴 답이 하나 있었습니다. 긴 문서라면 8B 대신 4B-instruct가 훨씬 빠르다는 점도 함께 보세요(긴 문서 글).
- Q5_K_M은 6GB에서 이득이 적습니다. 읽을 양이 늘어난 만큼 짧은 질문에서 Q4보다 12% 느렸고, 긴 문서에서는 16% 느렸습니다. 품질 차이는 이번 과제로는 확인되지 않았습니다.
한계
- 그래픽카드 한 종류(GTX 1660 SUPER 6GB)와 Qwen3 8B 한 모델로만 쟀습니다. Q3가 느린 현상은 이 카드(GTX 16 시리즈)에서 Q3 형식을 계산하는 방식의 특성일 수 있어서, 다른 그래픽카드에서는 다를 수 있습니다. 그래픽 메모리가 8GB 이상이면 Q5의 불리함은 줄어들 것으로 예상되지만 재 보지는 않았습니다.
- 품질은 과제 8개, 과제당 답 하나(temperature 0)로만 봤습니다. 양자화 단계의 미세한 품질 차이를 가르려면 훨씬 많은 문제가 필요합니다.
- 속도는 한 번의 측정 세션(연달아 잰 값)입니다. 이 PC에서는 같은 설정도 측정 시각에 따라 수 % 차이가 난 적이 있습니다.