GTX 1660 SUPER 6GB 로컬 LLM 실측: 8B 속도 2.9배 올린 설정
6GB 그래픽카드로 로컬 LLM을 돌릴 때 가장 궁금한 건 "몇 B 모델까지 쓸 만한가"입니다. GTX 1660 SUPER에서 Qwen3 4B·8B·14B를 20번 넘게 측정했고, 예상과 다른 결과가 두 가지 나왔습니다.
- Ollama 기본 설정으로 8B를 돌리면 14~16 tok/s인데, 설정 한 줄(
num_gpu 99)로 41 tok/s가 됩니다. 같은 질문끼리 비교하면 2.5~2.9배입니다. Ollama가 "6GB에 다 안 들어간다"고 판단해 30%를 CPU로 넘기지만, 실제로는 다 들어갔습니다. - 4B의 기본 태그는 받지 마세요. 한국어로 물어도 영어로 "생각"만 하다가 끝납니다. 4B를 쓰려면 instruct 태그를 받아야 합니다.
한눈에 보는 결과
| 모델 · 설정 | CPU/GPU 분담 | 생성 속도 | 한국어 질문 시 초당 한글 |
|---|---|---|---|
| 8B, 기본 설정 | 30% / 70% | 14.4~16.3 tok/s | 약 14자 |
| 8B, num_gpu 99 | 100% GPU | 41.2~41.4 tok/s | 약 42자 |
| 8B, num_gpu 99, 컨텍스트 8K | 100% GPU | 38.6 tok/s | — |
| 4B-instruct, 기본 설정 | 100% GPU | 77.0 tok/s | 약 84자 |
| 4B 기본 태그 | 100% GPU | 74~77 tok/s | 거의 0 (아래 설명) |
| 14B, 기본 설정 | 59% / 41% | 5.0 tok/s | — |
- 초당 한글은 답변에 들어 있는 한글 글자만 세서 생성 시간으로 나눈 값입니다(공백·기호·영문 제외). 같은 tok/s라도 모델마다 한 토큰에 담기는 한글 양이 달라서 따로 계산했습니다.
- 3회 반복한 측정 안에서는 편차가 ±0.3 tok/s 이내였습니다. 하지만 같은 8B 기본 설정도 측정한 시각에 따라 14.4~16.3 tok/s로 약 11% 차이가 났습니다. 원인은 확인하지 못했습니다. 비교는 같은 시간대에 연달아 잰 값끼리 했습니다.
테스트 환경과 방법
- CPU: Intel Core i9-10900K (10코어 20스레드), RAM: 32GB (16GB × 2, 3200MHz)
- 그래픽카드: NVIDIA GeForce GTX 1660 SUPER 6GB (6,144MB), 드라이버 591.86, Windows 11 Home
- 실행기: Ollama 0.34.4, 모델은 Ollama 라이브러리의 qwen3 기본 태그 그대로 (4B는
ollama show에서 Q4_K_M 확인) - 측정 전 그래픽 메모리: 바탕화면·브라우저 등이 쓰는 약 0.4~2GB를 그대로 둔 평소 상태
질문은 두 가지를 썼습니다. 영어 질문 "Explain in about 200 words how quantization lets a large language model run on a GPU with 6GB of VRAM."과, 같은 뜻의 한국어 질문 "6GB 그래픽카드에서 양자화가 어떻게 대형 언어 모델을 실행할 수 있게 해 주는지 200단어 정도로 설명해 주세요."입니다. 생성 길이는 256토큰(한 번만 1,500토큰), temperature 0, seed 고정입니다. 모델을 불러오는 첫 실행은 빼고 이어서 3회를 평균냈습니다(답변 언어만 확인한 몇 번은 1회). ollama ps로 CPU와 그래픽카드 분담 비율을, nvidia-smi로 그래픽 메모리를 확인했습니다. 비교할 때는 모델, 설정, 컨텍스트 길이, 질문 언어, 모델 태그 중 한 가지만 다른 값끼리 비교했습니다. 모델 설명은 공식 모델 카드를 참고했습니다.
기본 설정에서 8B가 느린 이유
Ollama는 모델을 불러올 때 그래픽 메모리가 얼마나 남았는지 보고, 모자랄 것 같으면 일부 층(layer)을 CPU 쪽에 둡니다. 8B를 기본 설정으로 불러오면 ollama ps에 크기 6.0GB, 30%는 CPU, 70%는 그래픽카드로 나옵니다. 이 30% 때문에 속도가 14~16 tok/s로 떨어집니다.
그런데 num_gpu를 99로 줘서 모든 층을 그래픽카드에 올리라고 하면 전부 그래픽카드에 올라갑니다. 이때 그래픽 메모리 사용량은 바탕화면 등이 쓰던 양까지 합쳐 5,744MB / 6,144MB였습니다. 들어갈 자리가 있었는데 Ollama의 자동 계산이 여유를 크게 잡았던 겁니다.
ollama ps 결과를 비교하면 차이가 바로 보입니다.
# 기본 설정
NAME SIZE PROCESSOR CONTEXT
qwen3:8b 6.0 GB 30%/70% CPU/GPU 4096
# num_gpu 99
NAME SIZE PROCESSOR CONTEXT
qwen3:8b 5.6 GB 100% GPU 4096
- 영어 질문: 14.4 → 41.3 tok/s (2.9배)
- 한국어 질문: 14.5 → 41.4 tok/s (2.9배), 초당 한글 약 14자 → 약 42자
- 컨텍스트를 8K로 늘려도 5,646MB로 들어갔고 38.6 tok/s(4K 대비 약 7% 감소)가 나왔습니다.
num_gpu 설정하는 방법
ollama run qwen3:8b로 대화를 연 뒤/set parameter num_gpu 99입력- API를 쓸 때는 요청의
options에"num_gpu": 99추가 - 항상 적용하려면 Modelfile로 새 모델을 만듭니다. 아래 두 줄을 파일로 저장하고
ollama create qwen3-8b-gpu -f 파일이름을 실행하면 됩니다.
FROM qwen3:8b
PARAMETER num_gpu 99
이렇게 만든 모델을 옵션 없이 돌려 보니 ollama show에 num_gpu 99가 들어가 있었고, 전부 그래픽카드에 올라가 43.8 tok/s가 나왔습니다. 옵션으로 줬을 때(41.2~41.4)보다 약간 빨랐는데, 이유는 확인하지 못했습니다.
다른 프로그램이 그래픽 메모리를 쓰고 있으면? 여유가 400~500MB뿐이라 걱정되는 부분이라 직접 시험했습니다. 다른 프로그램(작은 AI 모델을 띄운 llama-server)으로 그래픽 메모리를 약 0.8GB, 1.5GB 붙잡아 둔 상태에서 같은 8B를 돌렸습니다.
| 다른 프로그램이 잡은 메모리 | 8B, num_gpu 99 | 8B, 기본 설정 |
|---|---|---|
| 없음 | 41.2~41.4 tok/s | 14.4~16.3 tok/s |
| 약 0.8GB | 38.3 tok/s | 14.8 tok/s |
| 약 1.5GB | 38.5 tok/s | 14.5 tok/s |
불러오기가 실패하지는 않았고, 강제 설정은 약 7% 느려지는 데 그쳤습니다. 다만 붙잡아 둔 메모리를 그 프로그램이 실제로 쓰지 않고 있었기 때문에, 윈도우가 그 몫을 시스템 메모리로 밀어낸 것으로 보입니다. 게임처럼 그래픽 메모리를 계속 쓰는 프로그램과 같이 돌리면 결과가 더 나쁠 수 있으니, 그럴 때 느려지면 설정을 빼세요.
4B 기본 태그의 함정
qwen3:4b는 영어 질문에서 74 tok/s, 한국어 질문에서 77 tok/s로 가장 빨랐습니다. 그런데 한국어 질문의 답변을 열어 보니 질문에 대한 답이 아니었습니다. 256토큰 전부가 "Okay, so I need to explain…"으로 시작하는 영어 추론 과정이었고 한글은 거의 없었습니다(0.3%).
- 측정 스크립트는 생각 기능을 끄는 API 옵션(
think: false)을 매번 보냈지만 효과가 없었습니다. - 질문 끝에
/no_think를 붙여도 마찬가지였습니다(한글 4%). - 생성 길이를 1,500토큰으로 늘려도 끝까지 영어로 추론하다가 끝났습니다(한글 3%).
ollama show qwen3:4b를 보면 생각(thinking) 기능이 기본값으로 켜져 있다고 나옵니다. 반면 qwen3:4b-instruct 태그는 같은 속도(77.0 tok/s)로 질문을 받자마자 한국어로 답했습니다(한글 비율 71%). 8B 태그는 생각 끄기 옵션을 따라 바로 한국어로 답했습니다.
6GB 그래픽카드라면 이렇게 고르세요
- 8B를 쓸 거라면 num_gpu 99는 꼭 넣으세요. 같은 모델이 2.9배 빨라지고, 한국어로 초당 약 42자가 나옵니다.
- 가장 빠른 한국어 답이 필요하면 4B-instruct. 초당 한글 약 84자이고, 그래픽 메모리를 모델 자체로는 약 3.1GB만 써서 다른 프로그램과 같이 쓰기에도 여유가 있습니다.
- 8B와 4B-instruct의 답변 품질은 거의 같았습니다. 이메일 다듬기·요약·번역·사실 질문·계산·코딩·맞춤법·설명 8가지 한국어 과제로 채점해 보니 5점 만점에 8B 4.15점, 4B-instruct 4.10점이었습니다. 둘 다 사실 질문 하나를 틀렸고, 맞춤법 교정에서 8B는 "안"을 빠뜨려 뜻을 뒤집었습니다. 채점 방식과 다른 모델 결과는 한국어 LLM 비교 글에 있습니다.
- 14B는 6GB에서 비추천. 59%가 CPU로 넘어가 5.0 tok/s라서, 256토큰 답 하나를 받는 데 50초가 넘게 걸립니다.
- 모델을 받을 때는 태그 이름을 꼭 확인하세요. 같은 4B라도 기본 태그와 instruct 태그는 전혀 다르게 동작합니다.
한계와 다음 측정
속도는 질문 두 개(영어·한국어), 짧은 답변 기준의 결과이고, 품질은 과제 8개로만 본 것입니다. 다음에는 같은 모델을 RAM 8GB 노트북(Ryzen 7 8840HS 내장그래픽)에서 돌리면 어떤지, 양자화 단계를 바꾸면 6GB에서 무엇이 달라지는지 측정할 예정입니다.