6GB 그래픽카드 로컬 LLM 총정리: 모델·설정·긴 문서, 실측 7편 요약
GTX 1660 SUPER 6GB 한 대로 로컬 LLM을 이틀 동안 110개가 넘는 PC 작업(모델 받기·설정 변경 포함)으로 돌려 보며 7편의 글을 썼습니다. 이 글은 그 결과를 "무엇을 고르고, 무엇을 켜고, 무엇을 피할지" 기준으로 한 페이지에 모은 안내서입니다. 숫자는 모두 각 글에서 실제로 잰 값이고, 자세한 조건과 한계는 링크한 글에 있습니다.
먼저 이것만: 6GB에서 꼭 할 설정 세 가지
- 8B 모델을 Ollama로 쓴다면
num_gpu 99를 넣으세요. 기본 설정에서는 Ollama가 모델의 30%를 CPU 쪽에 둬서 14~16 tok/s였는데, 이 설정으로 전부 그래픽카드에 올리니 41 tok/s가 됐습니다(2.9배). → 8B 속도 2.9배 올린 설정 - Qwen3 4B는 기본 태그 대신
qwen3:4b-instruct를 받으세요. 기본 태그는 한국어로 물어도 영어로 "생각"만 하다 끝났습니다. → 같은 글 - 긴 문서를 넣을 때는
num_ctx를 문서보다 크게 잡으세요. 작으면 Ollama가 API 응답에 경고 없이 문서를 자르고, 모델은 잘린 부분을 물어도 틀린 숫자를 답했습니다("숫자만 답하라"는 조건이긴 했습니다). → 긴 문서 넣기
용도별로 고르면
| 용도 | 추천 | 근거 (실측) |
|---|---|---|
| 짧은 한국어 질문, 빠른 답 | Qwen3 4B-instruct 또는 Gemma 3 4B | 둘 다 초당 한글 약 85자. 설정 없이 전부 그래픽카드에 올라감 |
| 짧은 질문, 답 품질 우선 (상업 용도) | Qwen3 8B + num_gpu 99 |
한국어 과제 8개에서 4.15점(4B-instruct 4.10점, Gemma 3 4B 3.88점), 41 tok/s |
| 짧은 질문, 답 품질 우선 (개인·연구 용도) | EXAONE 3.5 7.8B + num_gpu 99 |
같은 과제에서 4.75점, 초당 한글 약 58자. 비상업 라이선스라 수익화·업무에는 못 씀 |
| 긴 문서 (약 4천 토큰 이상) | Qwen3 4B-instruct + num_gpu 99 |
약 8,500토큰 문서를 약 55초에 읽고 초당 약 51토큰으로 답함. 같은 조건의 8B는 약 12 tok/s |
| 긴 문서, 정확도 최우선 | Qwen3 8B + num_gpu 99 |
헌법 전문(약 1만 2천 토큰) 질문 채점에서 20점 만점에 20점. 대신 처음 읽는 데 약 4분 40초 |
| 긴 문서를 빨리 훑기 | Gemma 3 4B + num_gpu 99 |
같은 헌법 문서를 약 52초에 읽고 초당 51~61토큰으로 답함. 같은 채점에서 15점 |
품질 점수는 글마다 채점 대상과 기준이 달라서, 같은 글(같은 채점) 안에서만 비교하세요. 위 표의 4.15점·4.75점 같은 5점 만점 점수는 한국어 과제 채점, 20점 만점 점수는 헌법 질문 채점입니다. 예를 들어 같은 Qwen3 8B 답변이 한 글에서는 4.15점, 다른 글에서는 3.75점을 받았습니다. → 한국어 LLM 비교, 양자화 비교
설정별로 켤 것과 끌 것
| 설정 | 결론 | 실측 |
|---|---|---|
num_gpu 99 (8B) |
켜기 | 14~16 → 41 tok/s. 긴 문서에서도 끈 쪽(6.4~6.6 tok/s)보다 켠 쪽(12.1~12.2 tok/s)이 빨랐음 |
num_gpu 99 (4B-instruct, 긴 문서) |
켜기 | num_ctx 16384에서 Ollama가 21%를 CPU로 넘겼고, 켜니 답 속도 17.5~17.9 → 50.9~51.0 tok/s |
| 양자화 단계 (8B) | Q4_K_M | 짧은 질문 Q3 38.4 · Q4 42.8 · Q5 37.7 tok/s. 품질은 8개 과제로 갈리지 않음. 긴 문서만 Q3가 약 17% 빠름 → 양자화 비교 |
| Ollama KV 캐시 q8_0 (8B) | 끄기 | 긴 문서 답 속도 40~47% 느려짐 → KV 캐시 q8_0 |
| Ollama KV 캐시 q8_0 (4B-instruct) | 메모리가 모자랄 때만 | 속도는 거의 같고(측정 시각이 달라 참고용) 그래픽 메모리 약 980MB 절약 |
| llama.cpp 플래시 어텐션 | 끄지 말기 | 기본값(auto)에서 켜진 것으로 보임. 끄고 재니 8,192토큰 문맥에서 답 2.2 tok/s(메모리 부족 효과가 섞였을 수 있음) → 긴 문서 넣기 |
Ollama 대신 llama.cpp를 쓴다면
- NVIDIA 카드라면 CUDA 빌드가 답 쓰기(생성)에서 빠릅니다. winget으로 설치되는 Vulkan 빌드보다 11~20% 빨랐습니다(Qwen3 8B 46.6 대 39.8 tok/s). → llama.cpp CUDA vs Vulkan
- 문서 읽기(프롬프트 처리)는 반대로 Vulkan이 2.6~3.2배 빨랐습니다. 4,096토큰 문서를 CUDA는 약 40초, Vulkan은 약 12.5초에 읽었습니다. 다만 Vulkan은 8,192토큰에서 메모리 부족으로 실행되지 않았습니다. → 긴 문서 넣기
- Ollama와 llama.cpp CUDA 빌드의 생성 속도 차이는 모델에 따라 1~13%였습니다. 편의성을 생각하면 Ollama로도 충분합니다.
6GB의 한계: 어디서부터 느려지나
- 8B는 문맥 약 4천 토큰까지가 무난합니다. llama.cpp에서 채워 둔 문맥이 4,096토큰일 때 36.1 tok/s였다가 8,192토큰에서 13.2 tok/s로 떨어졌습니다. 계산상 모델 파일과 문맥 저장 공간을 더하면 6GB를 넘기 시작하는 지점이라, 그래픽 메모리가 모자라 느려진 것으로 봅니다(추정). → 긴 문서 넣기
- "100% GPU" 표시만 믿지 마세요.
ollama ps가 6GB 카드에서 모델 크기를 9.8GB로 표시하면서도 "100% GPU"라고 한 경우가 있었습니다. 작업 관리자의 "공유 GPU 메모리"도 참고가 되지만, 이 값만으로 원인을 단정하기는 어려웠습니다. → 긴 문서 넣기 - Ollama를 강제 종료하고 다시 켰다면
llama-server.exe가 남았는지 확인하세요. 남은 프로세스가 그래픽 메모리를 붙잡아 측정이 두 배 넘게 느려진 적이 있습니다. → KV 캐시 q8_0
문서 질의응답에서 배운 것
- 정확해야 하는 내용은 반드시 문서를 넣으세요. 헌법 조항을 문서 없이 물으니 세 모델이 20점 만점에 0~7점이었고, 없는 조문을 지어낸 답도 있었습니다. 문서를 넣으니 15~20점이 됐습니다. → 헌법 전문 질의응답
- 같은 문서에 여러 번 물을 때는 문서를 맨 앞에 두는 게 유리해 보입니다. Ollama가 앞에서 읽은 내용을 재사용해서, 두 번째 질문부터는 읽는 데 0.2~2.2초면 됐습니다(문서를 뒤에 둔 경우는 재 보지 않았습니다).
- 한국어 문서의 토큰 수는 "글자 수 ÷ 1.4"로 어림하면 됩니다(Qwen3, 공백 포함 글자 수 기준).
num_ctx를 정할 때 쓰세요. → 긴 문서 넣기
측정 환경
- CPU: Intel Core i9-10900K, RAM: 32GB (3200MHz)
- 그래픽카드: NVIDIA GeForce GTX 1660 SUPER 6GB, 드라이버 591.86, Windows 11 Home
- Ollama 0.34.4, llama.cpp CUDA 빌드 b11193 · Vulkan 빌드 b11175
측정은 원칙적으로 한 번에 한 가지 설정만 바꿔서 비교했고(예외는 각 글의 한계에 적었습니다), 품질 채점은 모델 이름을 가린 상태에서 했습니다. 측정 시각에 따라 같은 설정도 속도가 10% 안팎 달라진 적이 있어서, 각 글에서는 같은 시간대에 잰 값끼리 비교했습니다.
한계
- 그래픽카드 한 종류(GTX 1660 SUPER, 텐서 코어 없음)에서만 잰 결과입니다. RTX 카드나 8GB 이상 카드에서는 속도와 한계 지점이 달라질 수 있습니다.
- 품질은 과제 8개, 헌법 질문 12개 수준으로만 봤습니다. 긴 글쓰기나 복잡한 추론 품질은 따로 확인해야 합니다.
- 새 측정을 하면 이 글의 표도 함께 고치겠습니다.