로컬 AI 실측 노트

6GB 그래픽카드 로컬 LLM 총정리: 모델·설정·긴 문서, 실측 7편 요약

2026-09-27

GTX 1660 SUPER 6GB 한 대로 로컬 LLM을 이틀 동안 110개가 넘는 PC 작업(모델 받기·설정 변경 포함)으로 돌려 보며 7편의 글을 썼습니다. 이 글은 그 결과를 "무엇을 고르고, 무엇을 켜고, 무엇을 피할지" 기준으로 한 페이지에 모은 안내서입니다. 숫자는 모두 각 글에서 실제로 잰 값이고, 자세한 조건과 한계는 링크한 글에 있습니다.

먼저 이것만: 6GB에서 꼭 할 설정 세 가지

  1. 8B 모델을 Ollama로 쓴다면 num_gpu 99를 넣으세요. 기본 설정에서는 Ollama가 모델의 30%를 CPU 쪽에 둬서 14~16 tok/s였는데, 이 설정으로 전부 그래픽카드에 올리니 41 tok/s가 됐습니다(2.9배). → 8B 속도 2.9배 올린 설정
  2. Qwen3 4B는 기본 태그 대신 qwen3:4b-instruct를 받으세요. 기본 태그는 한국어로 물어도 영어로 "생각"만 하다 끝났습니다. → 같은 글
  3. 긴 문서를 넣을 때는 num_ctx를 문서보다 크게 잡으세요. 작으면 Ollama가 API 응답에 경고 없이 문서를 자르고, 모델은 잘린 부분을 물어도 틀린 숫자를 답했습니다("숫자만 답하라"는 조건이긴 했습니다). → 긴 문서 넣기

용도별로 고르면

용도 추천 근거 (실측)
짧은 한국어 질문, 빠른 답 Qwen3 4B-instruct 또는 Gemma 3 4B 둘 다 초당 한글 약 85자. 설정 없이 전부 그래픽카드에 올라감
짧은 질문, 답 품질 우선 (상업 용도) Qwen3 8B + num_gpu 99 한국어 과제 8개에서 4.15점(4B-instruct 4.10점, Gemma 3 4B 3.88점), 41 tok/s
짧은 질문, 답 품질 우선 (개인·연구 용도) EXAONE 3.5 7.8B + num_gpu 99 같은 과제에서 4.75점, 초당 한글 약 58자. 비상업 라이선스라 수익화·업무에는 못 씀
긴 문서 (약 4천 토큰 이상) Qwen3 4B-instruct + num_gpu 99 약 8,500토큰 문서를 약 55초에 읽고 초당 약 51토큰으로 답함. 같은 조건의 8B는 약 12 tok/s
긴 문서, 정확도 최우선 Qwen3 8B + num_gpu 99 헌법 전문(약 1만 2천 토큰) 질문 채점에서 20점 만점에 20점. 대신 처음 읽는 데 약 4분 40초
긴 문서를 빨리 훑기 Gemma 3 4B + num_gpu 99 같은 헌법 문서를 약 52초에 읽고 초당 51~61토큰으로 답함. 같은 채점에서 15점

품질 점수는 글마다 채점 대상과 기준이 달라서, 같은 글(같은 채점) 안에서만 비교하세요. 위 표의 4.15점·4.75점 같은 5점 만점 점수는 한국어 과제 채점, 20점 만점 점수는 헌법 질문 채점입니다. 예를 들어 같은 Qwen3 8B 답변이 한 글에서는 4.15점, 다른 글에서는 3.75점을 받았습니다. → 한국어 LLM 비교, 양자화 비교

설정별로 켤 것과 끌 것

설정 결론 실측
num_gpu 99 (8B) 켜기 14~16 → 41 tok/s. 긴 문서에서도 끈 쪽(6.4~6.6 tok/s)보다 켠 쪽(12.1~12.2 tok/s)이 빨랐음
num_gpu 99 (4B-instruct, 긴 문서) 켜기 num_ctx 16384에서 Ollama가 21%를 CPU로 넘겼고, 켜니 답 속도 17.5~17.9 → 50.9~51.0 tok/s
양자화 단계 (8B) Q4_K_M 짧은 질문 Q3 38.4 · Q4 42.8 · Q5 37.7 tok/s. 품질은 8개 과제로 갈리지 않음. 긴 문서만 Q3가 약 17% 빠름 → 양자화 비교
Ollama KV 캐시 q8_0 (8B) 끄기 긴 문서 답 속도 40~47% 느려짐 → KV 캐시 q8_0
Ollama KV 캐시 q8_0 (4B-instruct) 메모리가 모자랄 때만 속도는 거의 같고(측정 시각이 달라 참고용) 그래픽 메모리 약 980MB 절약
llama.cpp 플래시 어텐션 끄지 말기 기본값(auto)에서 켜진 것으로 보임. 끄고 재니 8,192토큰 문맥에서 답 2.2 tok/s(메모리 부족 효과가 섞였을 수 있음) → 긴 문서 넣기

Ollama 대신 llama.cpp를 쓴다면

6GB의 한계: 어디서부터 느려지나

문서 질의응답에서 배운 것

측정 환경

측정은 원칙적으로 한 번에 한 가지 설정만 바꿔서 비교했고(예외는 각 글의 한계에 적었습니다), 품질 채점은 모델 이름을 가린 상태에서 했습니다. 측정 시각에 따라 같은 설정도 속도가 10% 안팎 달라진 적이 있어서, 각 글에서는 같은 시간대에 잰 값끼리 비교했습니다.

한계