로컬 AI 실측 노트

GTX 1660 SUPER 6GB 로컬 LLM 실측: 8B 속도 2.9배 올린 설정

2026-09-26

6GB 그래픽카드로 로컬 LLM을 돌릴 때 가장 궁금한 건 "몇 B 모델까지 쓸 만한가"입니다. GTX 1660 SUPER에서 Qwen3 4B·8B·14B를 20번 넘게 측정했고, 예상과 다른 결과가 두 가지 나왔습니다.

  1. Ollama 기본 설정으로 8B를 돌리면 14~16 tok/s인데, 설정 한 줄(num_gpu 99)로 41 tok/s가 됩니다. 같은 질문끼리 비교하면 2.5~2.9배입니다. Ollama가 "6GB에 다 안 들어간다"고 판단해 30%를 CPU로 넘기지만, 실제로는 다 들어갔습니다.
  2. 4B의 기본 태그는 받지 마세요. 한국어로 물어도 영어로 "생각"만 하다가 끝납니다. 4B를 쓰려면 instruct 태그를 받아야 합니다.

한눈에 보는 결과

모델 · 설정 CPU/GPU 분담 생성 속도 한국어 질문 시 초당 한글
8B, 기본 설정 30% / 70% 14.4~16.3 tok/s 약 14자
8B, num_gpu 99 100% GPU 41.2~41.4 tok/s 약 42자
8B, num_gpu 99, 컨텍스트 8K 100% GPU 38.6 tok/s —
4B-instruct, 기본 설정 100% GPU 77.0 tok/s 약 84자
4B 기본 태그 100% GPU 74~77 tok/s 거의 0 (아래 설명)
14B, 기본 설정 59% / 41% 5.0 tok/s —

테스트 환경과 방법

질문은 두 가지를 썼습니다. 영어 질문 "Explain in about 200 words how quantization lets a large language model run on a GPU with 6GB of VRAM."과, 같은 뜻의 한국어 질문 "6GB 그래픽카드에서 양자화가 어떻게 대형 언어 모델을 실행할 수 있게 해 주는지 200단어 정도로 설명해 주세요."입니다. 생성 길이는 256토큰(한 번만 1,500토큰), temperature 0, seed 고정입니다. 모델을 불러오는 첫 실행은 빼고 이어서 3회를 평균냈습니다(답변 언어만 확인한 몇 번은 1회). ollama ps로 CPU와 그래픽카드 분담 비율을, nvidia-smi로 그래픽 메모리를 확인했습니다. 비교할 때는 모델, 설정, 컨텍스트 길이, 질문 언어, 모델 태그 중 한 가지만 다른 값끼리 비교했습니다. 모델 설명은 공식 모델 카드를 참고했습니다.

기본 설정에서 8B가 느린 이유

Ollama는 모델을 불러올 때 그래픽 메모리가 얼마나 남았는지 보고, 모자랄 것 같으면 일부 층(layer)을 CPU 쪽에 둡니다. 8B를 기본 설정으로 불러오면 ollama ps에 크기 6.0GB, 30%는 CPU, 70%는 그래픽카드로 나옵니다. 이 30% 때문에 속도가 14~16 tok/s로 떨어집니다.

그런데 num_gpu를 99로 줘서 모든 층을 그래픽카드에 올리라고 하면 전부 그래픽카드에 올라갑니다. 이때 그래픽 메모리 사용량은 바탕화면 등이 쓰던 양까지 합쳐 5,744MB / 6,144MB였습니다. 들어갈 자리가 있었는데 Ollama의 자동 계산이 여유를 크게 잡았던 겁니다.

ollama ps 결과를 비교하면 차이가 바로 보입니다.

# 기본 설정
NAME        SIZE      PROCESSOR          CONTEXT
qwen3:8b    6.0 GB    30%/70% CPU/GPU    4096

# num_gpu 99
NAME        SIZE      PROCESSOR          CONTEXT
qwen3:8b    5.6 GB    100% GPU           4096

num_gpu 설정하는 방법

FROM qwen3:8b
PARAMETER num_gpu 99

이렇게 만든 모델을 옵션 없이 돌려 보니 ollama show에 num_gpu 99가 들어가 있었고, 전부 그래픽카드에 올라가 43.8 tok/s가 나왔습니다. 옵션으로 줬을 때(41.2~41.4)보다 약간 빨랐는데, 이유는 확인하지 못했습니다.

다른 프로그램이 그래픽 메모리를 쓰고 있으면? 여유가 400~500MB뿐이라 걱정되는 부분이라 직접 시험했습니다. 다른 프로그램(작은 AI 모델을 띄운 llama-server)으로 그래픽 메모리를 약 0.8GB, 1.5GB 붙잡아 둔 상태에서 같은 8B를 돌렸습니다.

다른 프로그램이 잡은 메모리 8B, num_gpu 99 8B, 기본 설정
없음 41.2~41.4 tok/s 14.4~16.3 tok/s
약 0.8GB 38.3 tok/s 14.8 tok/s
약 1.5GB 38.5 tok/s 14.5 tok/s

불러오기가 실패하지는 않았고, 강제 설정은 약 7% 느려지는 데 그쳤습니다. 다만 붙잡아 둔 메모리를 그 프로그램이 실제로 쓰지 않고 있었기 때문에, 윈도우가 그 몫을 시스템 메모리로 밀어낸 것으로 보입니다. 게임처럼 그래픽 메모리를 계속 쓰는 프로그램과 같이 돌리면 결과가 더 나쁠 수 있으니, 그럴 때 느려지면 설정을 빼세요.

4B 기본 태그의 함정

qwen3:4b는 영어 질문에서 74 tok/s, 한국어 질문에서 77 tok/s로 가장 빨랐습니다. 그런데 한국어 질문의 답변을 열어 보니 질문에 대한 답이 아니었습니다. 256토큰 전부가 "Okay, so I need to explain…"으로 시작하는 영어 추론 과정이었고 한글은 거의 없었습니다(0.3%).

ollama show qwen3:4b를 보면 생각(thinking) 기능이 기본값으로 켜져 있다고 나옵니다. 반면 qwen3:4b-instruct 태그는 같은 속도(77.0 tok/s)로 질문을 받자마자 한국어로 답했습니다(한글 비율 71%). 8B 태그는 생각 끄기 옵션을 따라 바로 한국어로 답했습니다.

6GB 그래픽카드라면 이렇게 고르세요

한계와 다음 측정

속도는 질문 두 개(영어·한국어), 짧은 답변 기준의 결과이고, 품질은 과제 8개로만 본 것입니다. 다음에는 같은 모델을 RAM 8GB 노트북(Ryzen 7 8840HS 내장그래픽)에서 돌리면 어떤지, 양자화 단계를 바꾸면 6GB에서 무엇이 달라지는지 측정할 예정입니다.