6GB 그래픽카드 2026 소형 모델 실측: Gemma 4 E4B가 작년 8B보다 1.4배 빠르다
지난달 말 6GB 총정리에서는 짧은 질문에서 답 품질을 우선하면 Qwen3 8B(num_gpu 99), 속도를 우선하면 Qwen3 4B-instruct를 권했습니다. 둘 다 2025년에 나온 모델입니다. 2026년에 나온 작은 모델로 바꿔도 될까요? GTX 1660 SUPER 6GB에서 Gemma 4 E2B·E4B, Qwen3.5 4B·9B를 Ollama로 돌려 속도를 재고, 지난 글들과 같은 한국어 과제 8개를 풀게 해 모델 이름을 가린 채 채점했습니다. 비교 대상은 작년 모델인 Qwen3 8B와 4B-Instruct-2507(Ollama 이름 qwen3:4b-instruct)이고, 점수표에는 지난 글의 14B 답도 함께 넣었습니다.
결론부터 정리하면 이렇습니다.
- Gemma 4 E4B: 초당 64.8토큰으로 작년 8B(46.2)보다 1.4배 빨랐고, 그래픽 메모리는 약 0.8GB 덜 썼습니다. 과제 점수도 4.25점(5점 만점)으로 이번 비교에서 가장 높았습니다. 다만 8B(3.75점)와의 차이는 사실 질문과 맞춤법 두 과제에서 나왔고, 나머지 6개 과제만 보면 8B가 조금 높았습니다(4.33 대 4.00).
- Gemma 4 E2B는 93.4 tok/s로 가장 빨랐고 점수는 4.00점이었습니다.
- Qwen3.5 9B는 Ollama 기본 설정으로는 6GB에 다 안 올라갔습니다. 43%를 CPU에 두면서 8.8 tok/s까지 떨어졌습니다. 점수(3.81점)는 작년 8B와 비슷했습니다.
- Qwen3.5 4B는 작년 4B-2507보다 토큰 속도(64.0 대 76.9)도, 점수(3.31 대 3.63)도 낮았습니다. 맞춤법 과제에서 문장 뜻을 거꾸로 바꿨습니다.
- 새 모델 넷 모두 Ollama에서 '생각 기능'이 기본으로 켜져 있습니다. 이 글의 숫자는 전부 끈 상태입니다. 끄는 법은 아래 따라 하기에 적었습니다.
과제 8개를 한 번씩 푼 결과라 0.2~0.3점 차이는 우연일 수 있습니다. 그래서 점수보다는 속도와 그래픽 메모리 여유를 근거로, 6GB라면 작년 8B 대신 Gemma 4 E4B를 먼저 써 볼 만하다고 봅니다.
결과

| 모델 | 답 속도 (tok/s) | 초당 한글 | 과제 점수 |
|---|---|---|---|
| Gemma 4 E2B | 93.4 | 약 88자 | 4.00 |
| Gemma 4 E4B | 64.8 | 약 58자 | 4.25 |
| Qwen3.5 4B | 64.0 | 약 82자 | 3.31 |
| Qwen3.5 9B | 8.8 | 약 13자 | 3.81 |
| (작년) Qwen3 8B, 전부 GPU | 46.2 | 약 47자 | 3.75 |
| (작년) Qwen3 4B-2507 | 76.9 | 약 84자 | 3.63 |
| 모델 | 파일 크기 | CPU / GPU 분담 | 그래픽 메모리 (모델 몫) |
|---|---|---|---|
| Gemma 4 E2B | 4.6GB | 100% GPU | 3.2GB (3.1GB) |
| Gemma 4 E4B | 6.6GB | 100% GPU | 4.7GB (4.6GB) |
| Qwen3.5 4B | 3.4GB | 100% GPU | 3.9GB (3.8GB) |
| Qwen3.5 9B | 6.6GB | 43% / 57% | 4.6GB (4.4GB) |
| (작년) Qwen3 8B | 5.2GB | 100% GPU | 5.5GB (5.4GB) |
| (작년) Qwen3 4B-2507 | 2.5GB | 100% GPU | 3.2GB (3.1GB) |
-
Ollama 이름은
gemma4:e2b,gemma4:e4b,qwen3.5:4b,qwen3.5:9b입니다. -
속도는 같은 밤(10-04 22:32~22:37) 같은 질문으로 잰 값입니다. 모델마다 처음 불러오는 실행은 빼고 이어서 3회를 평균냈고, 3회 안의 차이는 모두 0.7 tok/s 이내였습니다.
- 그래픽 메모리는
nvidia-smi로 본 전체 사용량이고, 괄호는 측정 직전 사용량(이날 약 0.1~0.2GB)을 뺀 모델 몫입니다. 바탕화면·브라우저가 1GB쯤 쓰고 있으면 작년 8B는 6GB를 넘어 일부가 일반 메모리로 밀려날 수 있고, Gemma 4 E4B는 0.5GB쯤 여유가 남습니다. - CPU / GPU 분담은
ollama ps표시입니다. Gemma 4는ollama ps의 크기 칸이 224MB·255MB로 이상하게 나와서, 100% GPU는 Ollama의 표시로만 보세요. - 작년 8B는 지난 글들과 같이
num_gpu 99(전부 그래픽카드)로 쟀습니다. 첫 측정 글(09-27, Ollama 0.34.4)에서는 같은 조건으로 41.4 tok/s였는데 이번에는 46.2 tok/s가 나왔습니다(4B-2507은 77.0 → 76.9로 같음). Ollama 버전이 바뀌었고 측정 전 그래픽 메모리 사용량도 낮았지만, 어느 쪽 때문인지는 확인하지 못했습니다. - Qwen3.5 9B는 Ollama가 정한 기본 배치입니다. 그래픽 메모리를 4.6GB만 썼으니, 14B 글처럼 층 수(
num_gpu)를 직접 늘리면 빨라질 여지가 있습니다. 이번에는 재지 않았습니다. 또 이 질문에는 150토큰만 쓰고 끝냈습니다.
토큰 속도와 읽는 속도는 다르다
같은 64 tok/s인데 한글은 Qwen3.5 4B가 초당 약 82자, Gemma 4 E4B는 약 58자였습니다. 작년 4B-2507은 토큰 속도가 76.9로 더 빠른데도 한글은 약 84자로 Qwen3.5 4B와 비슷했습니다. 한 토큰에 담기는 한글 수가 모델마다 다르기 때문입니다.
- Qwen은 어휘가 약 15만 개(작년)에서 약 25만 개(Qwen3.5)로 늘어서, 한 토큰에 한글이 더 많이 담겼습니다(토큰당 한글 약 1.1자 → 1.3자, Qwen3.5-9B 설정).
- Gemma 4는 어휘가 더 큰데도 이번 답에서는 토큰당 한글이 약 0.9자로 적었습니다. 답에 마크다운 기호·영문이 많아 한글 비율이 53~55%로 낮았던 영향이 큽니다.
- "초당 한글"은 첫 측정 글과 같이 한글 글자만 센 값입니다(공백·기호·영문 제외, 마지막 답 기준).
또 하나는 답의 길이입니다. 과제 8개에서 답 하나의 평균 길이가 Gemma 4 E4B는 약 255토큰(약 500자), 작년 8B는 약 120토큰(약 220자)이었습니다. Gemma 4는 이메일·번역에서 여러 안을 한꺼번에 쓰고, 코딩 답도 700토큰 상한까지 길게 써서 길어졌습니다. 그래서 답 하나를 받는 데 걸린 시간은 오히려 Gemma 4 E4B가 약 4.1초로 작년 8B(약 3.5초)보다 조금 길었습니다(모델 불러오는 시간 제외, 8B는 09-28 측정, E4B는 코딩 답이 700토큰에서 잘린 채로 잰 값).
한국어 과제 8개 점수
지난 글들과 같은 과제 8개(이메일 다듬기·요약·번역·사실 질문·계산·코딩·맞춤법·설명)입니다. 설정도 같습니다: temperature 0, seed 1, 생각 기능 끔, 문맥 4,096, 답 길이 최대 700토큰. 새 모델 4개는 10-04 밤에 풀었고, 작년 모델 3개는 09-28~29 밤에 같은 설정(당시 Ollama 0.34.4)으로 받아 둔 답을 다시 썼습니다.
채점은 이번에 새로 했습니다. 과제마다 모델 8개(아래 7개 + 다음 글에 쓸 모델 1개)의 답을 무작위로 섞고 이름을 가린 뒤, 서로 결과를 보지 않는 채점자 둘(Claude)이 1~5점을 따로 매겼습니다. 64개 답 중 57개가 같은 점수였고, 나머지 7개도 1점 차이였습니다.
| 과제 | E4B | E2B | 3.5 9B | 3.5 4B | 8B | 4B-2507 | 14B |
|---|---|---|---|---|---|---|---|
| 이메일 다듬기 | 4.0 | 4.0 | 2.0 | 2.0 | 4.0 | 3.0 | 3.0 |
| 요약 | 4.0 | 5.0 | 5.0 | 3.5 | 5.0 | 5.0 | 1.0 |
| 번역 | 4.0 | 4.0 | 4.0 | 4.0 | 4.5 | 3.0 | 4.0 |
| 사실 질문 | 5.0 | 2.0 | 3.0 | 2.0 | 2.0 | 2.0 | 1.0 |
| 계산 | 5.0 | 5.0 | 5.0 | 5.0 | 5.0 | 5.0 | 5.0 |
| 코딩 | 4.0 | 4.0 | 4.0 | 5.0 | 4.0 | 5.0 | 5.0 |
| 맞춤법 | 5.0 | 5.0 | 3.0 | 1.0 | 2.0 | 3.0 | 2.0 |
| 설명 | 3.0 | 3.0 | 4.5 | 4.0 | 3.5 | 3.0 | 3.5 |
| 평균 | 4.25 | 4.00 | 3.81 | 3.31 | 3.75 | 3.63 | 3.06 |
표의 E4B·E2B는 Gemma 4, 3.5 9B·3.5 4B는 Qwen3.5, 8B·4B-2507·14B는 작년 Qwen3입니다. 작년 14B(Qwen3 14B)는 14B 글에서 쓴 24층 설정의 답입니다(속도는 그 글에서 24층 약 6.4~6.6 tok/s). 같은 답이라도 채점자도, 함께 섞인 답도 달라지면 점수가 달라집니다(작년 8B는 이번 3.75점, 14B 글 3.81점). 다른 글의 점수와 직접 비교하지 마세요.
- 틀린 내용 없이 사실 질문(세종시 출범 연도·훈민정음 반포 연도)을 다 맞힌 것은 Gemma 4 E4B 하나뿐이었습니다. 답: "세종특별자치시는 2012년에 출범했습니다. 훈민정음은 1443년에 창제되어 1446년에 반포되었습니다." Gemma 4 E2B는 세종시를 2000년, Qwen3.5 4B는 1998년, 작년 8B는 2001년으로 적었습니다. Qwen3.5 9B는 두 연도는 맞혔지만 1446년을 "조선 세조 원년"이라고 덧붙여 틀렸습니다(1446년은 세종 28년).
- 맞춤법 과제를 완벽하게 고친 것은 Gemma 4 둘뿐이었습니다. "몇일 → 며칠, 어의없는 → 어이없는, 웃음 밖에 → 웃음밖에, 괜찮아 질거에요 → 괜찮아질 거예요"를 모두 고쳤습니다. Qwen3.5 4B는 "웃음 밖에 안 나왔어요"를 "웃음이 나지 않았어요"로 바꿔 뜻을 뒤집었습니다.
- Qwen3.5 4B·9B 모두 이메일에서 메모의 뜻을 거꾸로 썼습니다. 메모는 "자료를 미리 보내 주면 검토하겠다"인데, "자료를 미리 보내 드리겠다"로 바꿨습니다.
- Qwen3.5 두 모델은 숫자·영문 뒤의 단위나 조사를 띄어 쓰는 버릇이 있었습니다("2012 년 7 월 1 일", "GPU 가", "RAM 으로"). 두 채점자 모두 번역 답에서 이 점을 지적했습니다.
- Gemma 4의 약점은 지시보다 많이 쓰는 것이었습니다. 이메일은 두 가지 안(Qwen3.5 9B도 이메일은 두 안을 썼습니다), 번역은 세 가지 안과 용어 풀이까지 붙였고, 코딩 답은 길어서 700토큰에서 잘렸습니다(코드는 잘리기 전에 이미 완성). 설명 과제에는 이모지가 섞였습니다. "한 가지만"이 필요하면 질문에 그렇게 적는 편이 좋습니다.
따라 하기
Ollama 0.35.1 기준입니다(Gemma 4는 Ollama 0.30.9 이상, Qwen3.5는 0.17.1 이상이 필요하다고 ollama show에 나옵니다).
ollama pull gemma4:e4b
ollama run gemma4:e4b --think=false
- 생각 기능 끄기: 새 모델 넷 모두
ollama show의 생각 기능 기본값이 켜짐(default true)입니다. 켜 두면 답 앞에 생각을 길게 써서 첫 글자가 늦게 나옵니다. 대화 중에는/set nothink, API로 부를 때는"think": false를 넣습니다(Ollama 안내). 생각을 켰을 때 얼마나 느려지는지는 작년 모델로 잰 생각 모드 글을 참고하세요(8B 기준 4.7배). - Gemma 4 E4B 파일은 6.6GB인데 그래픽 메모리는 약 4.7GB만 썼습니다. Gemma 4 E 모델은 층마다 따로 붙는 큰 임베딩 표(Per-Layer Embeddings)를 갖고 있고, 이 표는 "빠른 조회에만 쓰여" 실제로 계산하는 몫(유효 4.5B)이 전체(임베딩 포함 8B)보다 훨씬 작다고 모델 설명에 나옵니다. 파일에는 그림·소리 입력 부분도 들어 있습니다. Ollama가 이런 부분을 그래픽카드 밖에 두는 것으로 보이지만 직접 확인하지는 않았습니다.
- 입력은 Gemma 4 E 모델이 글·그림·소리, Qwen3.5가 글·그림(영상 포함)입니다. 이번 측정은 글만 썼습니다.
측정 환경과 방법
- CPU: Intel Core i9-10900K, RAM: 32GB (3200MHz), 그래픽카드: NVIDIA GeForce GTX 1660 SUPER 6GB (드라이버 591.86), Windows 11 Home
- Ollama 0.35.1. 새 모델은 Ollama 공식 이름의 기본 태그(Q4_K_M), 작년 8B는
qwen3:8b를num_gpu 99로 등록한 사본, 4B-2507은qwen3:4b-instruct - 모델: Gemma 4 E2B·E4B (2026-03-31 공개, Apache 2.0), Qwen3.5 4B·9B (2026-03 초 공개, 시리즈는 2026-02, Apache 2.0), Qwen3 8B·4B-Instruct-2507 (2025)
- 속도: 질문 "6GB 그래픽카드에서 양자화가 어떻게 대형 언어 모델을 실행할 수 있게 해 주는지 200단어 정도로 설명해 주세요.", 생성 최대 256토큰, temperature 0, seed 1, 생각 기능 끔, 문맥 4,096(Ollama 자동). 첫 실행 제외 3회 평균
- 측정 전에 다른 프로그램이 Ollama 모델을 올려 두지 않았는지, 그래픽 메모리 1.3GB 이하·CPU 30초 평균 25% 이하·남은 RAM 8GB 이상인지 확인했습니다(최대 30분 대기). 이날 PC에는 다른 프로그램이 함께 켜져 있었고, 확인 시점 CPU 사용률은 4~10%였습니다.
한계
- 과제 8개를 한 번씩만 풀었습니다. 긴 글쓰기, 긴 문서 요약, 여러 차례 대화에서는 순서가 바뀔 수 있습니다. 짧은 질문이라 흔들림이 크지만 질문을 읽는 속도(prompt)는 그래픽카드에 다 올라간 새 모델 3개가 초당 약 740~1,180토큰으로 작년 모델(약 2,570~3,430)보다 낮게 나왔습니다. 긴 문서를 넣을 때 차이가 날 수 있습니다.
- 채점자는 사람이 아니라 Claude 둘입니다. 사실·계산·맞춤법처럼 정답이 있는 과제는 정답을 주고 채점했습니다.
- 그래픽카드 한 종류(6GB)에서만 쟀습니다. 8GB 이상이면 Qwen3.5 9B도 다 올라갈 가능성이 커서 결과가 달라질 수 있습니다. 작년 Qwen3 모델의 그래픽 메모리는 메모리 계산기로 어림할 수 있습니다(Gemma 4·Qwen3.5는 아직 계산기에 없습니다).
- 작년 모델 3개의 답은 09-28~29에 받은 것이고, 이날 다시 잰 것은 8B·4B-2507의 속도뿐입니다. 지난 측정에서 같은 설정으로 두 번 받은 답이 과제 8개 모두 글자까지 같았던 적이 있어(생각 모드 글 근거 자료) 다시 받지 않았지만, 그때와 Ollama 버전이 달라 같은 답이 나온다는 보장은 없습니다.