로컬 AI 실측 노트

6GB 그래픽카드 2026 소형 모델 실측: Gemma 4 E4B가 작년 8B보다 1.4배 빠르다

2026-10-05

지난달 말 6GB 총정리에서는 짧은 질문에서 답 품질을 우선하면 Qwen3 8B(num_gpu 99), 속도를 우선하면 Qwen3 4B-instruct를 권했습니다. 둘 다 2025년에 나온 모델입니다. 2026년에 나온 작은 모델로 바꿔도 될까요? GTX 1660 SUPER 6GB에서 Gemma 4 E2B·E4B, Qwen3.5 4B·9B를 Ollama로 돌려 속도를 재고, 지난 글들과 같은 한국어 과제 8개를 풀게 해 모델 이름을 가린 채 채점했습니다. 비교 대상은 작년 모델인 Qwen3 8B와 4B-Instruct-2507(Ollama 이름 qwen3:4b-instruct)이고, 점수표에는 지난 글의 14B 답도 함께 넣었습니다.

결론부터 정리하면 이렇습니다.

과제 8개를 한 번씩 푼 결과라 0.2~0.3점 차이는 우연일 수 있습니다. 그래서 점수보다는 속도와 그래픽 메모리 여유를 근거로, 6GB라면 작년 8B 대신 Gemma 4 E4B를 먼저 써 볼 만하다고 봅니다.

결과

모델 6개의 답 쓰는 속도와 한국어 과제 점수 막대그래프. 가장 빠른 것은 Gemma 4 E2B 93.4 tok/s, 점수가 가장 높은 것은 Gemma 4 E4B 4.25점, 6GB에 다 안 올라간 9B는 8.8 tok/s
왼쪽은 답 쓰는 속도(3회 평균), 오른쪽은 한국어 과제 8개 평균 점수(채점자 2명 평균). 파란색이 2026년 새 모델, 주황색이 작년 모델.
모델 답 속도 (tok/s) 초당 한글 과제 점수
Gemma 4 E2B 93.4 약 88자 4.00
Gemma 4 E4B 64.8 약 58자 4.25
Qwen3.5 4B 64.0 약 82자 3.31
Qwen3.5 9B 8.8 약 13자 3.81
(작년) Qwen3 8B, 전부 GPU 46.2 약 47자 3.75
(작년) Qwen3 4B-2507 76.9 약 84자 3.63
모델 파일 크기 CPU / GPU 분담 그래픽 메모리 (모델 몫)
Gemma 4 E2B 4.6GB 100% GPU 3.2GB (3.1GB)
Gemma 4 E4B 6.6GB 100% GPU 4.7GB (4.6GB)
Qwen3.5 4B 3.4GB 100% GPU 3.9GB (3.8GB)
Qwen3.5 9B 6.6GB 43% / 57% 4.6GB (4.4GB)
(작년) Qwen3 8B 5.2GB 100% GPU 5.5GB (5.4GB)
(작년) Qwen3 4B-2507 2.5GB 100% GPU 3.2GB (3.1GB)

토큰 속도와 읽는 속도는 다르다

같은 64 tok/s인데 한글은 Qwen3.5 4B가 초당 약 82자, Gemma 4 E4B는 약 58자였습니다. 작년 4B-2507은 토큰 속도가 76.9로 더 빠른데도 한글은 약 84자로 Qwen3.5 4B와 비슷했습니다. 한 토큰에 담기는 한글 수가 모델마다 다르기 때문입니다.

또 하나는 답의 길이입니다. 과제 8개에서 답 하나의 평균 길이가 Gemma 4 E4B는 약 255토큰(약 500자), 작년 8B는 약 120토큰(약 220자)이었습니다. Gemma 4는 이메일·번역에서 여러 안을 한꺼번에 쓰고, 코딩 답도 700토큰 상한까지 길게 써서 길어졌습니다. 그래서 답 하나를 받는 데 걸린 시간은 오히려 Gemma 4 E4B가 약 4.1초로 작년 8B(약 3.5초)보다 조금 길었습니다(모델 불러오는 시간 제외, 8B는 09-28 측정, E4B는 코딩 답이 700토큰에서 잘린 채로 잰 값).

한국어 과제 8개 점수

지난 글들과 같은 과제 8개(이메일 다듬기·요약·번역·사실 질문·계산·코딩·맞춤법·설명)입니다. 설정도 같습니다: temperature 0, seed 1, 생각 기능 끔, 문맥 4,096, 답 길이 최대 700토큰. 새 모델 4개는 10-04 밤에 풀었고, 작년 모델 3개는 09-28~29 밤에 같은 설정(당시 Ollama 0.34.4)으로 받아 둔 답을 다시 썼습니다.

채점은 이번에 새로 했습니다. 과제마다 모델 8개(아래 7개 + 다음 글에 쓸 모델 1개)의 답을 무작위로 섞고 이름을 가린 뒤, 서로 결과를 보지 않는 채점자 둘(Claude)이 1~5점을 따로 매겼습니다. 64개 답 중 57개가 같은 점수였고, 나머지 7개도 1점 차이였습니다.

과제 E4B E2B 3.5 9B 3.5 4B 8B 4B-2507 14B
이메일 다듬기 4.0 4.0 2.0 2.0 4.0 3.0 3.0
요약 4.0 5.0 5.0 3.5 5.0 5.0 1.0
번역 4.0 4.0 4.0 4.0 4.5 3.0 4.0
사실 질문 5.0 2.0 3.0 2.0 2.0 2.0 1.0
계산 5.0 5.0 5.0 5.0 5.0 5.0 5.0
코딩 4.0 4.0 4.0 5.0 4.0 5.0 5.0
맞춤법 5.0 5.0 3.0 1.0 2.0 3.0 2.0
설명 3.0 3.0 4.5 4.0 3.5 3.0 3.5
평균 4.25 4.00 3.81 3.31 3.75 3.63 3.06

표의 E4B·E2B는 Gemma 4, 3.5 9B·3.5 4B는 Qwen3.5, 8B·4B-2507·14B는 작년 Qwen3입니다. 작년 14B(Qwen3 14B)는 14B 글에서 쓴 24층 설정의 답입니다(속도는 그 글에서 24층 약 6.4~6.6 tok/s). 같은 답이라도 채점자도, 함께 섞인 답도 달라지면 점수가 달라집니다(작년 8B는 이번 3.75점, 14B 글 3.81점). 다른 글의 점수와 직접 비교하지 마세요.

따라 하기

Ollama 0.35.1 기준입니다(Gemma 4는 Ollama 0.30.9 이상, Qwen3.5는 0.17.1 이상이 필요하다고 ollama show에 나옵니다).

ollama pull gemma4:e4b
ollama run gemma4:e4b --think=false

측정 환경과 방법

한계