6GB 그래픽카드 한국어 LLM 비교: EXAONE·Gemma3·Qwen3 실측
같은 "초당 토큰 수"라도 한국어로 체감하는 속도는 모델마다 다릅니다. 모델마다 한국어 한 글자를 몇 토큰으로 쪼개는지가 달라서입니다. GTX 1660 SUPER 6GB에서 같은 한국어 질문으로 EXAONE 3.5, Gemma 3, Qwen3를 측정해 실제로 초당 몇 글자의 한글이 나오는지 비교했습니다.
결론부터 정리하면 이렇습니다.
- 7~8B급에서는 EXAONE 3.5 7.8B가 한글을 가장 빨리 썼습니다. 설정 한 줄(
num_gpu 99)을 넣으면 초당 한글 약 58자로, 같은 조건의 Qwen3 8B(약 42자)보다 1.4배 빨랐습니다. - 4B급에서는 Gemma 3 4B와 Qwen3 4B-instruct가 초당 한글 약 85자로 사실상 같았습니다. 둘 다 설정 없이 전부 그래픽카드에 올라갑니다.
- 답변 품질도 EXAONE 3.5 7.8B가 가장 높았습니다. 한국어 과제 8개를 모델 이름을 가리고 채점하니 5점 만점에 4.75점이었고, 사실·계산·맞춤법·코드 네 문제를 모두 맞힌 건 이 모델뿐이었습니다.
- EXAONE 3.5는 비상업 라이선스라서, 블로그 수익화·업무 자동화 같은 상업적 용도에는 모델도 답변도 쓸 수 없습니다. 상업 용도라면 Qwen3(8B 4.15점, 4B-instruct 4.10점)가 Gemma 3 4B(3.88점)보다 나았습니다.
한눈에 보는 결과
| 모델 · 설정 | 모델이 쓴 그래픽 메모리 | CPU/GPU 분담 | 생성 속도 | 초당 한글 | 토큰당 한글 |
|---|---|---|---|---|---|
| EXAONE 3.5 7.8B, 기본 설정 | 4,188MB | 21% / 79% | 22.9 tok/s | 28자 | 1.23 |
| EXAONE 3.5 7.8B, num_gpu 99 | 5,028MB | 100% GPU | 48.9 tok/s | 58자 | 1.18 |
| Qwen3 8B, num_gpu 99 | 5,225MB | 100% GPU | 41.4 tok/s | 42자 | 1.02 |
| Gemma 3 4B, 기본 설정 | 3,723MB | 100% GPU | 74.7 tok/s | 85자 | 1.14 |
| Qwen3 4B-instruct, 기본 설정 | 3,118MB | 100% GPU | 77.0 tok/s | 84자 | 1.09 |
| EXAONE 3.5 2.4B, 기본 설정 | 1,868MB | 100% GPU | 121.0 tok/s | 165자 | 1.36 |
- 모델이 쓴 그래픽 메모리는 측정 중 사용량에서 측정 직전 사용량(바탕화면 등이 쓰던 약 340~1,000MB)을 뺀 값입니다. 측정할 때마다 바탕화면 쪽 사용량이 달라서, 전체 사용량 대신 이 값으로 비교했습니다.
- 초당 한글·토큰당 한글은 답변의 한글 글자만 센 값입니다(공백·기호·영문 제외). 답변에서 한글이 차지한 비율은 61~71%였습니다. temperature 0, seed 고정이라 3회 모두 같은 답이 나오므로, 저장한 답변 하나로 비율을 계산했습니다.
- 3회 반복 측정의 편차는 모두 ±0.3 tok/s 이내였습니다.
- 생성 속도(tok/s)만 보면 Qwen3 4B-instruct가 Gemma 3 4B보다 빠르지만, Gemma가 토큰 하나에 한글을 조금 더 담아서 초당 한글은 비슷해집니다.
테스트 환경과 방법
- CPU: Intel Core i9-10900K, RAM: 32GB (3200MHz)
- 그래픽카드: NVIDIA GeForce GTX 1660 SUPER 6GB (6,144MB), 드라이버 591.86, Windows 11
- 실행기: Ollama 0.34.4, 모델은 Ollama 라이브러리의 기본 태그(exaone3.5, gemma3, qwen3)
질문은 모두 같은 한국어 문장("6GB 그래픽카드에서 양자화가 어떻게 대형 언어 모델을 실행할 수 있게 해 주는지 200단어 정도로 설명해 주세요")입니다. 256토큰 생성, temperature 0, seed 고정으로, 첫 실행(모델 불러오기)을 빼고 3회를 평균냈습니다. "초당 한글"은 답변에 들어 있는 한글 글자 수를 생성 시간으로 나눈 값입니다.
num_gpu 99가 필요한 모델, 필요 없는 모델
Ollama는 모델을 불러올 때 그래픽 메모리가 모자랄 것 같으면 일부를 CPU로 넘깁니다. 이 판단이 6GB 카드에서는 지나치게 보수적이었습니다.
- EXAONE 3.5 7.8B는 기본 설정에서 21%를 CPU로 넘겨 22.9 tok/s였습니다.
num_gpu 99로 전부 그래픽카드에 올리자 바탕화면 사용량까지 합쳐 5,371MB로 충분히 들어갔고 48.9 tok/s(2.1배)가 나왔습니다. - Qwen3 8B도 같은 현상으로 기본 14~16 tok/s → 41 tok/s였습니다(자세한 내용은 GTX 1660 SUPER 6GB 로컬 LLM 실측: 8B 속도 2.9배 올린 설정 참고).
- 4B 이하 모델은 기본 설정으로도 전부 그래픽카드에 올라가서 설정이 필요 없었습니다.
설정 방법은 ollama run exaone3.5:7.8b로 대화를 연 뒤 /set parameter num_gpu 99를 입력하거나, Modelfile에 PARAMETER num_gpu 99를 넣어 새 모델로 만들면 됩니다. 그래픽 메모리를 쓰는 게임이나 영상 편집을 같이 켜 두면 메모리가 모자랄 수 있으니 그럴 땐 설정을 빼세요.
답변 품질: 한국어 과제 8개 블라인드 채점
속도만으로는 고를 수 없어서, 일상에서 자주 쓰는 한국어 과제 8개를 다섯 모델에 똑같이 풀게 했습니다. 이메일 다듬기, 글 요약, 영어 번역, 사실 질문, 계산, 파이썬 코드, 맞춤법 교정, 쉬운 설명입니다(최대 700토큰, temperature 0).
채점은 모델 이름을 가리고 과제마다 답변 순서를 섞은 뒤, AI 채점자 두 명(Claude)이 따로 매겼습니다. 정확성·지시 이행·한국어 자연스러움을 각각 1~5점으로 매겼고, 계산·사실·코드·맞춤법은 정답과 직접 대조했습니다. 두 채점자의 점수는 120개 항목 모두 1점 이내로 일치했습니다. 사람이 아니라 AI가 채점했다는 점, 과제가 8개뿐이라는 점은 감안해서 보세요.
| 모델 | 정확성 | 지시 이행 | 한국어 | 평균 | 정답 대조 4문제 |
|---|---|---|---|---|---|
| EXAONE 3.5 7.8B | 4.75 | 4.94 | 4.56 | 4.75 | 4/4 |
| Qwen3 8B (num_gpu 99) | 3.81 | 4.88 | 3.75 | 4.15 | 2/4 |
| Qwen3 4B-instruct | 3.69 | 4.88 | 3.75 | 4.10 | 2/4 |
| Gemma 3 4B | 3.63 | 3.94 | 4.06 | 3.88 | 2/4 |
| EXAONE 3.5 2.4B | 3.13 | 4.06 | 3.88 | 3.69 | 2/4 |
틀린 곳은 이랬습니다.
- 사실 질문(세종시 출범 2012년, 훈민정음 반포 1446년): Qwen3 8B는 세종시를 2001년, Gemma 3 4B는 1989년, Qwen3 4B-instruct는 훈민정음을 1948년이라고 답했습니다. 두 EXAONE 모델만 둘 다 맞혔습니다.
- 계산(사과 5개, 20% 할인 → 1,600원): EXAONE 3.5 2.4B만 3개 가격에 할인을 적용해 960원이라고 틀렸습니다.
- 맞춤법(며칠, 어이없는, 웃음밖에, 괜찮아질 거예요): 네 곳을 모두 고친 건 EXAONE 3.5 7.8B뿐이었습니다. Qwen3 8B는 "안"을 빠뜨려 문장 뜻을 뒤집었고, Qwen3 4B-instruct는 "몇일"을 그대로 뒀습니다.
- 코드(순서를 유지한 중복 제거): 다섯 모델 모두 맞혔습니다.
- 요약: EXAONE 3.5 2.4B가 재사용과 재활용을 섞고, 원문에 없는 내용을 덧붙였습니다.
작은 모델일수록 사실과 맞춤법에서 틀리는 경우가 많았습니다. 사실 확인이 필요한 용도라면 어떤 모델이든 답을 그대로 믿지 말고 확인하는 편이 안전합니다.
라이선스를 먼저 확인하세요
- EXAONE 3.5: 공식 모델 카드 기준 "EXAONE AI Model License Agreement 1.1 - NC"입니다. 라이선스 3.1조가 모델뿐 아니라 모델이 만든 결과물(Output)까지 상업적 목적으로 쓰는 것을 금지합니다. 연구 결과를 공개하는 것은 허용됩니다. 그래서 이 글에도 EXAONE의 답변 원문은 싣지 않았습니다.
- Gemma 3: Gemma 이용 약관(2026년 4월 1일 개정판)을 따릅니다. 상업적 이용은 가능하지만, 금지 용도 정책을 지켜야 하고 모델을 재배포할 때는 약관 고지를 함께 넣어야 합니다.
- Qwen3: 모델 카드 기준 Apache 2.0으로, 상업적 이용에 제약이 가장 적습니다.
개인 공부나 취미로 쓴다면 속도와 품질이 모두 가장 좋았던 EXAONE이 좋은 선택입니다. 수익이 나는 곳에 쓴다면 Gemma 3나 Qwen3 중에서 골라야 하고, 이번 채점에서는 Qwen3가 조금 더 나았습니다.
6GB 그래픽카드 한국어용 추천 정리
| 용도 | 추천 | 초당 한글 | 품질 점수 |
|---|---|---|---|
| 개인 공부·취미 (비상업) | EXAONE 3.5 7.8B + num_gpu 99 | 약 58자 | 4.75 |
| 상업 용도, 품질 우선 | Qwen3 8B + num_gpu 99 | 약 42자 | 4.15 |
| 상업 용도, 속도·메모리 여유 우선 | Qwen3 4B-instruct | 약 84자 | 4.10 |
| 최대한 가볍게 (비상업) | EXAONE 3.5 2.4B | 약 165자 | 3.69 |
Gemma 3 4B는 속도는 Qwen3 4B-instruct와 같았지만 품질 점수가 조금 낮았고, 모델이 쓰는 그래픽 메모리도 약 600MB 더 많았습니다.