로컬 AI 실측 노트

6GB 그래픽카드 한국어 LLM 비교: EXAONE·Gemma3·Qwen3 실측

2026-09-26

같은 "초당 토큰 수"라도 한국어로 체감하는 속도는 모델마다 다릅니다. 모델마다 한국어 한 글자를 몇 토큰으로 쪼개는지가 달라서입니다. GTX 1660 SUPER 6GB에서 같은 한국어 질문으로 EXAONE 3.5, Gemma 3, Qwen3를 측정해 실제로 초당 몇 글자의 한글이 나오는지 비교했습니다.

결론부터 정리하면 이렇습니다.

한눈에 보는 결과

모델 · 설정 모델이 쓴 그래픽 메모리 CPU/GPU 분담 생성 속도 초당 한글 토큰당 한글
EXAONE 3.5 7.8B, 기본 설정 4,188MB 21% / 79% 22.9 tok/s 28자 1.23
EXAONE 3.5 7.8B, num_gpu 99 5,028MB 100% GPU 48.9 tok/s 58자 1.18
Qwen3 8B, num_gpu 99 5,225MB 100% GPU 41.4 tok/s 42자 1.02
Gemma 3 4B, 기본 설정 3,723MB 100% GPU 74.7 tok/s 85자 1.14
Qwen3 4B-instruct, 기본 설정 3,118MB 100% GPU 77.0 tok/s 84자 1.09
EXAONE 3.5 2.4B, 기본 설정 1,868MB 100% GPU 121.0 tok/s 165자 1.36

테스트 환경과 방법

질문은 모두 같은 한국어 문장("6GB 그래픽카드에서 양자화가 어떻게 대형 언어 모델을 실행할 수 있게 해 주는지 200단어 정도로 설명해 주세요")입니다. 256토큰 생성, temperature 0, seed 고정으로, 첫 실행(모델 불러오기)을 빼고 3회를 평균냈습니다. "초당 한글"은 답변에 들어 있는 한글 글자 수를 생성 시간으로 나눈 값입니다.

num_gpu 99가 필요한 모델, 필요 없는 모델

Ollama는 모델을 불러올 때 그래픽 메모리가 모자랄 것 같으면 일부를 CPU로 넘깁니다. 이 판단이 6GB 카드에서는 지나치게 보수적이었습니다.

설정 방법은 ollama run exaone3.5:7.8b로 대화를 연 뒤 /set parameter num_gpu 99를 입력하거나, Modelfile에 PARAMETER num_gpu 99를 넣어 새 모델로 만들면 됩니다. 그래픽 메모리를 쓰는 게임이나 영상 편집을 같이 켜 두면 메모리가 모자랄 수 있으니 그럴 땐 설정을 빼세요.

답변 품질: 한국어 과제 8개 블라인드 채점

속도만으로는 고를 수 없어서, 일상에서 자주 쓰는 한국어 과제 8개를 다섯 모델에 똑같이 풀게 했습니다. 이메일 다듬기, 글 요약, 영어 번역, 사실 질문, 계산, 파이썬 코드, 맞춤법 교정, 쉬운 설명입니다(최대 700토큰, temperature 0).

채점은 모델 이름을 가리고 과제마다 답변 순서를 섞은 뒤, AI 채점자 두 명(Claude)이 따로 매겼습니다. 정확성·지시 이행·한국어 자연스러움을 각각 1~5점으로 매겼고, 계산·사실·코드·맞춤법은 정답과 직접 대조했습니다. 두 채점자의 점수는 120개 항목 모두 1점 이내로 일치했습니다. 사람이 아니라 AI가 채점했다는 점, 과제가 8개뿐이라는 점은 감안해서 보세요.

모델 정확성 지시 이행 한국어 평균 정답 대조 4문제
EXAONE 3.5 7.8B 4.75 4.94 4.56 4.75 4/4
Qwen3 8B (num_gpu 99) 3.81 4.88 3.75 4.15 2/4
Qwen3 4B-instruct 3.69 4.88 3.75 4.10 2/4
Gemma 3 4B 3.63 3.94 4.06 3.88 2/4
EXAONE 3.5 2.4B 3.13 4.06 3.88 3.69 2/4

틀린 곳은 이랬습니다.

작은 모델일수록 사실과 맞춤법에서 틀리는 경우가 많았습니다. 사실 확인이 필요한 용도라면 어떤 모델이든 답을 그대로 믿지 말고 확인하는 편이 안전합니다.

라이선스를 먼저 확인하세요

개인 공부나 취미로 쓴다면 속도와 품질이 모두 가장 좋았던 EXAONE이 좋은 선택입니다. 수익이 나는 곳에 쓴다면 Gemma 3나 Qwen3 중에서 골라야 하고, 이번 채점에서는 Qwen3가 조금 더 나았습니다.

6GB 그래픽카드 한국어용 추천 정리

용도 추천 초당 한글 품질 점수
개인 공부·취미 (비상업) EXAONE 3.5 7.8B + num_gpu 99 약 58자 4.75
상업 용도, 품질 우선 Qwen3 8B + num_gpu 99 약 42자 4.15
상업 용도, 속도·메모리 여유 우선 Qwen3 4B-instruct 약 84자 4.10
최대한 가볍게 (비상업) EXAONE 3.5 2.4B 약 165자 3.69

Gemma 3 4B는 속도는 Qwen3 4B-instruct와 같았지만 품질 점수가 조금 낮았고, 모델이 쓰는 그래픽 메모리도 약 600MB 더 많았습니다.