로컬 AI 실측 노트

Qwen3 '생각 모드' 6GB 실측: 답은 4.7~5.6배 늦고 점수는 뚜렷이 오르지 않았다

2026-09-30

Qwen3는 답하기 전에 속으로 "생각"을 길게 쓰는 기능(thinking)이 있습니다. 어려운 문제에서는 이게 정답률을 올린다고 알려져 있는데, 6GB 그래픽카드에서 평범한 한국어 일(이메일·요약·번역 등)을 시킬 때도 켤 만할까요? GTX 1660 SUPER 6GB에서 Qwen3 4B·8B·14B로 생각을 켜고 끈 채 같은 한국어 과제 8개를 풀게 하고, 걸린 시간과 답 품질(이름 가린 채점)을 비교했습니다. 설정은 두 가지로 쟀습니다. 매번 같은 답이 나오는 temperature 0, 그리고 Qwen이 권하는 설정(2회씩, 14B는 1회)입니다.

결론부터 정리하면 이렇습니다.

걸린 시간

모델별 답 하나 평균 시간. 4B instruct 2.5초, 생각 전용 37.7초, 8B 3.4초→16.0초, 14B 23.7초→132.3초
한국어 과제 8개의 답 하나당 평균 시간(모델 불러오는 시간 제외, 여러 번 잰 값의 평균). 파란색은 생각 끄기, 주황색은 생각 켜기.
모델 (설정) 생각 답 하나 평균 시간 (잰 횟수) 생성 토큰 (과제당) 그중 생각 (글자) 답 쓰는 속도
4B-instruct (전부 GPU) 없음 2.1~2.7초 (3회) 157 0 73~78 tok/s
4B 생각 전용 (qwen3:4b, 전부 GPU) 항상 37.0~38.4초 (4회) 2,396 7,526 62~71 tok/s
8B (num_gpu 99, 전부 GPU) 끄기 3.3~3.5초 (4회) 116 0 43~46 tok/s
8B (num_gpu 99, 전부 GPU) 켜기 15.5~16.4초 (4회) 654 1,801 42~44 tok/s
14B (num_gpu 24) 끄기 22.2~24.5초 (3회) 125 0 5.4~6.7 tok/s
14B (num_gpu 24) 켜기 121~145초 (3회) 688 1,891 3.6~6.1 tok/s

잰 횟수에는 temperature 0 두 번(같은 설정을 한 번 더 돌린 것 포함, 4B-instruct는 한 번)과 권장 설정 한두 번이 섞여 있습니다. 토큰·글자 수는 그 평균입니다.

답 품질: 생각을 켜도 뚜렷이 나아지지 않았다

과제 8개(이메일 다듬기·요약·번역·사실 질문·계산·코딩·맞춤법·설명)의 최종 답만 모았습니다. 과제마다 16가지 답(모델·생각·설정 조합)의 순서를 섞고 이름과 설정을 가린 뒤, 서로 결과를 보지 않는 채점자 둘(Claude)이 1~5점을 매겨 평균냈습니다. 두 채점자 점수는 128개 중 107개가 같았고, 2개를 빼면 모두 1점 차이 안이었습니다.

설정별 평균 (5점 만점)

모델 생각 temperature 0 권장 설정 1회차 권장 설정 2회차 평균
4B-instruct 없음 3.75 3.62 3.56 3.65
4B 생각 전용 항상 2.75 2.75 3.06 2.85
8B 끄기 3.94 3.81 3.62 3.79
8B 켜기 3.31 3.62 3.75 3.56
14B 끄기 3.12 3.38 — 3.25
14B 켜기 3.50 3.50 — 3.50

과제별 평균 (위 설정들을 합친 값)

과제 4B-instruct 4B 생각 전용 8B 끄기 8B 켜기 14B 끄기 14B 켜기
이메일 다듬기 3.2 2.3 3.8 3.5 3.5 4.0
요약 5.0 3.3 4.5 4.2 1.0 3.5
번역 3.5 1.0 4.3 4.3 5.0 3.5
사실 질문 3.0 2.3 2.0 1.3 1.0 1.0
계산 4.0 5.0 5.0 5.0 5.0 5.0
코딩 4.8 4.8 4.7 4.7 5.0 5.0
맞춤법 2.5 1.7 2.0 2.7 1.8 2.3
설명 3.2 2.3 4.0 2.8 3.8 3.8

4B는 태그를 골라야 한다

첫 측정 글에서 "4B 기본 태그는 한국어로 물어도 영어로 생각만 한다"고 적었는데, 이유가 분명해졌습니다. Ollama의 qwen3:4b는 태그 목록 기준으로 qwen3:4b-thinking-2507-q4_K_M과 같은 모델(ID 359d7dd4bcda)입니다. 생각 전용으로 나온 판이라, 이번에도 think: false를 보냈지만 답 자리에 영어 생각을 그대로 써 내려가다 700토큰에서 잘렸습니다(temperature 0·권장 설정 모두, 과제 8개 전부).

쓰고 싶은 것 받을 태그
생각 없이 바로 답하는 4B qwen3:4b-instruct (= qwen3:4b-instruct-2507-q4_K_M)
생각하는 4B qwen3:4b (= qwen3:4b-thinking-2507-q4_K_M)
켜고 끌 수 있는 모델 qwen3:8b, qwen3:14b (이번에 한 모델에서 켜기·끄기 모두 동작 확인)

태그 목록에는 문맥 길이가 40K로 적힌 qwen3:4b-q4_K_M도 따로 있습니다. 처음 나온 켜고 끄는 4B로 보이지만 이번에는 재지 않았습니다.

생각 켜고 끄는 법

Ollama 안내 기준입니다. 8B·14B처럼 켜고 끌 수 있는 모델에서 동작합니다.

curl http://localhost:11434/api/generate -d "{\"model\":\"qwen3:8b\",\"prompt\":\"hello\",\"stream\":false,\"think\":false}"

(Windows 명령 프롬프트(cmd)용입니다. PowerShell은 따옴표 처리 방식이 달라 이대로는 동작하지 않습니다.)

측정 환경과 방법

한계