헌법 전문을 통째로 넣고 물어봤다: 6GB 로컬 LLM, 문서 없이는 0~7점, 문서를 주면 15~20점
로컬 LLM에 긴 문서를 넣고 질문하면 정말 문서를 읽고 답할까요, 아니면 원래 알던 지식으로 답할까요? 대한민국 헌법 전문(130개 조, 약 1만 8천 자)을 GTX 1660 SUPER 6GB에서 세 모델에 통째로 넣고 질문 12개를 던졌습니다. 같은 질문을 문서 없이도 물어서 비교했습니다.
결론부터 정리하면 이렇습니다.
- 문서 없이는 거의 못 맞혔습니다. 헌법처럼 유명한 문서도 20점 만점에 0~7점이었습니다. 틀린 답의 대부분은 "헌법에 없음"이라고 잘못 답한 것이었지만, "위도 170도선을 기준으로 한다"처럼 없는 조문을 지어낸 답도 있었습니다.
- 문서를 넣으면 크게 올랐습니다. Qwen3 8B 20점, Qwen3 4B-instruct 18점, Gemma 3 4B 15점이었고, 조항 번호도 대부분 맞혔습니다.
- 문서에 없는 내용을 물으면 세 모델 모두 "문서에 없음"이라고 답했습니다.
- 속도는 크게 달랐습니다. 약 1만 2천 토큰 문서를 처음 읽는 데 8B는 약 4분 40초, 4B-instruct는 약 1분 54초, Gemma 3 4B는 약 52초가 걸렸습니다. 같은 문서에 이어서 묻는 두 번째 질문부터는 읽기가 0.2~2.2초로 줄었습니다.
한눈에 보는 결과
| 모델 | 문서 있음: 내용 (20점) | 문서 있음: 조항 번호 (10개) | 문서 없음: 내용 (20점) | 없는 규정 질문 (4점) | 처음 읽는 시간 | 답 쓰는 속도 |
|---|---|---|---|---|---|---|
Qwen3 8B (num_gpu 99) |
20 | 9 | 7 | 4 / 4 | 276.6~280.0초 | 4.0~6.0 tok/s |
Qwen3 4B-instruct (num_gpu 99) |
18 | 10 | 0 | 4 / 4 | 114.1초 | 25.3~32.8 tok/s |
Gemma 3 4B (num_gpu 99) |
15 | 7 | 2 | 4 / 4 (문서 없이 3 / 4) | 51.5초 | 51.4~61.3 tok/s |
- 질문은 문서 앞(제3조)부터 끝(제130조)까지 흩어진 10개(제2장 기본권 부분에서는 묻지 않음)와, 헌법에 없는 내용 2개(대통령 연봉, 국회의원 선거일)입니다.
- 내용 점수는 질문마다 2점(맞음)·1점(일부만 맞음)·0점(틀림, 잘못된 "없음", 지어낸 답)입니다. 조항 번호는 인용한 조 번호가 맞으면 1점입니다(항 번호 실수는 봐줌).
- 채점은 AI 채점자 두 명(Claude)이 모델 이름을 가린 채 정답표와 대조해 따로 했습니다. 두 채점자의 점수는 모든 칸에서 같았습니다.
- 처음 읽는 시간은 첫 질문에서 문서 전체를 읽은 시간입니다. Qwen3는 문서를 약 1만 2천 2백 토큰, Gemma 3는 약 1만 1천 7백 토큰으로 셌습니다.
- 답 쓰는 속도는 12개 답 각각의 생성 속도 범위입니다. 답이 4~150토큰 정도로 짧아서, 긴 글을 쓸 때의 속도와는 다를 수 있습니다.
테스트 환경과 방법
- CPU: Intel Core i9-10900K, RAM: 32GB (3200MHz)
- 그래픽카드: NVIDIA GeForce GTX 1660 SUPER 6GB (6,144MB), 드라이버 591.86, Windows 11 Home
- Ollama 0.34.4, 모델:
qwen3:8b(Q4_K_M)에num_gpu 99를 넣은 모델,qwen3:4b-instruct(Q4_K_M),gemma3:4b - 설정:
num_ctx 16384(문서 없는 질문은 4096), temperature 0, seed 고정, 답 최대 400토큰, 생각 기능 끔(Qwen3)
문서는 위키문헌의 대한민국헌법 (제10호)에서 전문과 제1조~제130조를 받아 위키 문법만 걷어낸 것입니다(부칙 제외). 헌법·법률은 저작권법 제7조에 따라 보호받지 않는 저작물입니다.
질문 방식은 문서 전체 → "위 문서만 근거로 다음 질문에 한국어로 짧게 답하세요. 해당 조항 번호(제○조)도 함께 적으세요. 문서에 답이 없으면 "문서에 없음"이라고만 답하세요. 질문:" → 질문 순서로 넣었습니다. 문서 없는 질문은 "대한민국 헌법에 관한 다음 질문에 알고 있는 대로 … 헌법에 그런 규정이 없으면 '헌법에 없음'이라고만 답하세요."로 바꿨습니다. 질문마다 따로 요청을 보냈습니다.
문서 없이는 정확히 답하지 못했다
문서 없이 물었을 때의 답을 보면, 세 모델 모두 헌법 내용을 정확히 답하지 못했습니다. 다만 지시문에 "헌법에 없음"이라는 선택지를 줬기 때문에, 모르는 게 아니라 쉽게 그 답으로 피했을 가능성도 있습니다.
- Qwen3 4B-instruct는 12개 질문 모두 "헌법에 없음"이라고 답했습니다. 지어내지는 않았지만, 있는 내용도 없다고 한 셈입니다. 모든 답이 6토큰짜리 같은 문장이라, 생각해 보지 않고 피한 답에 가까워 보입니다.
- Qwen3 8B는 몇 개를 맞혔지만(내용 7점) 조항 번호는 하나도 못 맞혔습니다. 법률안 공포 기한 15일을 "제75조", 대통령 출마 나이 40세를 "제65조"라고 하는 식이었습니다. 영토를 물으니 "제2조에서 한반도와 그 부속도서와 인천, 부산, 울산…"처럼 도시 이름을 반복하다가 답 길이 한도(400토큰)에 걸렸습니다.
- Gemma 3 4B는 없는 조문을 지어냈습니다. 영토를 물으니 "헌법 제13조에서 '대한민국은 공전의 위도 170도선을 기준으로 하며…'"라고 답했습니다. 헌법재판소 재판관 중 국회 선출 인원도 실제(3인)와 다른 6명이라고 했습니다.
유명한 문서라도 "모델이 알고 있겠지"라고 기대하기 어렵다는 뜻입니다. 법조문·규정·계약서처럼 정확해야 하는 내용은 문서를 직접 넣어 주는 것이 필수였습니다.
문서를 넣으면: 8B가 가장 정확, 4B-instruct도 거의 같았다
| 질문 (정답 조항) | Qwen3 8B | Qwen3 4B-instruct | Gemma 3 4B |
|---|---|---|---|
| 영토 (제3조) | 맞음 | 조항 번호만 답함(1점) | 맞음 |
| 정당 해산 제소 (제8조) | 맞음 | 맞음 | 맞음 |
| 국회의원 수 하한 (제41조) | 맞음 | 맞음 | 맞음 |
| 법률안 공포 기한 (제53조) | 맞음 | 맞음 | 맞음 |
| 후보 1명일 때 당선 조건 (제67조) | 맞음 | 엉뚱한 항을 인용했다가 정정(1점) | 조항 번호만 틀리게 답함 |
| 대통령 출마 나이 (제67조) | 맞음 | 맞음 | 맞음 |
| 일반사면 요건 (제79조) | 내용 맞음, 조항 틀림(제29조) | 맞음 | 맞음 |
| 일반 법관 임기 (제105조) | 맞음 | 맞음 | 대통령 임기 조문을 답함 |
| 헌법재판관 선출·지명 인원 (제111조) | 맞음 | 맞음 | 내용 맞음, 조항 틀림(제98조) |
| 헌법개정 국민투표 기한·의결 정족수 (제130조) | 맞음 | 맞음 | 30일은 맞음, 정족수를 과반수로 틀림(조항도 제129조로 틀림) |
| 대통령 연봉 (없음) | 문서에 없음 | 문서에 없음 | 문서에 없음 |
| 국회의원 선거일 (없음) | 문서에 없음 | 문서에 없음 | 문서에 없음 |
- Qwen3 8B는 내용을 전부 맞혔고, 조항 번호만 하나 틀렸습니다.
- Qwen3 4B-instruct는 조항 번호를 모두 맞혔습니다. 다만 첫 질문에 "제3조"라고만 답해 내용이 빠졌고, 한 질문에서는 엉뚱한 항을 먼저 인용한 뒤 바로잡느라 답이 길어졌습니다(149토큰).
- Gemma 3 4B는 문서 중간 이후에서 흔들렸습니다. 문서 앞쪽(제3조~제53조) 질문 4개는 모두 맞혔지만, 제67조~제130조 질문 6개 중 4개에서 조항 번호만 답하거나, 다른 조문을 가져오거나, 조항 번호를 틀리거나, 정족수를 틀렸습니다.
속도: 처음 한 번만 오래 걸린다
| 모델 | 문서를 센 토큰 수 | 처음 읽는 시간 | 두 번째 질문부터 읽는 시간 | 답 쓰는 속도 |
|---|---|---|---|---|
| Qwen3 8B | 12,204~12,228 | 276.6초 / 280.0초 (2회) | 1.1~2.2초 | 4.0~6.0 tok/s |
| Qwen3 4B-instruct | 12,196~12,220 | 114.1초 | 0.3~0.7초 | 25.3~32.8 tok/s |
| Gemma 3 4B | 11,726~11,753 | 51.5초 | 0.2~0.3초 | 51.4~61.3 tok/s |
- Ollama는 앞부분이 같은 요청이면 읽은 내용을 재사용합니다. 문서를 맨 앞에 두고 질문만 바꿨더니, 두 번째 질문부터는 문서를 다시 읽지 않고 0.2~2.2초 안에 답을 시작했습니다. 같은 문서에 여러 번 물을 거라면 문서를 앞에, 질문을 뒤에 두는 편이 유리할 것으로 봅니다(문서를 뒤에 둔 경우는 재 보지 않았습니다).
- 8B는 긴 문서에서 느립니다. 처음 읽는 데 약 4분 40초, 답은 초당 4~6토큰이었습니다. 같은 8B가 문서 없이(
num_ctx 4096) 답할 때는 초당 22~30토큰이었습니다. 긴 문서 글에서는 약 8,600토큰 문서에서 읽기 110~113초, 답 초당 약 12토큰이었으니, 1만 2천 토큰대에서는 그보다 훨씬 가파르게 느려졌습니다. 6GB에서는 문맥 공간이 모자라 느려지는 것으로 보이지만, 원인을 확정하지는 못했습니다. 4B-instruct도 그 글의 약 8,500토큰 문서(초당 약 51토큰)보다 느린 초당 25~33토큰이었습니다. - Gemma 3 4B가 가장 빨랐습니다. 읽기는 8B보다 약 5.4배 빨랐고, 답은 약 11배 빨랐습니다.
측정 직전 그래픽 메모리 사용량이 평소(약 600MB)보다 높았습니다(8B 첫 측정 2,449MB, 4B-instruct·Gemma 약 1,060~1,140MB). 그래서 8B는 1,359MB 상태에서 한 번 더 쟀는데, 읽기 280.0초, 답 초당 4.0~6.0토큰으로 첫 측정과 거의 같았습니다. 이 정도 차이는 속도에 큰 영향을 주지 않은 것으로 봅니다. 두 번 잰 8B의 답 12개는 글자 하나까지 같았습니다.
6GB 그래픽카드로 문서 질의응답을 한다면
- 정확해야 하는 내용은 반드시 문서를 넣으세요. 문서 없이는 헌법조차 0~7점이었고, 없는 조문을 지어낸 경우도 있었습니다.
- 정확도가 가장 중요하면 Qwen3 8B(20점)입니다. 다만 1만 2천 토큰 문서를 처음 읽는 데 4분 넘게 걸립니다.
- 속도와 정확도의 균형은 Qwen3 4B-instruct +
num_gpu 99(18점, 조항 번호 10개 모두 정답)입니다. 처음 읽는 데 약 2분, 답은 초당 약 26토큰이었습니다. - 빨리 훑어보는 용도라면 Gemma 3 4B입니다. 가장 빨랐지만 문서 뒤쪽 질문에서 틀린 답이 섞였으니, 답과 조항을 원문에서 한 번 확인하세요.
- 같은 문서에 여러 번 물을 때는 문서를 맨 앞에 고정하세요. 두 번째 질문부터는 기다림이 거의 없습니다.
한계
- 문서 하나(헌법), 질문 12개, 질문당 답 하나(temperature 0)로만 본 결과입니다. 다른 종류의 문서나 더 어려운 추론 질문에서는 순위가 달라질 수 있습니다.
- 채점자 두 명이 같은 종류의 AI라, 두 점수가 완전히 같게 나온 것이 사람 채점자 두 명의 일치만큼 강한 근거는 아닙니다.
- 측정하는 동안 그래픽 메모리를 쓰는 다른 프로그램이 있었던 것으로 보입니다. 8B를 사용량이 다른 두 상태(2,449MB, 1,359MB)에서 쟀을 때 속도가 거의 같아서, 영향은 작다고 봤습니다.
- 문서 없는 질문은
num_ctx 4096, 문서 있는 질문은 16384로 조건이 달랐습니다. 비교한 것은 "문서를 줬는지"이고, 두 조건에서 모델·질문·설정의 나머지는 같습니다.