로컬 AI 실측 노트

헌법 전문을 통째로 넣고 물어봤다: 6GB 로컬 LLM, 문서 없이는 0~7점, 문서를 주면 15~20점

2026-09-27

로컬 LLM에 긴 문서를 넣고 질문하면 정말 문서를 읽고 답할까요, 아니면 원래 알던 지식으로 답할까요? 대한민국 헌법 전문(130개 조, 약 1만 8천 자)을 GTX 1660 SUPER 6GB에서 세 모델에 통째로 넣고 질문 12개를 던졌습니다. 같은 질문을 문서 없이도 물어서 비교했습니다.

결론부터 정리하면 이렇습니다.

한눈에 보는 결과

모델 문서 있음: 내용 (20점) 문서 있음: 조항 번호 (10개) 문서 없음: 내용 (20점) 없는 규정 질문 (4점) 처음 읽는 시간 답 쓰는 속도
Qwen3 8B (num_gpu 99) 20 9 7 4 / 4 276.6~280.0초 4.0~6.0 tok/s
Qwen3 4B-instruct (num_gpu 99) 18 10 0 4 / 4 114.1초 25.3~32.8 tok/s
Gemma 3 4B (num_gpu 99) 15 7 2 4 / 4 (문서 없이 3 / 4) 51.5초 51.4~61.3 tok/s

테스트 환경과 방법

문서는 위키문헌의 대한민국헌법 (제10호)에서 전문과 제1조~제130조를 받아 위키 문법만 걷어낸 것입니다(부칙 제외). 헌법·법률은 저작권법 제7조에 따라 보호받지 않는 저작물입니다.

질문 방식은 문서 전체 → "위 문서만 근거로 다음 질문에 한국어로 짧게 답하세요. 해당 조항 번호(제○조)도 함께 적으세요. 문서에 답이 없으면 "문서에 없음"이라고만 답하세요. 질문:" → 질문 순서로 넣었습니다. 문서 없는 질문은 "대한민국 헌법에 관한 다음 질문에 알고 있는 대로 … 헌법에 그런 규정이 없으면 '헌법에 없음'이라고만 답하세요."로 바꿨습니다. 질문마다 따로 요청을 보냈습니다.

문서 없이는 정확히 답하지 못했다

문서 없이 물었을 때의 답을 보면, 세 모델 모두 헌법 내용을 정확히 답하지 못했습니다. 다만 지시문에 "헌법에 없음"이라는 선택지를 줬기 때문에, 모르는 게 아니라 쉽게 그 답으로 피했을 가능성도 있습니다.

유명한 문서라도 "모델이 알고 있겠지"라고 기대하기 어렵다는 뜻입니다. 법조문·규정·계약서처럼 정확해야 하는 내용은 문서를 직접 넣어 주는 것이 필수였습니다.

문서를 넣으면: 8B가 가장 정확, 4B-instruct도 거의 같았다

질문 (정답 조항) Qwen3 8B Qwen3 4B-instruct Gemma 3 4B
영토 (제3조) 맞음 조항 번호만 답함(1점) 맞음
정당 해산 제소 (제8조) 맞음 맞음 맞음
국회의원 수 하한 (제41조) 맞음 맞음 맞음
법률안 공포 기한 (제53조) 맞음 맞음 맞음
후보 1명일 때 당선 조건 (제67조) 맞음 엉뚱한 항을 인용했다가 정정(1점) 조항 번호만 틀리게 답함
대통령 출마 나이 (제67조) 맞음 맞음 맞음
일반사면 요건 (제79조) 내용 맞음, 조항 틀림(제29조) 맞음 맞음
일반 법관 임기 (제105조) 맞음 맞음 대통령 임기 조문을 답함
헌법재판관 선출·지명 인원 (제111조) 맞음 맞음 내용 맞음, 조항 틀림(제98조)
헌법개정 국민투표 기한·의결 정족수 (제130조) 맞음 맞음 30일은 맞음, 정족수를 과반수로 틀림(조항도 제129조로 틀림)
대통령 연봉 (없음) 문서에 없음 문서에 없음 문서에 없음
국회의원 선거일 (없음) 문서에 없음 문서에 없음 문서에 없음

속도: 처음 한 번만 오래 걸린다

모델 문서를 센 토큰 수 처음 읽는 시간 두 번째 질문부터 읽는 시간 답 쓰는 속도
Qwen3 8B 12,204~12,228 276.6초 / 280.0초 (2회) 1.1~2.2초 4.0~6.0 tok/s
Qwen3 4B-instruct 12,196~12,220 114.1초 0.3~0.7초 25.3~32.8 tok/s
Gemma 3 4B 11,726~11,753 51.5초 0.2~0.3초 51.4~61.3 tok/s

측정 직전 그래픽 메모리 사용량이 평소(약 600MB)보다 높았습니다(8B 첫 측정 2,449MB, 4B-instruct·Gemma 약 1,060~1,140MB). 그래서 8B는 1,359MB 상태에서 한 번 더 쟀는데, 읽기 280.0초, 답 초당 4.0~6.0토큰으로 첫 측정과 거의 같았습니다. 이 정도 차이는 속도에 큰 영향을 주지 않은 것으로 봅니다. 두 번 잰 8B의 답 12개는 글자 하나까지 같았습니다.

6GB 그래픽카드로 문서 질의응답을 한다면

한계