Contents — find the section you need

클라우드 API를 사용하지 않고 자체 머신에서 대규모 언어 모델을 실행하는 것, 즉 "로컬 LLM"이 지난 몇 년 동안 실용화되었습니다. 이는 개방형 가중치 모델의 개선과 양자화 기법을 통한 모델 축소라는 두 가지 흐름이 융합된 결과입니다.

OllamaOllama
Hugging FaceHugging Face

이미지: Ollama / Hugging Face 로고, Wikimedia Commons

로컬 추론 개요

Diagram 1 · Use the button to switch views
LLM 추론은 텍스트를 반복적으로 토큰화하고, 트랜스포머 레이어를 실행하고, 확률 분포를 생성하고, 다음 토큰을 선택하는 반면, 양자화는 FP16 가중치를 더 작은 Q4 표현으로 압축합니다

다이어그램: Duskcoil. 생성 경로와 가중치 양자화의 역할이 별도로 표시됩니다.

로컬 LLM을 이해하는 핵심은 반복되는 추론 루프와 모델을 저장하는 데 필요한 메모리를 분리하는 것입니다. 텍스트는 토큰 ID가 되고, 변환기는 다음 토큰에 대한 분포를 계산하며, 선택된 토큰은 입력으로 반환됩니다. 한편, 양자화는 주로 가중치의 저장 및 계산 방식을 변경하여 모델이 제한된 RAM 또는 VRAM에 맞도록 합니다. 따라서 유용한 배포 비교를 위해서는 모델 이름뿐만 아니라 가중치 형식, 컨텍스트 길이에 따라 증가하는 KV 캐시, 그리고 사용 가능한 CPU/GPU 백엔드도 고려해야 합니다.

오픈 웨이트 모델의 급속한 성장

2026년 현재 오픈 웨이트 환경은 몇 달 단위로 계속해서 재편되고 있습니다. DeepSeek은 Flash 및 Pro 변형 제품 전반에 걸쳐 높은 효율성을 추구하고 있습니다. Qwen은 폭넓은 하드웨어 및 모델 크기 옵션을 바탕으로 "강력한 경쟁자"에서 "대학원 수준 추론에서 최고 수준"으로 평가받는 수준으로 도약했습니다. Meta의 Llama 4는 오픈 소스 모델에서 최대 1천만 토큰에 달하는 컨텍스트 윈도우를 제공합니다. 최근에는 Z.ai의 GLM-5.2가 코딩 에이전트 성능에서 큰 도약을 이루어 출시 후 며칠 만에 에이전트 프레임워크에 통합되었으며, Kimi K2.7 Code HighSpeed는 멀티모달 코딩 추론에서 6배의 속도 향상을 자랑합니다. 변화의 속도는 매우 빠릅니다.

벤치마크 결과 또한 중요한 변화를 보여줍니다. SWE-bench 스타일의 코딩 평가 도구에서 최고의 오픈 소스 모델과 주요 상용 모델 간의 격차가 한 자릿수 퍼센트 포인트로 좁혀졌으며, 일부에서는 일상적인 엔지니어링 작업에서는 그 격차가 사실상 사라졌다고 주장합니다.

기초: 어텐션 메커니즘

오늘날 모든 주요 대규모 언어 모델(Ollama에서 실행되는 모델 포함)은 트랜스포머 아키텍처를 기반으로 하며, 그 핵심은 셀프 어텐션입니다. 입력 시퀀스에서 파생된 쿼리 행렬 Q, 키 행렬 K, 값 행렬 V이 주어지면, 다음과 같이 스케일링된 내적 어텐션을 계산합니다.

\text{Attention}(Q, K, V) = \text{softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_k}} \right) V

QK^\top는 토큰 간의 관련성(유사성)을 나타내며, \sqrt{d_k}(키 차원의 제곱근)으로 나누는 것은 내적이 너무 커져서 소프트맥스의 기울기가 0이 되는 것을 방지합니다. 모델의 전체 파라미터 개수와 레이어 깊이에 걸쳐 이 연산을 반복하는 것이 바로 트랜스포머 추론의 실제 과정이며, 이러한 파라미터(가중치 행렬)의 대부분을 얼마나 축소할 수 있는지가 바로 다음에 설명할 양자화의 역할입니다.

선형 양자화의 기본 형태

GGUF, AWQ, GPTQ의 기본 개념은 선형 양자화입니다. 즉, 부동 소수점 가중치 x을 하위 비트 정수 q로 변환하는 것입니다.

q = \text{round}\left( \frac{x}{s} \right) + z

s은 스케일(단계별 실수 폭)이고, z은 제로 포인트(정수 표현에서 실수 0이 위치하는 지점)입니다. 이 두 값은 모두 보정 매개변수이며, 각 방법이 이 두 값을 결정하는 방식과 세분성(전체 모델, 레이어별, 가중치별)에 따라 성능 차이가 발생합니다.

양자화의 발전: GGUF, AWQ, GPTQ

모델 성능 향상과 더불어 양자화, 즉 모델 크기 축소는 필수적인 요소가 되었습니다. GGUF, AWQ, GPTQ와 같은 양자화 방식을 통해 모델 크기를 약 70%까지 줄이면서도 정확도 손실은 2% 미만으로 유지할 수 있게 되었습니다. 덕분에 320억 개의 파라미터를 가진 클래스 모델도 이제 16GB 메모리에 저장할 수 있게 되었습니다. 일반적인 소비자용 하드웨어에서 로컬 추론을 수행하면 최고 수준 모델의 70~85% 수준의 정확도를 달성할 수 있으며, 요청당 추가 비용은 발생하지 않습니다.

세 가지 형식은 각각 고유한 강점을 가지고 있습니다. GGUF(이전 GGML)는 llama.cpp 및 관련 생태계(Ollama, LM Studio 등)의 기본 형식으로, CPU와 GPU를 함께 사용하는 하이브리드 추론에 강점을 보입니다. GPTQ는 GPU 전용 환경에서 추론 속도가 뛰어나며, AWQ는 4비트 양자화에서 크기 대비 정확도가 가장 우수한 것으로 알려져 있습니다. 일반적인 로컬 개발 환경에서는 Ollama를 통한 GGUF 형식이 기본 선택으로 권장됩니다.

세 가지 양자화 방법의 기술적 차이점

GGUF, AWQ, GPTQ는 모두 모델 가중치를 16비트/32비트 부동 소수점에서 약 4비트로 축소하는 양자화 방법이지만, 기술적으로는 서로 다른 방식을 사용합니다.

GPTQ는 양자화를 최적화 문제로 취급합니다. 손실 함수(헤시안 행렬)의 2차 정보를 이용하여 어떤 가중치의 반올림 오차가 출력에 가장 큰 영향을 미치는지 판단한 후, 각 가중치를 순차적으로 양자화하면서 발생하는 오차를 같은 행에 있는 아직 양자화되지 않은 가중치에 보정합니다. 이 방법은 GPU 추론 성능에 초점을 맞추고 있으며, 70억 개의 파라미터를 가진 모델을 양자화하는 데 단일 A100 GPU에서 약 2~4시간이 소요됩니다.

AWQ는 이와 대조적으로 양자화 단계 자체보다는 "실제로 중요한 가중치가 무엇인지"를 파악하는 데 중점을 둡니다. 이 방법은 모델의 실제 활성화 값을 관찰하는 보정 단계를 거쳐 출력 품질에 큰 영향을 미치는 "주요" 가중치를 식별하고, 이러한 가중치를 높은 정밀도로 유지하면서 나머지 모든 가중치를 적극적으로 양자화합니다. GPTQ보다 적은 수의 보정 샘플(대략 128~512개, GPTQ는 보통 2,048개 이상)만 필요하므로 처리 속도가 훨씬 빠릅니다. 70억 개의 데이터셋을 사용하는 모델의 경우 약 10~30분 정도 소요됩니다.

GGUF(llama.cpp의 기본 형식)는 "K-quants"라는 방식을 사용하여 레이어별로 다른 비트 심도를 할당합니다. 예를 들어, 어텐션과 같이 중요도가 높은 레이어에는 6비트, 피드포워드 레이어에는 4비트 등을 할당하여 단순한 4비트 균일 양자화보다 비트당 더 높은 품질을 달성합니다. 대표적인 설정인 Q4_K_M은 원래 모델 품질의 약 92%를 유지하는 것으로 알려져 있습니다.

이러한 기술적 차이는 어떤 사용 사례에 어떤 방법이 적합한지를 결정하는 데 직접적인 영향을 미칩니다. AWQ는 GPU 전용 고속 추론에, GPTQ는 성숙한 GPU 생태계와 방대한 사전 양자화 모델 라이브러리가 가장 중요한 경우에, GGUF(Ollama 등을 통해)는 CPU/GPU 혼합 환경에서의 사용 편의성이 우선시될 때 사용됩니다.

llama.cpp: 로컬 추론 엔진의 작동 방식

Ollama를 포함한 많은 로컬 LLM 런타임의 이면에는 C/C++로 작성된 추론 엔진인 llama.cpp와 그 기반이 되는 텐서 라이브러리인 GGML이 있습니다. GGML은 PyTorch나 TensorFlow와 유사한 경량의 저의존성 텐서 연산 라이브러리로, 모델의 전체 연산을 "계산 그래프"로 표현합니다. 일부 텐서는 실제 데이터(예: 가중치)를 저장하는 반면, 다른 텐서는 다른 텐서 간의 연산 결과만을 나타내며, 실제 연산이 실행되기 전까지는 아무런 값도 가지지 않습니다. 이 연산 그래프는 CPU에서 직접 실행하거나, 가속기(NVIDIA GPU용 CUDA, Apple 하드웨어용 Metal 등)용 명령어로 변환하여 실행할 수 있습니다. 동일한 모델 파일을 다양한 하드웨어 구성에서 실행할 수 있는 이러한 이식성은 GGUF 포맷의 인기를 뒷받침하는 기술적 기반입니다.

성장세의 핵심 지표

이러한 확산 속도는 구체적인 수치에서 확인할 수 있습니다. Ollama의 월간 다운로드 수는 2023년 1분기 10만 건에서 2026년 1분기 5,200만 건으로 3년 만에 520배 증가했습니다. 같은 기간 동안 로컬 추론을 위해 GGUF 형식으로 포맷된 Hugging Face의 모델 수는 200개에서 13만 5천 개로 늘어났습니다. 이 모든 것을 뒷받침하는 프로젝트인 llama.cpp는 GitHub에서 7만 3천 개 이상의 스타를 획득했습니다.

2026년 하반기 모델 출시 현황

Ollama 공식 블로그를 살펴보면, 2026년 하반기에만 주요 모델들이 잇따라 출시되었습니다. 8월 10일, Meta Superintelligence Labs는 Apache 2.0 라이선스 하에 300억 개의 파라미터를 가진 멀티모달 모델 "Muse Glimmer"를 공개했습니다. 바로 다음 날인 8월 11일에는 NVIDIA가 다단계 에이전트 작업을 위해 설계된 300억 파라미터 모델 "Nemotron 3.5 Lightning"을 발표했습니다. 6월 29일에는 Gemma 4가 Apple Silicon의 MLX 런타임에서 최대 90% 더 빨라지는 업데이트가 적용되어 코딩 에이전트 사용 사례의 실행 속도 향상을 위한 노력이 계속되었습니다. Ollama는 7월 9일 8,800만 달러 규모의 투자 유치를 발표했으며, 개발자 사용자 수가 890만 명에 달했다고 밝혔습니다. 오픈 웨이트 모델 생태계는 단순히 "모델을 출시하는" 단계를 넘어 진정한 상용 인프라로 발전하고 있습니다.

양자화의 최첨단: 새로운 선택지, NVFP4

GGUF, AWQ, GPTQ에 이어 NVIDIA의 블랙웰 아키텍처용으로 설계된 4비트 부동 소수점 포맷인 NVFP4에 대한 연구가 2026년까지 새로운 양자화 포맷으로 빠르게 성장했습니다. 2026년 6월에 발표된 한 연구에서는 블록 크기 16이 정확도와 저장 공간 측면에서 최적의 균형을 제공한다고 보고했으며, 스윕 검색을 통해 초기 블록 크기 값을 최적화하는 ScaleSweep(2026년 5월)을 비롯한 여러 방법들은 공격적인 양자화 방식을 사용하더라도 93% 이상의 정밀도 성능을 유지할 수 있음을 보여주었습니다. H-Scale(2026년 8월)과 같은 후처리 기법도 등장했는데, 이는 추론 시간 오버헤드 없이 2차 헤시안 기반 근사치를 사용하여 그룹별 스케일 값을 개선합니다. 이는 양자화 연구 자체가 "가중치를 얼마나 줄일 수 있을까"에서 "가중치를 줄인 후 정확도를 어떻게 회복할 수 있을까"로 전환되고 있음을 보여줍니다.

KV 캐시(생성 과정에서 과거 토큰의 중간 표현을 저장하는 메모리 영역으로, 컨텍스트가 길어질수록 용량이 커짐) 압축 또한 병행하여 발전하고 있습니다. SemKV(2026년 8월)는 중요도 점수에 따라 토큰별로 두 가지 정밀도 수준 중 하나를 동적으로 할당하여, 품질이 급격히 저하되는 "품질 절벽" 현상을 방지하면서 저장 공간을 6.0배 줄였으며, 최적화된 양자화기와 함께 사용할 경우 7.9배까지 줄일 수 있다고 보고했습니다. 긴 컨텍스트에 대한 로컬 추론에서 KV 캐시 압축은 가중치 양자화 자체만큼이나 중요한 실용적인 과제가 되고 있습니다.

이해도를 확인하세요
메모리에 가중치를 저장하는 것만으로 추론이 가능한가요?

KV 캐시, 작업 공간 및 런타임 오버헤드도 메모리를 소비합니다.

컨텍스트 길이와 동시 실행 수를 추정치에 포함하세요.

참고 자료

What to read next

Review the background의미론적 분할의 기술 동향Continue the series세계 모델의 기술 동향Explore another aspect of this field휴머노이드 로봇 기술 동향