VIDRAFT.
VIDRAFT / 인사이트 / 온디바이스 AI
온디바이스 AI

GPU 없이 대형 LLM을 돌릴 수 있을까

GPU 없이 CPU·폰·노트북에서 35B급 오픈 모델을 구동하는 온디바이스 AI. VIDRAFT POCKET은 가장 많이 내려받는 온디바이스 모델보다 CPU 디코딩 2.69배, 같은 품질로 실측됐습니다.

발행 2026-07-24읽는 시간 약 4분by VIDRAFT
핵심 답변

예, 가능합니다. 대형 언어모델을 4비트 양자화와 전문가 혼합(MoE)으로 압축하면 GPU 없이 폰·노트북·폐쇄망 서버의 CPU에서 구동할 수 있습니다. VIDRAFT POCKET은 35B급 오픈 모델을 GPU 없이 돌리며, 같은 품질에서 가장 많이 내려받는 온디바이스 모델보다 CPU 디코딩이 2.69배 빠른 것으로 실측됐습니다.

GPU 없이 LLM을 정말 돌릴 수 있나?

돌릴 수 있습니다. 가중치를 4비트 안팎으로 양자화하고 전문가 혼합(MoE)으로 활성 파라미터를 줄이면 연산·메모리 요구가 크게 낮아져, 일반 CPU와 통합 메모리만으로 추론이 가능합니다. llama.cpp(GGUF)와 애플 실리콘용 MLX가 대표 실행 기반입니다.

LLM이 GPU를 요구하는 이유는 수십억 가중치를 고정밀로 곱하기 때문입니다. 그러나 추론에서는 정밀도를 낮춰도 품질 손실이 작고, MoE는 토큰마다 일부 전문가만 켜므로 실제 연산량이 총 파라미터보다 훨씬 적습니다. 둘을 결합하면 26~35B급도 10~20GB로 줄어 최신 노트북 메모리에 들어갑니다.

온디바이스 AI의 실질 장점은?

프라이버시, 오프라인, 비용, 주권입니다. 데이터가 기기를 떠나지 않아 보안·규제에 강하고, 네트워크 없이 작동하며, 클라우드 추론 비용과 GPU 조달 부담이 사라집니다. 클라우드 AI가 못 들어가는 폐쇄망·국방·의료에서 특히 결정적입니다.

클라우드 LLM은 모든 입력을 외부 서버로 보냅니다. 온디바이스 추론은 입력·출력이 기기 안에 머물러 기밀 처리에 근본적으로 유리하고, 인터넷 없는 현장에서도 동작합니다. 이는 데이터 반출이 금지된 공공·규제 영역에서 주권형 AI의 전제 조건입니다.

POCKET의 실측 성능은?

같은 품질 목표에서 CPU 디코딩 2.69배, 단일 소비자 GPU 디코딩 2.22배 빠른 것으로 측정됐습니다. 답변 품질은 표준 평가에서 대등(동률)했습니다. 다만 8k처럼 아주 긴 프롬프트의 사전처리(prefill)는 0.41배로 오히려 느려, 이 축은 정직하게 함께 공개합니다.

POCKET은 구글 오픈 모델 Gemma를 한국어에 맞춰 조정해 GGUF·MLX로 배포한 온디바이스 라인입니다. 사용자가 체감하는 토큰 생성(디코딩) 속도에서 큰 우위를 보이면서 품질을 지켰다는 점이 핵심이며, 채팅·에이전트·중단문에 강하고 장문 일괄처리에는 트레이드오프가 있습니다.

어디에 쓰면 좋은가?

손 안의 폰, GPU 없는 노트북, 인터넷이 차단된 폐쇄망 서버입니다. 특히 국방·의료·행정처럼 데이터를 외부로 보낼 수 없어 클라우드 AI가 진입할 수 없는 영역이 온디바이스·주권형 AI의 핵심 시장입니다.

온디바이스 모델은 개인 기기 비서, 오프라인 현장 도구, 규제가 엄격한 조직의 내부 AI로 확장됩니다. GPU 인프라 없이 최신 언어모델 능력을 '데이터가 머무는 곳'에 직접 가져다 놓을 수 있기 때문입니다.

자주 묻는 질문

정말 스마트폰에서도 되나요?
됩니다. 양자화된 GGUF 모델은 최신 스마트폰 통합 메모리에서 구동되며, 애플 실리콘에서는 MLX로 실행됩니다. 모델 크기와 기기 메모리에 따라 속도·최대 컨텍스트가 달라집니다.
품질은 클라우드 대형 모델보다 떨어지지 않나요?
최상위 클라우드 모델과 동급은 아닙니다. POCKET은 '온디바이스에서 실용적인 35B급'을 목표로 하며, 같은 급 대표 온디바이스 모델과 품질이 대등하면서 속도가 앞선다는 점이 차별점입니다.
사전처리(prefill)가 느리다는 게 무슨 뜻인가요?
긴 프롬프트를 처음 읽어들이는 단계가 상대적으로 느리다는 뜻입니다. 짧은·중간 대화에서는 영향이 작지만 수천 토큰 문서를 한 번에 넣는 작업에서는 체감될 수 있습니다.

참고 출처

관련 글

LLM 기술
AI 모델 양자화란 무엇인가 — 4비트로 줄여도 똑똑할까
LLM 기술
훈련 없이 AI 모델을 더 똑똑하게 만들 수 있을까 — 모델 병합
피지컬 AI
펌웨어를 안 바꾸고 로봇에 한국어를 가르칠 수 있을까
↖ 홈 — vidraft.net

본 글은 VIDRAFT의 공개 실측 데이터와 외부 출처를 근거로 작성됐습니다. 성능 수치는 명시된 조건에서의 측정값이며 환경에 따라 달라질 수 있습니다.