VIDRAFT.
VIDRAFT / 인사이트 / 온디바이스 AI
온디바이스 AI

GPU 없이 35B AI 모델을 CPU로 실행할 수 있나요?

VIDRAFT POCKET Box와 POCKET-35B로 GPU 없이 온디바이스에서 대형 언어 모델을 실행하는 방법과 성능.

게시 2026-07-31약 2분 읽기VIDRAFT 제공
빠른 답변

네. VIDRAFT POCKET Box는 GPU가 전혀 없는 CPU 전용 어플라이언스로, 총 34.66B 파라미터 중 토큰당 약 3B만 활성화하는 Sparse MoE 모델 POCKET-35B를 로컬에서 실행합니다. Xeon 16스레드 CPU에서 IQ1_M 기준 27.0 tok/s를 기록했으며, 이는 개발사 자체 측정값(제3자 미검증)입니다.

GPU 없이 대형 언어 모델을 실행할 수 있나요?

가능합니다. POCKET Box는 GPU가 전혀 없는 CPU 전용 어플라이언스로 POCKET-35B를 온디바이스에서 구동하며, 최근 개발에 성공했습니다.

POCKET-35B는 총 34.66B 파라미터 중 토큰당 약 3B만 활성화하는 Sparse MoE 구조로, Darwin-36B-Opus(Qwen3.5 계열 MoE)를 기반으로 합니다. 인도메인 전문가 프루닝으로 256개 전문가를 128개로 줄여 모델 크기를 절반으로 낮췄습니다. 수정하지 않은 업스트림 llama.cpp와 MLX에서 그대로 실행되며, 별도의 런타임 포크가 필요 없습니다.

POCKET-35B는 왜 CPU에서 더 빠른가요?

CPU 추론은 메모리 대역폭에 좌우되는데, Sparse MoE인 POCKET-35B는 토큰당 0.66GB만 읽어 동일 크기 밀집 모델(Bonsai 3.5GB)보다 메모리 이동량이 훨씬 적기 때문입니다.

읽어야 할 가중치가 적을수록, 즉 하드웨어가 약할수록 MoE의 이점이 커집니다. 실제로 Xeon 16스레드 CPU에서 POCKET-35B는 IQ1_M 기준 27.0 tok/s로, 같은 크기의 1비트 Bonsai-27B(10.1 tok/s)보다 2.69배 빨랐습니다. MoE 인식 혼합정밀도 양자화로 한국어는 더 강하게 압축하고 영어는 더 강하게 프루닝합니다.

POCKET Box는 기기별로 얼마나 빠른가요?

개발사 자체 측정 기준으로 Xeon 16스레드 CPU 27.0 tok/s, H100 197 tok/s, Apple M3 Pro 18GB에서 Metal 25.4 tok/s(CPU 13.8)입니다.

H100에서는 197 대 89 tok/s로 동급 대비 2.22배였습니다. 모바일에서는 iPhone용 POCKET-EN이 혼합정밀도 GGUF 5.3GB, Android용 POCKET-KR이 MLX 2비트 5.1GB로 각각 88%, 94%의 라우팅 일관성을 보였습니다. 모든 수치는 명시된 조건에서 개발사가 직접 측정한 값이며 제3자 검증은 거치지 않았습니다.

POCKET-35B는 어떻게 설치하고 어떤 양자화를 써야 하나요?

Ollama, Docker, ModelScope, Hugging Face GGUF로 배포되며, 한국어 품질을 위해 IQ1 같은 극저비트 대신 Q4 이상을 권장합니다.

POCKET-35B는 수정 없는 llama.cpp와 MLX에서 실행되므로 표준 도구 체인을 그대로 사용할 수 있습니다. 다만 IQ1_M 같은 극저비트 양자화는 속도는 빠르지만 한국어 출력 품질이 저하되므로 실사용에는 Q4 이상을 권장합니다. 벤치마크 수치는 개발사 자체 측정값으로 참고용입니다.

자주 묻는 질문

POCKET Box에 GPU가 필요한가요?
아니요. POCKET Box는 GPU가 전혀 없는 CPU 전용 어플라이언스입니다.
아이폰이나 안드로이드에서도 실행되나요?
네. iPhone용 POCKET-EN은 5.3GB GGUF, Android용 POCKET-KR은 5.1GB MLX 2비트로 제공됩니다.
어떤 양자화를 권장하나요?
한국어 품질을 위해 Q4 이상을 권장합니다. IQ1 같은 극저비트는 속도는 빠르지만 한국어 출력이 저하됩니다.

출처

관련 글

과학 AI
경구약의 장 흡수(HIA)를 가장 잘 예측하는 AI 모델은?
모델 추론
GPQA 다이아몬드 과학 벤치마크에서 1위 한국 LLM은 무엇일까?
AI 안전·평가
AI는 자신이 모른다는 것을 알까? FINAL-Bench란 무엇인가?
↖ 홈 — vidraft.net

이 글은 VIDRAFT의 공개·실측 데이터와 외부 출처에 기반합니다. 성능 수치는 명시된 조건에서의 측정값이며 환경에 따라 달라질 수 있습니다.