GPU 없이 35B AI 모델을 CPU로 실행할 수 있나요?
VIDRAFT POCKET Box와 POCKET-35B로 GPU 없이 온디바이스에서 대형 언어 모델을 실행하는 방법과 성능.
네. VIDRAFT POCKET Box는 GPU가 전혀 없는 CPU 전용 어플라이언스로, 총 34.66B 파라미터 중 토큰당 약 3B만 활성화하는 Sparse MoE 모델 POCKET-35B를 로컬에서 실행합니다. Xeon 16스레드 CPU에서 IQ1_M 기준 27.0 tok/s를 기록했으며, 이는 개발사 자체 측정값(제3자 미검증)입니다.
GPU 없이 대형 언어 모델을 실행할 수 있나요?
POCKET-35B는 총 34.66B 파라미터 중 토큰당 약 3B만 활성화하는 Sparse MoE 구조로, Darwin-36B-Opus(Qwen3.5 계열 MoE)를 기반으로 합니다. 인도메인 전문가 프루닝으로 256개 전문가를 128개로 줄여 모델 크기를 절반으로 낮췄습니다. 수정하지 않은 업스트림 llama.cpp와 MLX에서 그대로 실행되며, 별도의 런타임 포크가 필요 없습니다.
POCKET-35B는 왜 CPU에서 더 빠른가요?
읽어야 할 가중치가 적을수록, 즉 하드웨어가 약할수록 MoE의 이점이 커집니다. 실제로 Xeon 16스레드 CPU에서 POCKET-35B는 IQ1_M 기준 27.0 tok/s로, 같은 크기의 1비트 Bonsai-27B(10.1 tok/s)보다 2.69배 빨랐습니다. MoE 인식 혼합정밀도 양자화로 한국어는 더 강하게 압축하고 영어는 더 강하게 프루닝합니다.
POCKET Box는 기기별로 얼마나 빠른가요?
H100에서는 197 대 89 tok/s로 동급 대비 2.22배였습니다. 모바일에서는 iPhone용 POCKET-EN이 혼합정밀도 GGUF 5.3GB, Android용 POCKET-KR이 MLX 2비트 5.1GB로 각각 88%, 94%의 라우팅 일관성을 보였습니다. 모든 수치는 명시된 조건에서 개발사가 직접 측정한 값이며 제3자 검증은 거치지 않았습니다.
POCKET-35B는 어떻게 설치하고 어떤 양자화를 써야 하나요?
POCKET-35B는 수정 없는 llama.cpp와 MLX에서 실행되므로 표준 도구 체인을 그대로 사용할 수 있습니다. 다만 IQ1_M 같은 극저비트 양자화는 속도는 빠르지만 한국어 출력 품질이 저하되므로 실사용에는 Q4 이상을 권장합니다. 벤치마크 수치는 개발사 자체 측정값으로 참고용입니다.
자주 묻는 질문
- POCKET Box에 GPU가 필요한가요?
- 아니요. POCKET Box는 GPU가 전혀 없는 CPU 전용 어플라이언스입니다.
- 아이폰이나 안드로이드에서도 실행되나요?
- 네. iPhone용 POCKET-EN은 5.3GB GGUF, Android용 POCKET-KR은 5.1GB MLX 2비트로 제공됩니다.
- 어떤 양자화를 권장하나요?
- 한국어 품질을 위해 Q4 이상을 권장합니다. IQ1 같은 극저비트는 속도는 빠르지만 한국어 출력이 저하됩니다.
관련 글
이 글은 VIDRAFT의 공개·실측 데이터와 외부 출처에 기반합니다. 성능 수치는 명시된 조건에서의 측정값이며 환경에 따라 달라질 수 있습니다.