VIDRAFT.
VIDRAFT / 인사이트 / 모델 추론 가속
모델 추론 가속

구글·허깅페이스 'Fast Gemma Challenge'에서 검증(VERIFIED) 1위를 한 AI는?

비드래프트(VIDRAFT)가 구글×허깅페이스 The Fast Gemma Challenge에서 510.58 TPS를 PPL 2.39로 달성해, 구글이 공식 검증(VERIFIED)한 기록 기준 세계 1위에 올랐다 (2026년 8월 스냅샷).

게시 2026-08-02약 2분 읽기VIDRAFT 제공
빠른 답변

2026년 8월 기준, 비드래프트는 구글×허깅페이스 'The Fast Gemma Challenge'에서 510.58 TPS(초당 생성 토큰)를 품질 지표 PPL 2.39로 달성했다. 리더보드 원시 속도 상위권(535.91 TPS 등)은 PPL 2.44로 품질 기준(2.40)을 넘겨 검증을 통과하지 못했고, 구글이 비공개 프롬프트셋으로 재검증(VERIFIED)한 기록 가운데 비드래프트가 세계 1위다. 이는 특정 조건에서의 검증된 단일 대회 결과다.

구글×허깅페이스 Fast Gemma Challenge 검증 리더보드
구글×허깅페이스 Fast Gemma Challenge 검증 리더보드 · https://huggingface.co/spaces/gemma-challenge/gemma-dashboard

Fast Gemma Challenge란 무엇인가?

구글과 허깅페이스가 공동 주최한 공개 경연으로, 구글의 오픈 모델 'Gemma'를 동일한 GPU(A10G) 위에서 누가 가장 빠르게 추론하는지를 초당 생성 토큰 수(TPS)로 겨룬다.

149개의 자율 AI 에이전트가 병렬로 참여해 계획 수립, 커스텀 커널 작성, 서빙 최적화, 벤치마크를 실시간으로 반복하며 순위를 다툰다. 참가진에는 허깅페이스와 구글 딥마인드 관계자도 포함돼, 사실상 세계 최고 수준의 추론 최적화 실력을 겨루는 무대다.

비드래프트는 이 대회에서 몇 위인가?

비드래프트는 510.58 TPS를 PPL 2.39로 달성했고, 구글이 공식 검증(VERIFIED)한 기록 가운데 세계 1위다.

비드래프트는 약 24대 규모의 GPU만으로 이 결과를 만들었다. 합성 워밍업 브리지, 커널 튜닝(CTK), 최적화된 서빙 설정 등 '같은 하드웨어를 더 잘 쓰는' 엔지니어링으로, 수천~수만 장의 GPU를 동원하는 글로벌 팀들이 참여한 검증 리더보드 정상에 올랐다.

왜 '원시 속도 1등'이 아니라 '검증 1위'가 중요한가?

이 대회는 속도만으로 이길 수 없다. 품질 지표 PPL이 2.40을 넘으면 실패이고, 주최 측이 비공개 프롬프트셋으로 재실행해 확인(VERIFIED)해야 실제 순위로 인정된다.

리더보드 상단의 원시 속도 기록(535.91·529.13 TPS 등)은 PPL이 2.44~2.46에 달해 품질 기준을 위반, 검증을 통과하지 못했다. 속도를 얻기 위해 모델 품질을 훼손하는 편법을 원천 차단한 것이다. 비드래프트는 510.58 TPS를 PPL 2.39로 — 품질을 조금도 희생하지 않고 — 달성했고, 구글의 재검증을 통과했다. 그래서 '검증된 기록 중 세계 1위'라는 표현이 정확하다.

추론 가속이 왜 중요하고, 이 결과의 한계는 무엇인가?

추론 가속은 곧 서버 비용 절감이자, GPU 없는 기기에서도 AI를 구동하는 온디바이스 AI의 토대다. 다만 이 수치는 특정 조건에서의 검증된 단일 대회 결과다.

같은 모델을 두 배 빠르게 돌리면 서버 비용은 절반이 되고, 노트북·스마트폰 같은 엣지 기기에서의 구동 가능성이 열린다. 비드래프트의 온디바이스 AI(POCKET)와 주권형 AI가 이 가속 기술 위에 서 있다. 한편 TPS/PPL 수치는 대회가 지정한 모델·하드웨어·프롬프트 조건에서의 측정값이며, 조건이 달라지면 결과도 달라질 수 있다. 이는 추론 속도라는 단일 축의 성과로, 모델 전반의 역량에 대한 최종 판정은 아니다.

자주 묻는 질문

비드래프트가 Fast Gemma Challenge에서 원시 속도 1등인가?
아니다. 원시 TPS만 보면 비드래프트보다 빠른 기록(535.91 TPS 등)이 있으나, 그 기록들은 품질 지표 PPL이 2.44 이상으로 품질 기준(2.40)을 위반해 검증을 통과하지 못했다. 비드래프트는 구글이 공식 검증(VERIFIED)한 기록 가운데 세계 1위다.
PPL 품질 게이트가 무엇인가?
PPL(Perplexity)은 답변 품질 지표로 낮을수록 좋다. 이 대회는 PPL이 2.40을 초과하면 실패로 처리해, 속도를 위해 모델 품질을 훼손하는 편법을 막는다. 비드래프트의 기록은 PPL 2.39다.
VERIFIED는 어떤 의미인가?
참가자가 올린 숫자가 그대로 순위가 되는 것이 아니라, 주최 측(구글×허깅페이스)이 비공개 프롬프트셋으로 결과를 다시 실행해 진위를 확인(VERIFIED)해야 실제 순위로 인정된다. 비드래프트의 510.58 TPS @ PPL 2.39는 이 재검증을 통과했다.

출처

관련 글

모델 추론
GPQA 다이아몬드 과학 벤치마크에서 1위 한국 LLM은 무엇일까?
온디바이스 AI
GPU 없이 35B AI 모델을 CPU로 실행할 수 있나요?
과학 AI
경구약의 장 흡수(HIA)를 가장 잘 예측하는 AI 모델은?
↖ 홈 — vidraft.net

이 글은 VIDRAFT의 공개·실측 데이터와 외부 출처에 기반합니다. 성능 수치는 명시된 조건에서의 측정값이며 환경에 따라 달라질 수 있습니다.