GPQA 다이아몬드 과학 벤치마크에서 1위 한국 LLM은 무엇일까?
비드래프트(VIDRAFT)의 Darwin-398B-JGOS가 GPQA 다이아몬드에서 90.9%를 기록하며 세계 3위, 한국 모델 중 1위에 올랐다 (베이스 모델 기준, 2026년 7월 스냅샷).
2026년 7월 기준, 비드래프트의 Darwin-398B-JGOS는 GPQA 다이아몬드에서 90.9%로 한국 모델 중 1위이며, 두 개의 중국 프런티어 모델(Kimi-K3 93.5, GLM-5.2 91.2)에만 뒤진 세계 3위다. 이는 베이스 모델 기준의 단일 벤치마크 결과다.
GPQA 다이아몬드 벤치마크란 무엇인가?
문항은 생물·화학·물리 분야에 걸쳐 있으며 각 분야 전문가가 작성하고, 웹 검색이 가능한 비전문가조차 풀기 어렵게 선별된다. 암기하거나 검색한 답에 강하게 저항하기 때문에, GPQA 다이아몬드는 대형 언어모델의 과학 추론 최전선을 측정하는 지표로 널리 사용된다.
Darwin-398B-JGOS는 GPQA 다이아몬드에서 몇 위인가?
더 높은 점수를 낸 모델은 두 개의 중국 프런티어 모델뿐이다 — Kimi-K3(93.5)와 GLM-5.2(91.2). Darwin은 DeepSeek-V4-Pro(90.1), 알리바바 Qwen3.5-397B(88.4), 엔비디아 Nemotron-3-Ultra-550B(87.9)를 앞선다. 그 다음 한국 모델은 Darwin에 약 4.6점 뒤져 있어, Darwin이 이 벤치마크에서 국내 선두임이 뚜렷하다.
Darwin-398B-JGOS는 어떻게 만들어졌나?
비드래프트는 Gemma-4와 Qwen-3.5 계열 모델을, 최적의 가중치 조합을 탐색하는 진화적 병합 과정을 통해 결합했다. 398B 규모의 모델을 백지에서 새로 학습하지 않고도, 상대적으로 적은 연산 예산(약 24 GPU)으로 GPQA 다이아몬드 세계 3위 결과를 얻은 것이다. 이는 정교한 모델 조합이 대규모 무차별 사전학습에 필적할 수 있음을 보여준다.
이 GPQA 다이아몬드 결과의 한계는 무엇인가?
GPQA 다이아몬드 점수는 평가 설정(프롬프트·샘플링·채점 방식)에 따라 유의미하게 달라질 수 있으며, 이 수치는 특정 시점(2026년 7월)의 베이스 모델 성능을 반영한다. 높은 GPQA 다이아몬드 점수는 뛰어난 과학 추론 능력을 시사하지만, 그것만으로 코딩·언어·안전성·실무 과제 전반에서의 우위를 뜻하지는 않는다.
자주 묻는 질문
- Darwin-398B-JGOS가 세계 1위 AI 모델인가?
- 아니다. Darwin은 GPQA 다이아몬드에서 90.9%로 세계 3위다. 두 개의 중국 프런티어 모델 Kimi-K3(93.5)와 GLM-5.2(91.2)가 더 높다. Darwin은 한국 모델 중에서는 1위다.
- 비드래프트는 Darwin을 처음부터 학습시켰나?
- 아니다. Darwin은 Gemma-4와 Qwen-3.5 계열 오픈 모델을 약 24대의 GPU로 진화적으로 병합해 만든 것으로, 백지 사전학습이 아니다. 비드래프트는 이를 '규모보다 방법'이라 부른다.
- GPQA 다이아몬드 90.9%가 Darwin이 전반적으로 최고 모델이라는 뜻인가?
- 아니다. 이는 베이스 모델 기준의 단일 벤치마크 스냅샷이다. GPQA 다이아몬드는 대학원 수준의 과학 추론을 측정하며 점수는 평가 설정에 따라 달라지므로, 전반적 역량에 대한 판정이 아니다.
관련 글
이 글은 VIDRAFT의 공개·실측 데이터와 외부 출처에 기반합니다. 성능 수치는 명시된 조건에서의 측정값이며 환경에 따라 달라질 수 있습니다.