VIDRAFT.
VIDRAFT / 인사이트 / 오픈 파운데이션
오픈 파운데이션

AETHER란 무엇인가? VIDRAFT의 완전 공개 파운데이션 모델

가중치만 여는 것을 넘어 학습 데이터·코드·로그·체크포인트까지 전부 Apache-2.0으로 공개한 from-scratch 파운데이션 모델

게시 2026-07-31약 2분 읽기VIDRAFT 제공
빠른 답변

AETHER는 한국 AI 기업 VIDRAFT가 밑바닥부터 학습한 파운데이션 모델로, 가중치뿐 아니라 학습 데이터·코드·로그·중간 체크포인트까지 모두 Apache-2.0으로 공개합니다. 흔한 '가중치만 공개(open weights)'보다 한 단계 높은 완전 개방 표준을 따릅니다.

AETHER가 '가중치만 공개'가 아니라 '완전 공개'라는 것은 무슨 뜻인가요?

AETHER는 최종 가중치는 물론 학습에 사용한 데이터, 학습 코드, 학습 로그, 중간 체크포인트까지 전부 Apache-2.0 라이선스로 공개합니다.

대다수의 '오픈' 모델은 완성된 가중치만 배포하기 때문에 어떤 데이터로 어떻게 학습됐는지 외부에서 재현할 수 없습니다. AETHER는 Allen AI의 OLMo와 같은 완전 개방 표준을 지향해, 연구자와 기업이 학습 과정 전체를 검증하고 그대로 재현하거나 이어서 학습할 수 있도록 다섯 가지 산출물(weights, data, code, logs, checkpoints)을 모두 제공합니다.

AETHER-7B-5Attn의 아키텍처는 어떻게 구성되나요?

AETHER-7B-5Attn은 약 65.9억(6.59B) 파라미터의 Mixture-of-Experts 모델로, 다섯 종류의 이질적 어텐션을 49개 층에 7x7 라틴 방진(Latin-square) 배치로 배열합니다.

7x7 라틴 방진 레이아웃은 다섯 가지 서로 다른 어텐션 유형이 층마다 균형 있게 분포되도록 설계된 것으로, 특정 어텐션에 치우치지 않고 이종 어텐션의 조합 효과를 실험할 수 있게 합니다. AETHER의 핵심 가치는 벤치마크 우위가 아니라, 이 재현 가능한 어텐션 배치 방법 자체와 완전 개방된 학습 파이프라인에 있습니다.

AETHER는 어떤 데이터와 하드웨어로 학습됐나요?

약 1,442억(144.2B) 토큰을 NVIDIA B200 GPU 16장으로 학습했으며, 데이터 비율은 수학 37.8%, 한국어 21.6%, 영어 21.6%, 기타 19%입니다.

학습 결과물로 base와 instruct 두 가지 변형이 공개되며, 각각 약 13GB 크기의 체크포인트 3종이 함께 제공됩니다. 수학 비중이 가장 높은 데이터 믹스와 한국어·영어를 동등하게 둔 구성은 이 모델이 추론과 이중언어 활용을 함께 겨냥했음을 보여줍니다.

지금 시점에서 AETHER의 한계는 무엇인가요?

공개 발표에는 아직 벤치마크 점수가 포함되어 있지 않으며(대신 제3자가 표준 벤치마크를 직접 돌릴 수 있도록 평가 코드를 제공), 이번 빌드에는 KV 캐시가 없어 지연시간과 메모리에 영향을 줍니다.

AETHER는 프런티어급 성능을 주장하는 모델이 아니라, 재현 가능한 완전 개방과 이종 어텐션 방법론에 가치를 둔 연구용 릴리스입니다. 벤치마크 수치는 회사가 자체 발표하는 대신 누구나 포함된 평가 코드로 검증하도록 열어두었고, KV 캐시 부재는 향후 빌드에서 개선될 수 있는 엔지니어링 사항입니다.

자주 묻는 질문

AETHER를 상업적으로 무료로 사용할 수 있나요?
네. AETHER는 가중치·데이터·코드·로그·체크포인트가 모두 Apache-2.0으로 공개되어 상업적 이용, 수정, 재배포가 허용됩니다.
AETHER는 어디서 내려받을 수 있나요?
Hugging Face의 FINAL-Bench 조직 페이지에서 base·instruct 변형과 각 약 13GB 체크포인트 3종을 받을 수 있으며, VIDRAFT 공식 사이트(vidraft.net)에서 관련 정보를 확인할 수 있습니다.
AETHER가 최상위 프런티어 모델보다 성능이 좋나요?
발표 시점에는 벤치마크 점수가 공개되지 않았습니다. AETHER의 강점은 성능 순위가 아니라 재현 가능한 완전 개방과 7x7 라틴 방진 이종 어텐션 방법이며, 성능은 포함된 평가 코드로 누구나 직접 측정할 수 있습니다.

출처

관련 글

온디바이스 AI
GPU 없이 35B AI 모델을 CPU로 실행할 수 있나요?
과학 AI
경구약의 장 흡수(HIA)를 가장 잘 예측하는 AI 모델은?
모델 추론
GPQA 다이아몬드 과학 벤치마크에서 1위 한국 LLM은 무엇일까?
↖ 홈 — vidraft.net

이 글은 VIDRAFT의 공개·실측 데이터와 외부 출처에 기반합니다. 성능 수치는 명시된 조건에서의 측정값이며 환경에 따라 달라질 수 있습니다.