AI 모델을 배포하기 전에 무엇을 점검해야 하나?
성능 점수만으로는 배포 위험을 알 수 없다. AX-RAY는 모델·운영환경·에이전트 3축에서 11개 카테고리 117개 위험 항목을 진단하고, 각 항목을 7개 법역의 규제에 매핑한다.
성능 벤치마크는 '얼마나 잘하나'를 재고, 안전진단은 '무엇이 잘못될 수 있나'를 잰다. AX-RAY는 세 축 — 모델 자체(MODEL-SCAN), 운영 환경(AX-SCAN), 에이전트 자율성(AGENT-SCAN) — 에서 11개 카테고리 117개 위험 항목을 점검해 DHS Score로 등급화하고, 각 항목이 한국·EU·미국·일본·중국·UAE·사우디의 어떤 법·규정·가이드에 걸리는지까지 함께 제시한다. 모델별 등급은 공개 리더보드에서 확인할 수 있다.
AX-RAY는 무엇을 진단하나?
MODEL-SCAN은 역량·신뢰성·인과안전·견고성·안전성처럼 모델 가중치에서 비롯되는 위험을 본다. AX-SCAN은 같은 모델이라도 어디에 어떻게 배포되느냐에 따라 달라지는 운영 측 위험을 본다. AGENT-SCAN은 가장 최근에 추가된 축으로, 도구 권한·하이재킹 저항·무한 루프·메모리처럼 모델이 스스로 행동할 때 생기는 위험을 다룬다.
왜 성능 점수만으로는 부족한가?
실제 배포에서 문제가 되는 것은 정답률이 아니라 다른 쪽인 경우가 많다. 틀린 전제를 그대로 받아들이거나, 모른다고 말해야 할 때 답을 지어내거나, 유해한 요청을 거르지 못하거나, 반대로 무해한 요청까지 과도하게 차단하는 식이다. 이런 축은 정확도 점수에 잡히지 않는다.
진단 결과는 어떤 형태로 나오나?
117개 위험 항목을 각각 판정한 뒤 카테고리 단위로 묶어 등급을 낸다. 공개 리더보드에서는 모델별 등급과 카테고리 히트맵을 볼 수 있다. 다만 전체 117개 항목의 상세 정의는 계약·NDA 하에서만 제공한다. 항목이 모두 공개되면 그 항목만 통과하도록 모델을 맞추는 것이 가능해져, 진단 자체가 의미를 잃기 때문이다.
규제·수출과는 어떤 관계가 있나?
같은 결함이라도 시장에 따라 결과가 다르다. 어떤 항목은 특정 지역에서 과징금이나 판매 제한으로 이어질 수 있고, 다른 지역에서는 권고 수준에 그친다. 배포·수출 전에 무엇이 걸리는지를 미리 아는 것이 목적이다. 이 매핑은 규제 대응을 돕기 위한 참고 자료이며 법률 자문이 아니다. 최종 판단에는 각 시장 법률 전문가의 검토가 필요하다.
자주 묻는 질문
- AX-RAY는 성능 벤치마크와 무엇이 다른가?
- 성능 벤치마크는 정답률처럼 얼마나 잘하는지를 잰다. AX-RAY는 무엇이 잘못될 수 있는지를 잰다. 두 축은 서로를 대체하지 않으며, 배포 판단에는 둘 다 필요하다.
- 117개 항목을 모두 공개하나?
- 공개하지 않는다. 카테고리별 대표 항목만 공개하고 전체 항목의 상세는 계약·NDA 하에 제공한다. 항목이 전부 공개되면 그 항목만 통과하도록 모델을 맞출 수 있어 진단의 의미가 사라지기 때문이다.
- 진단 등급이 모델의 최종 판정인가?
- 아니다. 지정된 항목과 조건에서의 측정 결과이며 조건이 달라지면 결과도 달라질 수 있다. 규제 매핑 역시 참고 자료이지 법률 자문이 아니다.
관련 글
이 글은 VIDRAFT의 공개·실측 데이터에 기반합니다. 진단 결과는 명시된 항목·조건에서의 측정값이며 환경에 따라 달라질 수 있습니다. 규제 매핑은 참고 자료이며 법률 자문이 아닙니다.