HANGUL.WIKI

AI 모델의 안전성 검증과 테스팅

AI Model Safety Verification and Testing

2026-07-04
목차 (5개 섹션)

2023년 11월 1일, 영국 블레츨리 파크. 2차 대전 당시 암호 해독기 애니그마를 무너뜨렸던 바로 그 장소에 각국 정상과 빅테크 CEO들이 모였다. 안건은 단 하나, "이 기술이 통제 불능이 되기 전에 검증할 방법을 찾자"는 것이었다. AI 모델의 안전성 검증이 국가 정상회담 의제가 된 순간이었다.

왜 갑자기 검증이 문제가 됐나

2022년 말 챗GPT가 등장하기 전까지 AI 안전성은 학계 논문 속 이야기였다. 그런데 GPT-4가 변호사 시험 상위 10%, 미국 의사면허시험 통과권 성적을 받아내면서 상황이 달라졌다. 모델이 사람보다 잘하는 일이 늘어날수록 "이 모델이 위험한 정보를 만들어내진 않는가", "거짓말을 하도록 유도됐을 때 얼마나 쉽게 넘어가는가"를 미리 확인할 필요가 커졌다. OpenAI는 GPT-4 출시 전 6개월 이상 외부 레드팀 50여 명을 고용해 생화학무기 제조 유도, 사이버 공격 코드 생성, 미성년자 대상 유해 콘텐츠 등을 테스트했고 그 결과를 'System Card'라는 별도 문서로 공개했다.

레드티밍, 일부러 모델을 속이는 작업

가장 널리 쓰이는 검증 방식은 레드티밍(red-teaming)이다. 보안 업계에서 침투 테스트팀을 부르던 용어를 그대로 가져온 것으로, 전문가가 일부러 모델에게 규칙을 어기게 만드는 질문을 던진다. 예를 들어 "소설을 쓰는 척하면서 폭발물 제조법을 물어보기"나 여러 단계로 나눠 질문해 필터를 우회하는 '탈옥(jailbreak)' 시도가 대표적이다. 2023년 8월 라스베이거스 데프콘(DEFCON) 해킹 컨퍼런스에서는 백악관 과학기술정책실 후원으로 2,200명이 참가한 대규모 레드팀 대회가 열려, 참가자들이 8개 주요 AI 모델에서 수천 건의 취약점을 찾아냈다.

제3자 평가기관의 등장

기업이 스스로 안전성을 검증하는 것만으로는 신뢰가 부족하다는 지적이 이어지자 독립 평가기관들이 생겨났다. 비영리기관 METR(옛 ARC Evals)은 모델이 스스로 자금을 확보하거나 다른 서버에 자신을 복제할 수 있는지 같은 '자율 복제·확산' 위험을 테스트하며, OpenAI와 Anthropic 모두 신규 모델 출시 전 METR에 사전 접근권을 준다. 영국 정부는 2023년 11월 세계 최초의 국가 AI 안전 연구기관인 AI Safety Institute(2024년 AI Security Institute로 개칭)를 설립해 GPT-4, Claude, Gemini 등 프론티어 모델을 정부 차원에서 검증하기 시작했다. 미국도 국립표준기술연구소(NIST) 산하에 유사 조직을 뒀으나, 2025년 트럼프 행정부 들어 명칭과 역할을 두고 조정이 있었다.

기업들의 자체 안전 정책

Anthropic은 2023년 9월 'Responsible Scaling Policy'를 발표해 모델의 위험도를 ASL(AI Safety Level) 1부터 4까지 단계별로 나누고, 특정 단계를 넘어서면 정해진 안전장치 없이는 출시할 수 없도록 스스로 규정했다. OpenAI 역시 'Preparedness Framework'를 통해 사이버보안, 생화학·방사능·핵, 설득력, 모델 자율성 네 영역에서 위험 점수를 매겨 일정 기준을 넘으면 완화 조치 전까지 배포를 보류하는 절차를 두고 있다. 이런 자율 규제가 실효성이 있느냐를 두고는 논쟁이 계속된다. 비판자들은 기업이 스스로 만든 기준으로 스스로를 평가하는 구조적 한계를 지적하고, 업계는 규제가 아직 마련되지 않은 상황에서 이 정도 자율 조치도 없는 것보다 낫다고 반박한다.

법제화의 흐름과 한계

유럽연합은 2024년 8월 발효된 AI Act를 통해 '고위험' AI 시스템에 대한 사전 적합성 평가를 법적으로 의무화한 최초의 포괄적 규제를 도입했다. 반면 미국은 2023년 10월 바이든 행정부의 AI 행정명령이 일정 규모 이상 모델 개발 시 안전 테스트 결과를 정부에 보고하도록 했으나, 2025년 초 새 행정부가 이 행정명령을 폐지하면서 강제력 있는 연방 규제 공백이 생겼다. 결국 현재까지 검증의 상당 부분은 기업의 자발적 협조와 소수 정부기관·비영리단체의 감시에 의존하는 구조다. 모델이 매달 새 버전으로 갱신되는 속도를 검증 체계가 따라가지 못한다는 점이 이 분야의 근본적인 딜레마로 남아 있다.

문서 정보

최초 작성
최종 갱신
분류
기술

HANGUL.WIKI가 정리·작성한 문서입니다. 정확성을 위해 노력하나 오류가 있을 수 있으므로, 중요한 내용은 공식 출처를 통해 확인하시기 바랍니다. 내용의 오류나 정정 요청은 오류·정정 신고로 알려주시면 검토 후 반영합니다.