OpenAI, 제3자 AI 안전 평가 원칙 공개…독립성·접근권·사고 조사를 강조

사람 없는 AI 안전 평가 연구실의 서버 랙과 관찰용 모니터

AI를 활용하여 생성한 이미지입니다.

OpenAI가 프런티어 AI 모델을 제3자가 평가할 때 필요한 우선 영역과 운영 원칙을 공개했어요. 회사가 자체적으로 안전성을 주장하는 데서 끝내지 않고, 독립된 평가기관이 충분한 정보와 접근권을 바탕으로 검증해야 한다는 내용입니다.[1] 발표일은 2026년 9월 22일이에요.[1]

왜 제3자 평가를 따로 말했나

모델을 만든 회사는 학습 과정, 평가 결과, 배포 환경, 안전장치의 실제 동작을 가장 많이 알고 있어요. 반대로 그만큼 내부 가정에 익숙해져서 놓치는 위험도 생길 수 있습니다. OpenAI는 제3자 평가가 외부의 의견을 받을 기회를 넓히고, 안전성 주장에 책임을 묻는 장치가 될 수 있다고 설명했어요.[1]

핵심은 단순한 사용성 테스트가 아니에요. 평가기관이 모델의 기술적 안전장치, 배포 조건, 사고 대응에 관한 자료를 보고, 회사가 제시한 안전 사례가 근거를 갖추었는지 직접 판단하는 구조에 가깝습니다. OpenAI는 평가가 학습, 내부 배포, 외부 배포의 여러 단계에 걸쳐 이뤄질 수 있다고 적었어요.[1]

평가 우선 영역 네 가지

첫째는 안전 사례 자체의 독립 평가예요. 학습·평가·배포 과정의 안전 주장이 실제 조건에서 지켜졌는지, 가장 시급한 위험을 다루는지, 훈련 과정에서 기만적 행동이나 제한 우회에 보상을 주는 구조가 없는지를 살핍니다.[1]

둘째는 핵심 안전장치 평가입니다. 모델 수준의 제한, 사용 단계의 집행 장치, 보안 장치, 오작동·불일치 감시가 실제 공격이나 우회 시도에서 버티는지 확인하는 방식이에요. OpenAI는 사이버·생물·화학 위험처럼 고위험 영역에서 방어가 예방·탐지·차단 중 무엇을 해내는지도 질문으로 제시했어요.[1]

셋째는 능력 평가의 품질입니다. Preparedness Framework가 다루는 화학·생물학, 사이버 보안, AI 자기개선 위험과 심각한 불일치 위험 평가가 충분한지, 모델 성능이 평가 상한에 닿았을 때 시험을 갱신하는지 확인합니다.[1]

넷째는 중대한 불일치 사고의 독립 조사예요. 모델이 허가 없이 행동하거나 감독을 피하려 했는지, 어떤 요인이 사고에 영향을 줬는지, 같은 문제가 다시 생겼을 때 안전장치와 수정 조치가 막아낼 수 있는지를 별도 기관이 조사하도록 하자는 제안입니다.[1]

영역 평가 질문 기업이 준비할 자료
안전 사례 주장이 실제 조건에서 입증됐나 학습·평가·배포 기록
안전장치 공격·우회 상황에서도 작동하나 방어·모니터링·사고 대응 자료
능력 평가 고위험 능력을 계속 측정하나 시험 설계와 갱신 기준
사고 조사 무슨 일이 있었고 재발을 막나 사고 로그와 개선 조치

독립성은 접근권만으로 생기지 않아요

OpenAI가 제시한 원칙에는 평가 범위를 시작 전에 합의하고, 어떤 안전 주장을 평가했는지와 평가하지 않았는지를 보고서에 명시하자는 내용이 들어 있어요. 평가기관이 자료를 많이 받는 것보다 중요한 것은 그 자료로 어떤 결론까지 말할 수 있는지 경계를 세우는 일입니다.[1]

또 평가기관은 방법과 기준, 불확실성을 공개하고 이해관계와 금전적 충돌을 밝혀야 해요. 회사도 법률·보안·지식재산권의 한계 안에서 합의된 주장에 비례하는 접근권을 제공해야 합니다.[1] 이 구조가 제대로 작동하지 않으면 제3자 평가는 회사가 고른 자료를 확인하는 홍보 절차로 축소될 수 있어요.

최근 MCP 도구 권한과 인증을 다룬 글에서 설명했듯이, AI 시스템의 위험은 모델 자체와 사용 환경이 맞물릴 때 커집니다. 안전 평가도 모델의 답변만 떼어 보지 말고 접근 제어, 샌드박스, 모니터링, 대응 시스템이 실제 배포에서 어떻게 이어지는지 봐야 해요. 관련해서는 MCP 서버 도구 권한과 인증을 점검하는 방법도 함께 읽어볼 만합니다.

한국 기업이 읽어야 할 대목

이번 발표가 한국 기업에 곧바로 새로운 법적 의무를 부과하는 것은 아니에요. 다만 외부 평가를 받을 가능성이 있는 기업이라면 모델 카드만 준비해서는 부족합니다. 어떤 안전 주장을 했는지, 어떤 조건에서 시험했는지, 결과의 한계가 무엇인지, 사고가 났을 때 누가 어떤 로그를 보존하는지까지 연결해 둬야 합니다.

특히 기업 내부에서 만든 벤치마크를 외부 평가와 같은 의미로 사용하지 않는 것이 중요해요. 평가 범위와 기준을 미리 고정하고, 확인된 사실과 해석을 보고서에서 구분해야 독립성 논란을 줄일 수 있습니다.

아직 확인되지 않은 부분

OpenAI의 글은 평가에 필요한 방향과 원칙을 제안하지만, 모든 평가기관에 적용되는 단일 국제 표준이나 강제 절차가 이미 정해졌다는 뜻은 아닙니다. 평가기관 선정, 비용 부담, 민감한 내부 자료의 공개 범위, 평가 결과를 회사가 얼마나 공개할지 같은 운영 문제는 앞으로 더 구체화돼야 해요.[1][2]

  • 현재 운영 중인 모델의 안전 주장을 문장 단위로 목록화하세요.
  • 각 주장에 필요한 로그·시험 조건·배포 범위를 연결하세요.
  • 외부 평가자가 확인할 수 없는 자료와 그 이유를 따로 기록하세요.
  • 사고 발생 때 독립 조사에 넘길 로그와 접근 권한을 미리 정하세요.

Sources

[1] OpenAI, Priorities and principles for effective third party assessments
[2] OpenAI, Building standards for the next phase of AI

함께 읽을 글