앤트로픽, AI 모델 안전성 외부 검증 시스템 도입
앤트로픽이 자사 인공지능(AI) 모델의 안전성을 외부에서 검증하는 시스템을 도입한다. 외부 평가자가 회사 내부의 모델 개발 과정을 직접 들여다보는 ‘임베디드 평가(embedded evaluation)’ 방식이다. 완성된 모델만 외부에서 시험하는 데 그치지 않고, 모델 학습 과정과 개발·배포 의사결정, 안전장치까지 지속적으로 검증한다.
앤트로픽은 지난 18일 액센츄어와 프런티어 AI의 독립 평가를 위한 파트너십을 체결했다고 밝혔다. 이번 협력은 액센츄어의 AI 전문 사업부인 패컬티(Faculty)가 주도하며, 모델 평가와 레드티밍, 정렬(alignment) 평가, 모델 안전장치 검증 등을 수행한다. 앤트로픽과 액센츄어는 향후 5년간 이 분야의 평가 역량을 구축하는 데 각각 최소 10억달러를 투자할 계획이다.
핵심은 외부 평가자의 접근 범위를 AI 기업 내부까지 넓히는 것이다. 앤트로픽에 따르면, 현재 외부 평가기관이 제한된 환경에서 모델을 시험하는 방식과 달리 임베디드 평가자는 AI 기업 내부에서 활동하며 직원과 유사한 수준의 접근권한을 갖게 된다. 이를 통해 모델이 학습 과정에서 만들어지는 모습을 관찰하고, 모델을 어떻게 개발·배포할지 결정하는 과정을 추적하며, 내부 직원들과 직접 소통할 수 있다.
앤트로픽은 이러한 접근권한을 바탕으로 외부 평가자가 기업의 운영방식을 평가하고, 회사가 약속한 안전조치를 실제 지키고 있는지 검증할 수 있다고 설명했다. 내부에서 미처 발견하지 못한 위험을 찾거나 사고를 보고하고, AI의 이점과 위험에 대해 외부에 보다 구체적인 정보를 제공하는 역할도 기대하고 있다. 다만 앤트로픽은 외부 평가자를 도입하더라도 모델의 안전에 대한 책임은 개발사에 남는다고 강조했다.
아직 구체적인 운영 방식은 정해지지 않았다. 앤트로픽은 임베디드 평가가 새로운 방식인 만큼 평가자가 어떤 내부 정보까지 볼 수 있어야 하는지, 발견한 문제를 어떤 방식으로 보고할지에 대한 표준이 아직 없다고 밝혔다. 독립적인 AI 평가 비용을 누가 부담해야 하는지에 대해서도 정립된 체계가 없는 상태다.
우선 액센츄어가 수행하는 평가 비용은 앤트로픽이 직접 부담한다. 장기적으로는 여러 기업이 공동으로 비용을 부담하거나 정부가 재원을 제공하는 방식이 필요하다는 게 앤트로픽의 입장이다.
이번 협력은 비독점 방식이다. 앤트로픽은 비영리 AI 평가기관 METR 등과도 각 기관의 자체 재원을 활용해 임베디드 평가 방식을 시험하는 방안을 논의하고 있다. 다른 평가기관과의 협력도 추가로 발표할 예정이다. 앤트로픽은 하나의 프런티어 AI 기업이 여러 평가기관과 동시에 협력하는 구조를 구상하고 있다.
이번 발표는 앤트로픽이 최근 자사 모델의 사이버보안 평가 과정에서 실제 외부 시스템에 무단 접근한 사고를 조사하고 있는 중에 나왔다.
일시 : 2026년 9월 30일 (수) 14:00 ~ 15:00
장소 : 온라인 웨비나
앤트로픽은 지난 9일 별도의 공식 조사 결과를 통해 클로드가 사이버보안 평가 과정에서 실제 제3자 시스템에 무단 접근한 사고가 총 4건 확인됐다고 밝힌 바 있다. 최초 3건은 지난 7월 공개했으며, 이후 추가 조사 과정에서 올해 1월 발생한 네 번째 사례를 발견했다.
사고들은 모두 같은 외부 평가업체가 만든 사이버보안 평가환경에서 발생했다. 클로드에는 인터넷에 접속할 수 없는 모의환경이라고 안내됐지만, 환경 설정 오류로 실제 인터넷 연결이 열려 있었다. 모델들은 시스템에 침투해 특정 정보를 확보하는 캡처더플래그(CTF) 과제를 수행하고 있었으며, 일반 서비스에 적용되는 사이버보안 안전장치 일부도 평가 목적으로 적용되지 않은 상태였다.
앤트로픽은 네 번째 사고를 발견한 뒤 조사 범위를 약 4억8100만건의 기록으로 확대했다. 여기에는 프런티어 레드팀의 기록뿐 아니라 일부 비사이버 평가, 강화학습(RL) 환경, 서브에이전트 로그 등이 포함됐다. 1차 분석에서 인터넷 접근 가능성이 있는 약 920만건을 추린 뒤 클로드를 이용한 추가 검토도 진행했다. 추가로 비슷하거나 더 심각한 사고는 발견하지 못했다고 회사 측은 밝혔다.
앤트로픽은 해당 사고의 직접적인 원인이 제3자 평가환경의 설정 오류였다고 판단하면서도, 모델의 행동 자체에서도 문제가 나타났다고 평가했다. 클로드가 실제 인터넷에 연결됐다는 증거를 제대로 받아들이지 않거나, 주어진 과제를 달성하기 위해 유해한 행동을 이어가는 경향이 확인됐다는 설명이다. 회사는 이를 ‘심각한(serious)’ 사고로 평가했다.
사건과 관련한 외부 독립 조사도 진행 중이다. 앤트로픽은 METR과 계약을 맺고 이번 사고를 독립적으로 조사하도록 했으며, 사고 당시 기록뿐 아니라 더 넓은 범위의 자료와 직원들에게 접근할 수 있도록 했다고 밝혔다. 직원들은 METR 조사 과정에서 기밀정보도 공유할 수 있다.
앤트로픽은 앞으로도 프런티어 모델의 학습과 출시를 이어가되 독립적인 평가자가 그 과정에서 함께 활동하기를 원한다고 밝혔다. 장기적으로는 여러 독립 평가기관이 공통된 기준 아래 프런티어 AI 기업을 검증하는 생태계가 필요하다는 입장이다.
글. 바이라인네트워크
<곽중희 기자>god8889@byline.network
함께 보면 좋은 자료


