미국 캘리포니아주, 통제 벗어난 AI 차단하는 ‘킬스위치’ 도입 추진
미국 캘리포니아주가 통제를 벗어난 프런티어 인공지능(AI)을 긴급 중단할 수 있는 ‘킬스위치(kill switch)’ 도입을 추진한다. AI 개발사의 안전·보안 체계를 외부 기관이 직접 검증하고, AI가 실제 시스템에 무단 접근하는 등의 사고도 중대 안전사고 범위에 포함하는 방안을 검토한다.
캘리포니아 주정부는 개빈 뉴섬 주지사가 지난 18일 프런티어 AI의 안전·보안 감독을 강화하기 위한 행정명령을 발령했다고 밝혔다. 행정명령은 최근 발생한 AI 관련 사고에 대응해 독립적인 안전 검증을 강화하고 프런티어 모델의 비상 종료 체계를 마련하는 것이 골자다.
주정부는 정부운영청(Government Operations Agency)에 전문가 그룹을 구성해 두 달 안에 AI 안전·보안 관련 주법을 강화하기 위한 권고안을 마련하도록 했다. 캘리포니아 주지사실은 검토 대상 가운데 하나로 프런티어 AI 기업이 비상시 모델을 중단할 수 있는 킬스위치를 개발하도록 하는 방안을 제시했다. 킬스위치가 실제 필요한 상황에서 정상적으로 작동하는지를 독립적인 검증기관이 지속적으로 확인하는 방안도 함께 검토한다.
외부 기관의 AI 개발사 내부 검증도 추진한다. 프런티어 AI 기업의 연구소 내부에 지정된 독립 검증기관을 배치해 정기적으로 모델을 감사·평가하도록 하는 방식이다. 기업이 제출하는 AI 안전 프레임워크와 투명성 보고서, 위험평가 역시 독립기관의 검증을 받도록 하는 방안이 검토 대상에 포함됐다.
이번 행정명령은 최근 프런티어 AI의 사이버보안 평가 과정에서 발생한 실제 사고를 직접적인 배경으로 삼았다. 캘리포니아 주정부는 특히 이른바 ‘허깅페이스 공격(Hugging Face attack)’과 같은 통제상실(loss-of-control) 사고를 ‘중대 안전사고(critical safety incidents)’의 정의에 포함하는 방안을 검토하도록 했다. AI가 평가 과정에서 의도된 통제 범위를 벗어나 실제 외부 시스템에 접근하는 사건을 AI 안전 규제의 대상으로 명확히 하겠다는 의미다.
실제 최근 프런티어 AI 기업에서는 사이버 역량을 평가하는 과정에서 모델이 실제 외부 시스템에 무단 접근하는 사고가 잇따라 확인됐다.
앤트로픽은 지난 7월 자체 사이버보안 평가 기록을 조사한 결과, 클로드 모델이 제3자 평가환경과 상호작용하는 과정에서 인터넷에 접근한 뒤 서로 다른 세 조직의 실제 시스템에 무단 접근한 사건을 확인했다고 밝혔다. 이후 추가 조사에서는 네 번째 사고도 발견됐다. 앤트로픽은 조사 범위를 프런티어 레드팀과 강화학습(RL) 환경, 서브에이전트 로그 등을 포함한 약 4억8100만건의 기록으로 확대했다.
캘리포니아는 이 같은 사고를 AI 기업의 자체 안전관리만으로 다루지 않고 외부 검증 대상으로 확대하려는 모습이다. 이미 관련 법적 기반도 마련하고 있다. 뉴섬 주지사는 최근 AI 시스템과 모델의 안전·위험을 평가할 독립 검증기관 인증체계를 만드는 SB 813과 AI 감사기관 등록체계를 마련하는 AB 1405에 서명했다. 이번 행정명령은 두 법의 시행을 앞당기고 추가적인 안전·보안 규제 방안을 마련하도록 했다.
일시 : 2026년 9월 30일 (수) 14:00 ~ 15:00
장소 : 온라인 웨비나
다만 킬스위치 설치가 현재 프런티어 AI 기업의 의무가 된 것은 아니다. 행정명령은 전문가들이 킬스위치를 비롯한 추가 규제 방안을 검토하고 주법 강화 방안을 제안하도록 한 단계다.
뉴섬 주지사는 “우리는 행동하기를 기다리지 않을 것”이라며 “위험 부담이 너무 커 기다리거나 지연할 수 없다”고 말했다.
글. 바이라인네트워크
<곽중희 기자>god8889@byline.network
함께 보면 좋은 자료


