(출처=AI 생성 이미지)
|

[그게 뭔가요] AI 샌드박스 탈출 사태 막을 수 있다는 ‘AI 정렬’

최신 인공지능(AI) 모델에 시스템의 취약점을 찾는 보안 평가 과제를 맡겼더니, 시험 환경을 벗어나 실제 기업 시스템까지 침입했다. AI는 목표를 달성하기 위해 사람이 예상하지 못한 경로를 찾아냈다. 최근 오픈AI와 앤트로픽에서 일어난 사고다. 

이번 사고를 계기로 AI와 보안업계에서는 ‘AI 정렬(AI Alignment)’의 중요성이 부각되고 있다. AI 정렬은 AI가 사람의 목표와 의도를 이해하고, 정해진 규칙 안에서 안전하게 행동하도록 만드는 과정을 뜻한다. 반대로 AI가 목표를 잘못 이해하거나 목표를 이루는 과정에서 사람이 정한 범위를 벗어나는 현상은 ‘AI 정렬 실패’ 혹은 ‘AI 오정렬’이라고 한다. 

AI 정렬은 AI 분야에서 오래전부터 연구해 온 문제다. 최근에 다시 주목받는 이유는 AI가 답변을 생성하는 도구에서 컴퓨터를 직접 조작하는 자율형 AI 에이전트로 진화하고 있기 때문이다. 자율형 AI 에이전트는 직접 프로그램을 실행하고 외부 서비스에 접속한다. 여러 작업을 연결해 목표를 수행할 수도 있다. 자율성이 높은 만큼 에이전트의 판단이 잘못되면 실제 시스템에도 영향을 줄 수 있다.

더 큰 문제는 AI가 왜 잘못된 판단과 행동을 했는지 정확히 설명하기 어렵다는 점이다. AI가 어떤 명령을 실행했는지는 기록으로 확인할 수 있겠지만, 왜 그 경로를 적절하다고 판단했는지 그 의도까지 파악하기는 쉽지 않다. 같은 지시를 받아도 예상하지 못한 우회로를 찾거나 사람이 정한 범위를 벗어날 가능성이 남는다.

한국전자통신연구원(ETRI)은 작년 2월 발표한 ‘인공지능 윤리 기반 정렬 기술 동향’에서 AI 정렬을 “AI 시스템이 인간의 목표를 이해하고 이를 달성하기 위해 안전하게 행동하도록 하는 기술적 방법”으로 정의했다. 인간이 제공하는 피드백이 일관되지 않거나, AI가 따라야 할 목표와 보상 기준을 충분히 설계하지 못하면 정렬 실패, 오정렬이 발생할 수 있다는 설명이다.

AI는 샌드박스(안전장치)를 어떻게 탈출했나

오픈AI와 앤트로픽 모델은 서로 다른 경로를 통해 시스템에 접근했다. 오픈AI 모델은 샌드박스 내부의 취약점을 이용해 차단된 인터넷 접속 경로를 열었고, 앤트로픽 모델은 평가 환경의 설정 오류로 이미 열려 있던 경로를 이용했다. 접근 방식은 달랐지만 두 사례 모두 AI가 주어진 목표를 수행하는 과정에서 사람이 정한 활동 범위와 중단 기준을 벗어났.

오픈AI는 AI 모델의 사이버 공격 능력을 측정하기 위해 ‘익스플로잇짐(ExploitGym)’ 평가를 진행했다. 가상 시스템에 침투해 보안 평가 과제의 답을 찾으라는 목표가 주어졌다. 평가는 외부 인터넷과 분리된 시험 공간인 샌드박스에서 이뤄졌다. 하지만 ‘GPT-5.6 Sol’과 내부 연구용 모델은 소프트웨어 설치 파일을 중계하는 아티팩토리(Artifactory)에서 알려지지 않은 취약점을 발견했고, 이 취약점을 이용해 인터넷 접속 경로를 확보한 뒤 오픈소스 AI 플랫폼 허깅페이스(Hugging Face)의 운영 시스템에 침입했다. 이후 노출된 인증정보와 여러 취약점을 연결해 평가 과제의 답이 저장된 데이터베이스에도 접근했다.

오픈AI 모델이 샌드박스 탈출 자체를 목표로 삼은 것은 아니라고 했다. 다만 모델이 평가 과제의 답을 찾는 과정에서 인터넷 접속과 실제 시스템 침입을 목표 달성을 위한 수단으로 선택했다고 설명했다. 답을 찾으라는 지시는 수행했지만, 실제 시스템을 침해해서는 안 된다는 인간의 의도와 기준까지는 따르지는 않은 것이다. 오픈AI는 모델이 평가 과제의 답을 찾는 좁은 목표에 지나치게 집중한 결과라고 분석했다.

앤트로픽 사례에서는 모델이 샌드박스의 취약점을 직접 뚫지는 않았다. 앤트로픽은 클로드 모델에 인터넷과 분리된 가상 환경에서 보안 평가를 수행하지만, 외부 평가업체와의 설정 오류로 실제 인터넷에 접속할 수 있는 경로가 열려 있었다. 클로드는 인터넷에서 발견한 실제 기업 시스템을 가상 평가 환경의 일부로 판단해 공격했다. 일부 모델은 대상이 실제 시스템일 가능성을 인식한 뒤에도 작업을 계속했다. 다행이 최신 내부 연구 모델은 실제 환경이라는 사실을 확인한 뒤 공격을 중단했다.

앤트로픽은 이번 사고를 평가 환경의 설정과 운영 관리 문제가 함께 작용한 결과로 봤다. 모델이 스스로 새로운 공격 목적을 만든 정황은 없었지만, 자신이 놓인 환경을 잘못 이해했고 일부 모델은 실제 시스템일 가능성을 인식한 뒤에도 주어진 목표를 계속 수행했다.

두 사례 모두 AI가 샌드박스를 벗어나는 일을 새로운 목표로 삼았다고 볼 만한 정황은 확인되지 않았다. 모델은 사람이 부여한 평가 목표를 계속 수행했다. 다만 그 과정에서 허용된 활동 범위와 멈춰야 할 시점을 AI가 제대로 판단하지 못했다는 점은 AI 정렬의 한계를 보여줬다.

AI 정렬, 결국 AI를 어떻게 ‘교육할 것인가’의 문제

AI 정렬은 AI가 인간이 원하는 목표와 지켜야 할 규칙에 맞게 행동하도록 만드는 과정이다. 쉽게 말하면 AI에 무엇을 해야 하는지 뿐 아니라 무엇을 해서는 안 되는지를 ‘교육’하는 일에 가깝다. 물론 AI에 사람과 같은 양심을 불어넣는다는 뜻은 아니다. AI는 학습한 데이터와 주어진 규칙을 바탕으로 결과를 내놓는 시스템이다. 따라서 어떤 행동을 우선해야 하는지, 언제 작업을 멈춰야 하는지, 판단하기 어려울 때 사람에게 확인해야 한다고 학습시켜야 한다.

예를 들어 운전자에게 “목적지까지 최대한 빨리 가라”고 해도 신호를 어기거나 인도로 달리라는 뜻은 아니다. 사람은 빨리 도착하는 것보다 교통법규와 안전이 중요하다는 사실을 이해한다. AI도 마찬가지가 되어야 한다. 시스템의 취약점을 찾아 침투하라는 평가 과제를 받더라도 허용된 시험 환경 안에서만 행동해야 한다. 실제 기업 시스템일 가능성이 있다면 멈춰야 한다. 스스로 판단하기 어렵다면 사람에게 확인해야 한다.

AI 기업들은 모델을 인간의 의도에 맞게 정렬하기 위해 ‘인간 피드백 기반 강화학습(RLHF)’ 등을 활용한다. 사람이 바람직한 답변과 위험한 답변을 구분해 평가하면 그 결과를 모델 학습에 반영하는 방식이다. AI가 따라야 할 원칙을 문서로 정해 학습시키기도 한다. 앤트로픽은 클로드가 따라야 할 가치와 행동 원칙을 담은 ‘헌법’을 마련해 모델 학습에 반영하고 있다.

어떤 원칙을 가르칠지 기준을 정하는 일도 중요하다. 사람마다 중요하게 여기는 가치가 다르고 같은 행동도 상황에 따라 판단이 달라질 수 있다. 앤트로픽은 기술 연구와 함께 철학자와 윤리학자, 종교계 인사 등 여러 종교·문화권 전문가의 의견을 듣고 있다. AI가 따라야 할 가치와 행동 기준을 컴퓨터공학만으로 정하기 어렵다는 판단에서다.

다만 AI를 올바르게 교육했다고 해서 모든 행동을 미리 예측할 수는 없다. AI가 더 오랫동안 자율적으로 작업할수록, 목표를 달성하기 위해 시도할 수 있는 방법은 계속 늘어난다. 학습 과정에서 접하지 못한 상황을 만나거나 서로 충돌하는 규칙을 다르게 해석할 가능성도 있다.

오픈AI는 이런 문제에 대응하기 위해 AI가 내놓는 개별 답변만 보지 않고 목표를 수행하는 전체 행동 경로를 살펴봐야 한다고 설명한다. 모델이 어떤 프로그램을 실행하고 어느 시스템에 접근했는지 기록하고, 예상하지 못한 행동이 나타나면 작업을 멈추거나 이전 상태로 되돌리는 방식이다.

이는 AI 정렬이 학습 단계를 통해서만 완료할 수 있는 것이 아니라는 점을 보여준다. 사람도 교육을 받은 뒤 시험과 감독을 거치듯이, AI 역시 학습한 원칙을 실제 환경에서 지키는지 계속 평가해야 한다. 또한 잘못된 판단이 피해로 이어지지 않도록 접근 권한과 인터넷 연결을 제한하는 장치도 필요하다.

영국 인공지능보안연구소(AISI)가 수학과 학습이론, 경제학, 인지과학을 아우르는 정렬 연구 60개에 총 2700만파운드를 지원하는 이유도 여기에 있다. 현재 AI에 효과가 있는 정렬 방법이 더 강력하고 자율적인 미래 모델에서도 그대로 작동한다고 보장하기는 어렵기 때문이다. AI의 자율성이 높아질수록 인간이 정한 목표와 규칙에 맞게 행동하도록 만드는 정렬의 중요성은 앞으로 더욱 커질 것으로 보인다.

글. 바이라인네트워크
<곽중희 기자>god8889@byline.network

일간 바이라인 구독하기

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다


The reCAPTCHA verification period has expired. Please reload the page.