[그게 뭔가요] AI 샌드박스 탈출 사태 막을 수 있다는 ‘AI 정렬’
최신 인공지능(AI) 모델에 시스템의 취약점을 찾는 보안 평가 과제를 맡겼더니, 시험 환경을 벗어나 실제 기업 시스템까지 침입했다. AI는 목표를 달성하기 위해 사람이 예상하지 못한 경로를 찾아냈다. 최근 오픈AI와 앤트로픽에서 일어난 사고다. 이번 사고를 계기로 AI와 보안업계에서는 ‘AI 정렬(AI Alignment)’의 중요성이 부각되고 있다. AI 정렬은 AI가 사람의 목표와 의도를 이해하고, 정해진 규칙 안에서 안전하게 행동하도록 만드는 과정을 뜻한다. 반대로 AI가 목표를 잘못 이해하거나 목표를 이루는 과정에서 사람이 정한 범위를 벗어나는 현상은 AI ’정렬 실패’ 혹은 ’오정렬’이라고 한다.
