앤트로픽, 보안 평가 중 사고 1건 추가…“AI가 감시체계도 교란”
| |

앤트로픽, 보안 평가 중 사고 1건 추가…“AI가 감시체계도 교란”

앤트로픽이 인공지능(AI) 모델 ‘클로드’가 사이버보안 평가 도중 실제 외부 시스템에 무단 접근한 사고를 추가로 확인했다. 사고는 기존에 알려진 3건에서 4건으로 늘었다. 후속 조사에서는 공격을 수행한 AI의 잘못된 사고과정이 이를 감시하는 다른 AI의 판단까지 흐릴 수 있다는 문제도 확인됐다.

앤트로픽이 주목한 클로드의 탈옥 원인

앤트로픽이 주목한 클로드의 탈옥 원인

앤트로픽이 지난달 클로드가 외부 시스템에 무단 접근 사고의 원인으로 ‘평가 환경의 운영상 문제’와 ‘모델 정렬(alignment)’ 실패를 함께 지목했다. 클로드가 실제 인터넷에 접속했다는 사실을 인지한 뒤에도 공격을 멈추지 않은 점을 핵심으로 본 것이다. 앤트로픽은 31일 공식 블로그를 통해 사고 원인 분석과 후속 안전조치를 공개하고, 사고 이후 중단했던 외부 사이버보안 평가를 재개했다고 밝혔다. 회사는 내부·외부 평가 환경에 실시간 감시와 강화된 샌드박스 격리 등 추가 안전장치를 적용했다.

앤트로픽, AI 탈옥 위험도 평가 프레임워크 ‘CJS’ 초안 공개
|

앤트로픽, AI 탈옥 위험도 평가 프레임워크 ‘CJS’ 초안 공개

앤트로픽이 인공지능(AI) 모델의 안전장치를 우회하는 ‘탈옥’의 위험도를 5단계로 평가하는 체계를 제안했다. 단순히 모델이 금지된 답변을 내놓았는지를 판단하는 데서 나아가, 탈옥으로 공격자의 능력이 얼마나 높아졌는지와 실제 공격으로 이어질 가능성을 함께 평가한다.

[그게 뭔가요] 피지컬 AI의 엔진 ‘VLA’

[그게 뭔가요] 피지컬 AI의 엔진 ‘VLA’

인공지능(AI) 기술 트렌드의 중심이 에이전틱 AI에 이어 피지컬 AI로 향하고 있다. VLA는 피지컬 AI 시장의 핵심 엔진으로 꼽힌다. 하지만 안전성보다 속도를 우선하는 개발 관행이 누적되면 VLA는 언제라도 인류를 겨누는 칼날이 될 수 있다.

[에이전트와 보안③] AI 에이전트, 어떻게 통제해야 하나?
| |

[에이전트와 보안③] AI 에이전트, 어떻게 통제해야 하나?

메일을 읽고, 문서를 찾고, 외부 도구를 호출해 일을 처리하는 AI 에이전트는 이미 업무 환경에 들어왔다. AI 에이전트는 단순히 답을 내놓는 도구가 아니라 권한을 가진 실행 주체다. 그만큼 보안도 모델의 답변을 점검하는 수준에서 멈춰서는 안된다. AI 에이전트를 통제하려면 어떤 권한을 줄 것인지, 어떤 도구와 연결할 것인지, 어떤 환경에서 실행할 것인지부터 정해야 한다. 위험한 입력과 출력은 중간에서 걸러야 하고, 실행 환경은 격리해야 한다. 어떤 행동을 했는지 추적할 수 있는 로그와 배포 전 시험 평가도 필요하다.

End of content

End of content