오픈AI 모델이 낸 보안 사고, 중국 모델이 분석…가드레일의 역설
오픈소스 AI 플랫폼 허깅페이스는 지난 16일 공개한 침해사고 보고서에서 사고 경로와 피해 범위를 조사하는 과정에서 상용 프론티어 모델을 포렌식 분석에 활용했지만, 안전장치(가드레일)가 실제 공격 명령과 익스플로잇 페이로드 등의 입력을 차단했다고 밝혔다. 이에 허깅페이스는 중국 오픈웨이트 모델 ‘GLM-5.2’를 자체 환경에서 구동해 분석을 이어갔다. 사고 당시 침해를 일으킨 AI 모델의 정체는 확인되지 않았다. 하지만 닷새 뒤인 21일 오픈AI가 자사의 최신 사이버보안 특화 모델 ‘GPT-5.6 Sol’과 비공개 사전 출시 모델이 평가 과정에서 사고를 일으켰다고 공개하면서 공격 주체가 드러났다.
