앨리스 시앙(Alice Xiang) 소니 글로벌 AI 거버넌스 책임자 겸 부사장이 29일 서울 양재 엘타워에서 열린 ‘글로벌 AI 프라이버시 포럼(Global AI Privacy Forum)’ 에서 기조연설을 하고 있다. (출처=바이라인네트워크, AI 일부 보정)
| |

소니가 AI 공정성 평가 데이터셋 ‘피비’를 만든 이유

이미지를 다루는 인공지능(AI) 모델의 사고 편향성을 줄이려면 모델의 성능만 높일 것이 아니라, 데이터를 어떻게 수집하고 구성했는지를 꼼꼼하게 점검해야 한다는 제언이 나왔다.

앨리스 샹(Alice Xiang) 소니(SONY) 글로벌 AI 거버넌스 책임자 겸 부사장은 29일 서울 양재 엘타워에서 열린 ‘글로벌 AI 프라이버시 포럼(Global AI Privacy Forum)’ 기조연설에서 “AI의 판단 편향성이 학습데이터 구성에서 비롯될 수 있다”며 “동의와 개인정보 보호, 공정한 보상, 다양성을 반영한 데이터로 모델의 편향을 평가해야 한다”고 강조했다.

샹 부사장은 이날 소니가 개발한 공정성 평가 데이터셋 ‘피비(FHIBE, Fair Human-Centric Image Benchmark)’를 소개했다. 피비는 사람 중심 컴퓨터 비전 모델이 피부색과 연령, 성별 대명사 등 서로 다른 집단에서 어떤 편향을 보이는지 점검하기 위해 설계한 데이터셋이다. 소니는 데이터 수집 과정에 동의와 개인정보 보호, 지식재산권, 공정한 보상, 안전성, 다양성 원칙을 적용했다.

사람을 대상으로 하는 컴퓨터 비전은 얼굴·신체 인식부터 자세 추정, 본인 확인, 이미지 생성 등에 활용된다. 문제는 모델을 만드는 데 사용한 데이터의 구성에 따라 특정 집단에서 성능 차이가 발생할 수 있다는 점이다.

샹 부사장은 “AI 개발자가 어떤 데이터를 선택하느냐에 따라 모델의 판단도 달라질 수 있다”고 설명했다. 기존 주요 데이터셋이 일부 국가와 인구집단에 집중되면서 국가나 인종 등에 따라 이미지 인식 성능에서 차이가 나타날 수 있다는 것이다. 그는 “실제 얼굴인식 모델은 학습 과정에서 많이 접한 인구집단을 상대적으로 더 정확하게 인식하는 경향을 보였다”고 덧붙였다.

웹 이미지, 쉽게 구하지만 개인정보 동의는 생략

샹 부사장은 기존의 데이터 수집 방법마다 한계가 있다고 설명했다. 인터넷에서 이미지를 자동 수집하는 웹 스크래핑은 대량의 데이터를 저렴하게 확보할 수 있다. 대신 정보주체의 동의를 받지 않았을 가능성이 크고 개인정보와 저작권 문제가 발생할 수 있다. 사진 속 사람이나 창작자에게 보상하기도 어렵다.

스톡 이미지도 대안이 될 수 있지만 한계가 있다. 과거 촬영 당시 사진 사용에 동의했더라도 당사자가 자신의 이미지가 생성형 AI 모델에 활용될 것까지 예상했다고 보기 어려울 수 있다는 것이다.

합성 이미지 역시 모든 문제를 해결하지는 못한다. 이미지를 생성한 AI 모델이나 개발자가 가진 편향이 합성 데이터에 반영될 수 있다. 실제 환경에서 얻은 이미지와 합성 이미지 사이의 차이도 존재한다. 반대로 사람을 직접 모집해 동의를 받고 데이터를 수집하면 수집 과정을 통제하고 보상할 수 있지만 비용이 많이 들고 세계적으로 다양한 참여자를 확보하기 어렵다.

◈ AI시대를 선도하는 Voice AI(온라인)

일시 : 2026년 9월 30일 (수) 14:00 ~ 15:00
장소 : 온라인 웨비나

샹 부사장은 이런 문제를 해결하려면 AI 데이터 수집 단계부터 ▲동의 ▲개인정보와 지식재산권 보호 ▲공정한 보상 ▲안전성 ▲다양성을 함께 고려해야 한다고 강조했다.

81개 국가·지역 1981명 참여한 ‘피비’

소니AI가 이러한 원칙을 실제 데이터 수집에 적용한 결과가 바로 피비다. 피비는 사람을 대상으로 하는 컴퓨터 비전 모델의 편향을 측정하기 위한 공개 데이터셋이다. 국제학술지 네이처(Nature)에 지난해 공개된 연구에 따르면, 피비는 81개 국가·지역의 1981명이 참여한 1만318장의 이미지로 구성됐다. 피부색과 연령, 조상 계통 등 다양한 특성을 함께 살펴볼 수 있도록 상세한 주석 정보도 담았다.

핵심은 피비가 일반적인 AI 학습용 데이터셋이라기보다 모델의 편향을 점검하는 평가용 데이터셋이라는 점이다. 자세 추정과 사람·얼굴 탐지, 얼굴 인증, 이미지 분할, 시각 질의응답 등 여러 사람 중심 컴퓨터 비전 작업에서 집단별 성능 차이를 확인할 수 있다. 소니AI는 피비를 모델 학습에 사용하는 것을 원칙적으로 제한하고 공정성 평가와 편향 완화를 목적으로 사용하도록 했다.

샹 부사장은 “피비는 윤리를 위해 만들어졌고 윤리적인 방식으로 구축됐다”고 강조했다. 기존 데이터보다 세부적인 정보를 담아 성별 대명사와 연령, 피부색 등 여러 요소가 겹쳤을 때 모델에서 어떤 편향이 나타나는지도 살펴볼 수 있도록 설계했다는 것이다.

동의 철회부터 개인정보 삭제·보상까지

소니AI는 피비의 데이터 수집 방식에 개인정보 보호 원칙을 적용했다. 참여자가 자신의 이미지가 어떻게 사용되는지 이해한 상태에서 동의하도록 했고, 이후에도 동의를 철회할 수 있도록 했다. 사진에 우연히 찍힌 사람이나 차량 번호판처럼 불필요한 개인정보는 제거했다. 이미지에 포함된 로고 등 제3자의 지식재산권도 점검했다. 자동화된 방식과 사람의 검토를 함께 사용해 개인정보가 제대로 제거됐는지도 확인했다.

또한 데이터 제공자에 대한 보상도 설계 단계에 포함했다. 소니AI는 데이터 수집업체와 계약하면서 참여자가 해당 지역의 최저임금 이상을 받도록 했다. 샹 부사장은 “실제 참여자가 받은 보상은 평균적으로 현지 최저임금의 12배 수준이었다”고 말했다.

안전성을 위해 폭력적이거나 불법적인 콘텐츠를 걸러내는 과정도 거쳤다. 아동 성착취물과 관련해서는 미국 국립실종학대아동센터(NCMEC)의 알려진 자료와 대조해 문제가 되는 이미지가 포함되지 않았는지 확인했다는 것이다.

부사장은 “소니AI가 개발한 피비의 목적은 특정 AI 모델 하나를 더 정확하게 만드는 데 있지 않다”며 “개발자가 모델을 배포하기 전에 여러 집단에서 성능 차이가 나타나는지를 확인하고, 편향이 발견되면 원인을 추적할 수 있는 기준을 제공하는 데 있다”고 강조했다. 이어 “피비는 하나의 완성된 해답이라기보다 AI 데이터 수집 방식을 바꾸기 위한 출발점”이라고 덧붙였다.

글. 바이라인네트워크
<곽중희 기자>god8889@byline.network

일간 바이라인 구독하기

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다


The reCAPTCHA verification period has expired. Please reload the page.