오픈AI “AI 에이전트가 업무 수행, 엔지니어 역할은 지휘·검증으로”
“묻는 말에만 답하던 단발성 챗봇을 넘어 인공지능(AI)이 스스로 도구를 다루며 다단계 업무를 완수하는 에이전트 시대가 열렸습니다. 이제 인간 엔지니어의 역할은 직접 코드를 짜는 단순 실행자가 아니라 명확한 목표를 설정하고 하루 평균 3.1명 분량의 AI 에이전트를 지휘·검증하는 총괄 설계자입니다.”
리처드 호(Richard Ho) 오픈AI 하드웨어 총괄 부사장(VP)은 30일 서울 서초구 삼성전자 서초사옥에서 열린 ‘삼성 AI 포럼 2026’ 기조연설에서 이같이 밝혔다. 이번 포럼은 ‘디 에이전틱 시프트(The Agentic Shift: From Intelligence to Impact)’를 주제로, AI가 지식 제공을 넘어 스스로 판단하고 작업을 수행하는 방식에 대해 논의하기 위해 마련됐다.
호 부사장은 이날 ‘챗봇에서 에이전틱 워크플로우로’를 주제로 발표하며 엔지니어링 분야에 도입된 AI 에이전트의 실증 데이터를 구체적으로 공개했다.

대화형 챗봇과 에이전트의 차이는 목표 설정과 자체 수정 능력이다. 호 부사장은 “챗봇은 턴 바이 턴(turn-by-turn) 방식으로 질문에 답하는 데 그치지만 에이전트는 목표를 설정하고 도구를 사용하며 다단계 과정을 수행한다”며 “이 과정에서 결과를 스스로 확인하고 필요에 따라 절차를 조정한다”고 설명했다. 인간이 단일 답변을 얻는 체제에서 업무 전체를 AI에 위임하는 구조로 변화했다는 의미다. 에이전트는 개별 질문에 답하는 것을 넘어 목표 달성에 필요한 작업을 여러 단계에 걸쳐 수행한다는 설명이다.

이러한 전환은 수학적 난제 해결 과정에서 확인된다. 수세대 동안 수학자들을 괴롭힌 나비에-스토크스 문제 증명에 1만명의 에이전트가 투입돼 88시간 만에 결과를 도출했다. 호 부사장은 “에이전트들은 인터넷 캐시 버전을 참조하며 작은 그룹으로 소통해 270만개의 메시지와 1300억개의 출력 토큰을 생성했다”며 “이후 린 정형화(Lean formalization)라는 검증 단계를 17시간 동안 독자 수행했다”고 덧붙였다.
에이전트의 독립적 실행력은 객관적인 벤치마크 평가에서도 나타난다. 오픈AI의 프론티어매스 평가에서 모델은 97.6%의 점수를 기록했으며, 컴퓨터 지원 설계 평가인 벤치캐드에서는 95.9%를 달성했다. 오픈AI의 프론티어매스 평가는 AI 모델의 고차원적인 연구 수준 수학 문제 해결 능력을 측정하기 위해 고안된 초고난도 수학 성능 평가 지표다.
또 야간 회귀 테스트에서 에이전트는 스스로 로그를 분석해 코드를 고치고 유의미한 결론을 얻을 때까지 반복 작업을 수행한다. 야간 회귀 테스트는 소프트웨어 개발 중 새롭게 수정된 코드가 기존 시스템에 새로운 오류를 일으키지 않았는지 매일 밤 자동으로 실행해 검증하는 테스트다.


단순 실행에서 벗어난 업무 위임 현상은 통계 수치로 입증된다. 지난 6월 기준 코덱스 모델 환경에서 생성된 출력 토큰 비율은 전체의 64%를 차지했다. 호 부사장은 “기술 채택에 적극적인 프론티어(Frontier) 기업은 일반 회사에 비해 에이전트 사용량이 8.3배 더 높다”며 “재사용 가능한 지침인 플러그인(Plugin)과 도구 활용법인 스킬(Skill) 채택 비율 역시 프론티어 기업이 각각 2.3배, 6.3배 높다”고 짚었다.



하드웨어 반도체 설계 분야에도 AI가 직접 참여한다. 호 부사장의 연구팀은 브로드컴, 셀레스티카와 협력해 맞춤형 추론 칩인 할라피뇨 설계 전 과정에 에이전트를 투입했다. 브로드컴과 셀레스티카는 오픈AI와 협력해 맞춤형 AI 칩 할라피뇨의 설계와 생산을 함께 담당한 글로벌 반도체 및 하드웨어 제조 기업이다. 맞춤형 추론 칩인 할라피뇨는 AI 에이전트의 도움을 받아 단기간에 설계를 마치고 전력 효율과 응답 속도를 지연 시간 최대 72% 단축 극대화한 핵심 하드웨어다.
호 부사장은 “컴파일러 및 네트워크 구성을 포함한 설계에 AI를 적용해 9개월 만에 테이프아웃(Tape-out)을 완료했다”며 “AI 주도의 최적화를 통해 연산 블록 면적을 8~10% 줄이고 초기 베이스라인 대비 성능을 287배 올렸으며 응답 지연 시간은 43~72% 단축했다”고 덧붙였다.

기계가 다단계 실행 과정을 직접 처리하면서 인간의 업무 생산성은 향상되는 추세다. 오픈AI의 지난달 중순 내부 연구원 집계 결과에 따르면, 인간 엔지니어 1명의 하루 근무 8시간 기준 시간 당 투입된 에이전트 워크데이는 평균 3.1배에 달하는 것으로 나타났다. 이는 한 명의 작업자가 여러 에이전트를 병렬로 가동하며 본인의 기본 업무 외에 3명 이상의 추가 인력이 필요한 업무량을 동시에 소화하고 있음을 의미한다.
호 부사장은 “작업의 병목 현상은 이제 단순 실행이 아니라 실험 설계, 물리적 장비에 대한 접근, 산출물 검토, 그리고 다음에 에이전트에게 지시할 유용한 질문을 선택하는 인간의 의사결정 영역으로 이동했다”며 “결국 인간의 직무는 직접 실무를 수행하는 것에서 여러 에이전트를 효율적으로 운영하고 통제하는 방향으로 바뀌게 될 것”이라고 진단했다.

글로벌 기업들의 에이전트 워크플로우 도입 성과도 나타나고 있다. 삼성전자는 한국 내 전체 임직원과 전 세계 디바이스경험(DX) 부문 직원을 대상으로 챗GPT 엔터프라이즈와 코덱스를 도입해 연구개발(R&D), 제조, 소프트웨어, 마케팅 등 업무 전반에 활용하고 있다. 영국 항공사 버진 애틀랜틱은 에이전트를 활용해 2주가 걸리던 레거시 코드 개선 작업을 30~60분으로 단축했다. 새로운 애플리케이션(앱) 도입 과정에서 단위 테스트 커버리지를 100% 수준으로 유지하고, 앱 출시 단계의 우선순위 결함(P1)을 0건으로 줄였다.
시스코는 C/C++ 코드 환경에서 에이전트를 활용해 버그 해결 속도를 기존 대비 10~15배 높였다. 15개 이상의 상호 연결된 저장소 리포지토리에서 빌드 대기 시간을 20% 단축해 매월 1500시간 이상의 엔지니어링 시간을 절감했다. 트래블러스 보험 회사는 사고 발생 시 초기 보험 처리 접수에 AI 어시스턴트를 도입했다. 결과적으로 전체 고객의 85~90%가 인간 상담원의 개입 없이 AI와의 대화만으로 필수 정보를 제공하고 초기 접수를 완료했다.


호 부사장은 에이전틱 워크플로우의 도입과 운영을 위해 산출물의 특성에 맞는 검증 체계를 갖춰야 한다고 강조했다. 소프트웨어 변경은 리뷰와 통합 검사를 거치고, 수학 증명은 공식 확인을 수반하며, 고객 거래는 유효한 기록 및 정책 검토를 거치는 방식이다. 이어 그는 기업의 성공적인 기술 도입을 위한 ‘90일 파일럿 프로그램’ 방법론을 제시했다. 최초 1일부터 30일까지는 목표와 기준점을 정의하고, 31일부터 60일까지는 연계된 파일럿 테스트를 실행하며, 61일부터 90일까지는 결과를 평가하고 적용 범위를 확장하는 구조다.
호 부사장은 “이 90일의 과정 동안 전체 작업 소요 시간과 산출물의 품질, 투입된 인간의 노력, 결과 도출 비용을 직접 측정해야 한다”며 “에이전트 기계가 다단계 실행을 전담하는 환경에서 인간은 명확한 목표를 세우고 신뢰할 수 있는 성공 기준을 설정하는 의사결정에 역량을 집중해야 한다”고 말했다.
글. 바이라인네트워크
<김원민 기자>wmkim627@byline.network
함께 보면 좋은 자료


