(출처=구글)
| |

구글, 출력 토큰 100만개 품은 ‘제미나이 4 아르곤’ 공개

구글은 최대 100만개의 출력 토큰을 처리하고 소프트웨어 엔지니어링과 창의적 글쓰기, 사이버 보안 업무 등 기업 업무를 자율적으로 수행하는 차세대 인공지능(AI) 모델 ‘제미나이 4 아르곤(Gemini 4 Argon)’을 1일 공개했다.

코라이 카부크쿠오글루 구글 딥마인드 수석 부사장 겸 수석 AI 아키텍트는 아르곤이 법률·금융·사이버 보안·소프트웨어 개발 등 장시간이 소요되는 복잡한 업무를 자율적으로 수행하도록 설계됐다고 설명했다. 현재 미국 정부의 사전 검증을 거치고 있으며, 사이버 방어 전문가 대상 프로그램인 ‘페어윈드(Fairwind)’를 통해 우선 제공되고 있다. 향후 유료 응용 프로그램 인터페이스(API) 고객과 구글 AI 울트라 구독자 및 기업·개발자·일반 소비자 등을 대상으로 순차적으로 공급을 확대할 계획이다.

아르곤의 가격은 입력 토큰 100만개당 2달러, 출력 토큰 100만개당 10달러이며, 캐시된 입력 토큰에는 95% 할인 요금이 적용된다.

구글은 아르곤의 출력 토큰 한도를 기존 6만4000개에서 100만개로 확대했다. 이를 바탕으로 수천 명의 구글 직원이 코딩, 연구, 문서 작성 등 내부 워크플로우에 모델 아르곤을 활용하고 있다고 밝혔다. 구글 연구진은 양자 컴퓨팅 알고리즘의 자원 최적화 작업에도 아르곤을 투입해 기존 기준보다 40% 개선된 결과를 얻었으며, 데이터센터 메모리 최적화 작업으로는 현재 300테비바이트(TiB)를 확보했다. 메모리 확보 규모는 향후 500TiB에서 1PiB까지 늘어날 것으로 전망했다.

아르곤의 장문맥 처리 능력은 대규모 코드베이스의 언어 전환 작업에서도 효과를 보였다. C/C++는 실행 속도와 성능이 높아 시스템 프로그래밍에 널리 사용돼 왔지만, 메모리 안전성 측면에서 한계가 있다. 구글은 이를 보완하기 위해 메모리 안전성이 높은 러스트로의 전환을 추진하고 있다. 아르곤은 정규 표현식 처리 라이브러리 re2, 오픈소스 비디오 디코더 libgav1부터 80만줄 이상의 퓨시아 지르콘 커널까지 코드 변환을 수행한다.

구글은 libgav1을 러스트로 전환하는 과정에서 아르곤이 3만2000줄의 단일 명령어 다중 데이터(SIMD) 코드를 분석하고 다시 작성했다고 전했다. 변환된 코드는 기존 비디오 출력 결과를 유지하면서 기존 러스트 포팅 버전보다 2.7배 빠른 속도를 기록해 원본 C++ 성능에 근접했다. 구글은 변환 코드를 자동 및 수동으로 검토한 뒤 실제 환경에 배포한다.

지식 노동 및 코딩 역량을 평가하는 주요 산업 벤치마크에서 아르곤은 경쟁 AI 모델 대비 뚜렷한 격차를 보였다.

실무 소프트웨어 엔지니어링 능력 평가(DeepSWE v1.1) 지표 (출처=구글)
하비 법률 에이전트 벤치마크 점수 지표 (출처=구글)

이밖에 소프트웨어 엔지니어링 실무 성능을 평가하는 DeepSWE v1.1 벤치마크에서 77.9%를 기록하며, 74.2%인 클로드 오퍼스 5.5와 74.1%인 GPT-6 아스트라, 67.4%인 클로드 페이블 5.1과 차이를 보였다.

미국 국내총생산(GDP) 기여도 기반의 경제적 영향력 평가 지표인 발스 인덱스에서 아르곤은 68.9%를 기록했다. 이는 67.0%인 클로드 오퍼스 5.5와 65.8%인 클로드 페이블 5.1, 63.1%인 GPT-6 아스트라를 모두 앞선 수치다.

다단계 재무 연구 및 분석 능력을 평가하는 발스 파이낸스 에이전트 v2에서도 65.4%를 달성해 1위를 차지했다. 경쟁 모델인 클로드 페이블 5.1은 58.9%, 클로드 오퍼스 5.5는 58.6%, GPT-6 아스트라는 53.5%로 약 6.5~11.9% 점수 격차를 보였다.

장기 법률 업무 능력을 평가하는 하비 법률 에이전트 벤치마크에서는 19.6%를 획득했다. 6.7%인 클로드 페이블 5.1과 5.4%인 GPT-6 아스트라, 3.8%인 클로드 오퍼스 5.5와 비교했을 때 가장 큰 성능 차이를 나타냈다.

기업 워크플로우 자동화를 평가하는 오토메이션벤치 결과 지표 (출처=구글)
실제 환경에서의 보안 취약점 발견 및 침투 테스트 벤치마크 지표 (출처=구글)
간접 프롬프트 주입 방어력을 나타내는 그레이 스완 IPI 벤치마크 지표 (출처=구글)

또 아르곤은 기업 업무 자동화 능력을 평가하는 재피어의 오토메이션벤치에서 51.3%, 차트 분석과 장시간 비디오 이해 능력을 평가하는 LVBench에서 91.7%를 기록했다. 사이버 보안 분야에서는 취약점 탐지와 대응에 활용된다. 구글은 보안 전문가와 내부 보안팀을 대상으로 일부 안전장치를 조정한 아르곤을 별도로 제공한다고 밝혔다.

보안 기업 위즈는 공공 인프라 보호 프로젝트인 스캔 포 굿에 아르곤을 활용해 기존 모델이 발견하지 못한 병원 의료 소프트웨어의 민감 정보 노출 취약점을 발견했다고 설명했다. 취약점 대응 능력을 평가하는 CWE-bench v1에서는 68%를 기록해 그록 4.7 오픈코드, GPT-6 아스트라 코덱스와 함께 공동 1위에 올랐다.

위즈의 블랙박스 침투 테스트에서도 아르곤은 소스 코드 없이 실제 웹 시스템을 분석해 공격 표면을 식별하고 개념 증명(PoC)을 생성하는 능력을 보였다. 블랙박스 침투 테스트는 시스템의 소스 코드나 내부 구조에 대한 아무런 사전 정보 없이, 실제 외부 해커와 동일한 관점에서 라이브 시스템을 공격해 보안 취약점을 찾아내는 점검 기법이다. 해당 테스트에서 70.9%를 기록해 이전 세대 모델인 3.8 플래시 사이버의 58.2%보다 12.7%포인트 상승한 성능을 보였다.

구글은 아르곤의 광범위한 출시에 앞서 프런티어 안전 프레임워크를 기반으로 안전장치를 강화하고 있다. 화생방·핵 관련 악용 요청을 거부하도록 시스템을 개선하는 한편, 합법적인 이중 용도 과학 연구는 허용하도록 설계했다. 그레이 스완의 간접 프롬프트 주입(IPI) 벤치마크에서는 악의적 지시나 문맥 탈취 공격에 대한 방어력을 평가했다.

이어 사용자의 의도에서 벗어난 행동을 막기 위해 오정렬 완화 시스템을 적용했다. 모델의 사고 과정을 실시간으로 감시해 위험이 감지되면 작업을 중단하고 담당팀에 알린다. 구글은 감시 결과를 훈련 데이터에 반영하지 않아 모델이 감시를 회피하는 방법을 학습하지 않도록 했다고 설명했다. 고위험 훈련 전에는 샌드박스 환경을 격리하는 등 보안 절차도 마련해 파트너들과 공유할 계획이다.

구글 측은 “초기 사이버 방어 전문가 및 신뢰할 수 있는 테스터들의 실제 평가와 피드백을 수렴해 시스템을 한층 더 강화할 것”이라며 “이러한 안전성 검증을 거친 후 유료 API 고객과 구글 AI 울트라 구독자를 시작으로 시장 전반에 모델 접근 권한을 공식 확대하겠다”고 밝혔다.

글. 바이라인네트워크
<김원민 기자>wmkim627@byline.network

일간 바이라인 구독하기

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다


The reCAPTCHA verification period has expired. Please reload the page.