[그게 뭔가요] 떠들지 않는 AI 모델 JEV
최근 AI 모델계에 신선한 충격을 던진 새로운 유형의 AI가 등장했다. 타입세이프AI란 스타트업에서 베타로 선보인 ‘제브(JEV)’다. 기존의 언어모델처럼 수다스럽게 떠들지 않고, 말하지 않는 대신 확률만 던지는 모델이다.
타입세이프AI는 지난 15일 소프트웨어가 직접 사용할 수 있는 빠르고 구조화된 의사결정을 내리도록 설계된 새로운 유형의 모델 ‘시스템원모델(System One Model)’을 발표했다. 이에 기반한 첫번째 오픈 모델로 ‘제브’를 얼리액세스로 공개했다.
제브는 트랜스포머 기반의 AI 모델이지만, 대형언어모델(LLM)은 아니다. 자연어로 만들어진 문자열을 생성하는 대신 확률을 생성한다. LLM이 인간에게 선호되는 문자열과 답변을 생성하는 반면, 제브는 시스템 작업 결과에 대한 선택지별 확률을 생성한다. 타입세이프 측은 이를 ‘타입 안전성을 보장하는 구조화된 값’이라고 표현한다. 모든 답변은 보정된 확률과 신뢰도 점수를 함께 제공한다.
예를 들어 ‘지난달 결제된 금액을 돌려받고 싶다’는 고객의 문의를 받았다고 가정하자. LLM은 무슨 문의인지 분류하라는 프롬프트에 ‘환불 문의’란 텍스트를 생성하고, 애플리케이션은 이 텍스트를 다시 파싱하거나 JSON 스키마에 맞는지 확인한다. 제브는 애초에 가능한 결과를 ‘환불/기술적/영업/기타’ 등으로 정해두고 환불이란 타입 값과 각 선택지의 확률을 돌려준다. 환불 문의이므로 환불이란 타입의 확률이 높게 나온다.
기존 LLM과 유사한 수준의 지능을 달성하면서도 속도와 효율성을 대폭 향상시킬 수 있다. 무엇보다 자연어를 사용하지 않으므로 토큰을 출력하지 않아서, 출력 토큰이 무료다. 입력 토큰은 100만단위 대신 십억 단위로 사용량을 계산한다. 사용자가 미리 출력을 정의하므로, 모델이 잘못된 결과를 내놓지 않는다.
이밖에도 LLM과 제브 사이에 기술적인 차이가 많다. LLM이 RLHF와 검증 가능한 보상 기반의 강화학습(RLVR)으로 최적화됐다면, 제브는 보정된 의사결정 기반 강화학습(RLCD)으로 최적화됐다. LLM이 토큰의 추출을 이전 토큰에 따라 조건부 순차적으로 생성하는 데 비해, 제브는 단일 쿼리로 모든 출력을 병렬로 생성한다.
속도가 LLM보다 어마어마하게 빠른 것으로 설명된다. 프론티어 모델의 전체 응답시간이 3~329초 사이라면, 제브의 전체 응답 시간은 70밀리초~500밀리초다. 40~200배 더 빠른 속도다.

회사측은 모든 출력에서 확신도(confidence)와 불확실성을 함께 전달하고, 높은 확신도일수록 정확도가 높아진다고 한다. LLM의 고질적 문제인 환각이 없다는 설명이다.
일시 : 2026년 9월 30일 (수) 14:00 ~ 15:00
장소 : 온라인 웨비나
회사는 새로운 모델 아키텍처와 병렬 샘플러, RLCD 방법론 등을 개발했다고 강조했다. 제브를 최첨단 정보 분석 함수 호출이라고 비유했다.
타입세이프AI는 오픈AI 챗GPT 개발에 참여하고 인간피드백 기반 강화학습(RLHF) 기법을 발명한 디오고 알메이다가 창업한 회사다. 디오고 알메이다 외에 메타 출신인 사샤 셍 COO, 에릭 카프니 CTO 등이 핵심 인물이다.
디오고 알메이다는 제브를 발표한 문서에서 “모델들은 수년간 채팅에서 인간을 초인적으로 능가해 왔는데, 그렇다면 자동화는 어디에 있는 걸까”라고 자문하며 시작했다.
그는 “오픈AI에서 언어 모델이 지시를 따르고 사람과 대화하는 데 유용하게 쓰일 수 있도록 하는 방법론을 개발하는 데 참여했고, 그 연구가 결국 챗GPT의 기반이 됐다며” “당시에는 채팅 모델이 인공 일반 지능(AGI)으로 이어질지도 모른다고 생각했지만, 과대광고에도 불구하고 뭔가 정말 중요한 것이 빠져 있다는 것을 깨달았다”고 적었다.
이어 “2년간의 비밀 개발, 수많은 기술적 난관, 그리고 연구 성과 끝에 첫 시스템원 모델을 출시하게 됐다”며 “이 모델은 소프트웨어가 직접 사용할 수 있는 빠르고 구조화된 의사 결정을 내리도록 설계된 새로운 유형의 첨단 모델”이라고 강조했다.
RLCD와 RLHF
RLCD(Reinforcement Learning for Calibrated Decisions)는 판단의 확률이 실제 정확도와 잘 맞도록 하는 방법이다. 모델이 90% 확신도라고 생성했을 때 실제 행위에서도 90% 내외 확률로 일어나게 만드는 것이다. 진실과 거짓을 구분하는 LLM과 달리 판단의 신뢰성을 더 중요하게 보는 업무 자동화를 감안한 방법이다.
RLHF는 인간의 선호에 맞는 답을 내놓게 AI 모델을 학습시킨다. 사람과 AI가 자연어로 자연스럽게 대화하는데 초점을 맞춘다. 하지만, AI 모델이 주로 소통하는 워크로드를 소프트웨어로 두면 자연어 대화는 오히려 불편하다. 기계와 기계가 소통하는데 인간의 언어를 사용하려 토큰을 소모하는 절차를 거쳐야 하기 때문이다. 제브는 텍스트를 생성하는 대신 예와 아니오란 두가지 선택지 중 하나에 확신도 점수를 매겨 판단에 활용하는데 초점을 맞춘다.

타입세이프 측은 제브의 성능을 강조하기 위해 자체 개발 벤치마크 테스트 결과를 제시했다. 프론티어 모델과 비교해 193.6배 더 빠르고, 444.6배 더 저렴하다고 주장했다. 공개된 둠 게임 데모에서 제브는 초당 10개의 쿼리를 실행하는데 시간당 약 7달러의 비용만 썼다.
왜 주목받나
AI 활용이 단순한 챗봇과 검색을 넘어 AI 에이전트로 진화하면서 실제 행위를 수행하기 위한 판단의 능력이 더 중요해졌다. 에이전트가 의사결정하는 단계에서 LLM 대신 제브를 사용하면 속도와 정확도를 함께 높일 수 있다. 단순한 판단을 내려야 하는 상황에 굳이 LLM이란 고비용이면서 부정확한 모델로 시간과 돈을 낭비하지 않아도 된다. 오히려 순간적인 판단의 정확도를 높여 업무의 효율을 획기적으로 높일 수 있다.
인간의 모든 일은 크고 작은 판단과 의사결정의 연속이다. 그럴듯한 거짓말로 확률적 의사결정을 포장하는 LLM보다 제브처럼 확률에 근거한 판단만 내리는 모델을 쓰면 소모적인 의사결정을 줄일 수 있다.
이에 전문가들은 제브를 사용해 판단 모델(제브), 추론 모델(LLM), 도구 등으로 AI 에이전트 아키텍처로 분화시킬 수 있을 것으로 전망하고 있다.
입력 분류, 라우팅, 점수화 등은 제브에게 맡기고, 복잡한 분석과 계획, 추론을 고성능 LLM에게 맡기는 형태다.
어디서 영감받았나
시스템원모델은 다니엘 카네만의 ‘생각의 속도와 느림’에서 영감을 받은 이름이다. 다니엘 카네만은 인간의 사고를 설명하기 위한 개념으로 시스템1과 시스템2란 용어를 사용했다. 시스템1은 빠르고 자동적이며 무의식적으로 작동하는 사고를 의미한다. 시스템2는 의식적이고 느리며 상당한 집중을 요구하는 사고다. 수많은 변수를 고려해 판단하는 사고는 시스템2에 해당하고, 특별한 변수 없는 단순 사칙 연산은 시스템1에 해당한다.
타입세이프는 카네만의 시스템1 개념을 차용해 입력에 즉각적인 판단을 만들어내는 메커니즘을 AI 모델로 구현한다는 아이디어를 갖고 있다. 환불 요구에 환불을 묻는 질문인가를 판단하는 상황에서 제브를, 환불을 할 지 말 지를 결정해야 하는 상황에서 추론 모델을 사용하는 게 가능하다.
타입세이프는 제브를 AI 워크플로우에서 분류, 라우팅, 점수화, 추출, 분기, 대규모 데이터의 피처 생성, 저지연 실시간 애플리케이션, LLM 출력 평가 및 가드레일 등에 활용할 수 있다고 설명한다.
제브란 명칭은 19세기 경제학자 윌러엄 스탠리 제본스의 이름에서 따왔다. 그의 이름에서 비롯된 ‘제본스 역설’은 상품 가격 하락이 상품의 사용량 증가로 이어지는 것을 설명한다.
디오고 알메이다는 “증기기관의 효율성 향상으로 석탄 수요가 증가했듯 기계 지능도 비슷한 경로를 밟을 것으로 예상된다”며 “지능 개발 비용이 10분의 1로 줄어들때마다 활용 사례도 10분의 1로 늘어난다”고 강조했다.

주의할 점
타입세이프 측은 제브를 ‘확각이 없다’고 주장한다. 이는 일정부분 맞지만, 과장이기도 하다. 제브는 출력할 수 있는 타입과 선택지를 미리 정의하므로 존재하지 않는 정보를 만들어내지 않는다. 이 점에서 환각이 없다고 할 수 있다. 다만, 선택지 중 어느것도 확정적이지 않은데 반드시 하나를 선택해야 하는 상황이라면 틀린 결정을 내놓을 수도 있다.
제브는 무조건적인 AI 활용에서 최적화로 수요 트렌드가 변화하는 와중에 나타났다. 여러 상황에 따라 다양한 모델을 최적화해 사용하고, 비용과 성능 문제를 해결하는 데 관심을 갖기 시작한 시장의 수요가 제브에 환호하게 만들고 있다.
회의적지만 흥분하는 커뮤니티
커뮤니티는 호기심과 의심을 동시에 내놓고 있다. 해커뉴스에서 1000포인트를 받을 정도로 폭발적인 반응을 이끌어냈지만, 과장된 마케팅과 벤더 벤치마크란 지적도 적지 않다.
일부 전문가는 기존의 BERT와 다르지 않다고도 지적했다. BERT는 Bidirectional Encoder Representations from Transformers의 약자로 구글에서 2018년 공개한 트랜스포머 인코더 기반 언어 모델이다. 문장을 왼쪽에서 오른쪽으로만 읽지 않고, 문장의 앞뒤 문맥을 고려해 단어와 문장의 의미를 표현한 게 핵심이다. BERT 논문은 모델에 별도의 분류 방법을 써서 확률을 반환하게 했다. 비정형 상태를 받아 타입 지정된 확률적 판단으로 반환한다는 제브의 특징이 BERT의 구현 방법과 유사하다.
그럼에도 빠른 판단을 내려준다는 점에서 분류 워크로드를 핵심으로 사업에 활용하는 곳은 제브를 빠르게 채택하고 있다. 오픈라우터, 버셀(Vercel), 클라우드플레어가 제브를 채택했다.

에이전트 인프라 구축 회사인 버셀의 프라닛 샤르마 소프트웨어 엔지니어는 오픈AI의 챗GPT-5.6 루나를 사용해 명령어의 안전성을 검토하는 분류기를 실행해왔는데, 제브로 교체해 속도를 5~18배 높이고 정확도도 높아졌다고 밝혔다.
브리요AI의 니킬 무도카르 CTO는 비즈니스 이메일 분류에서 제브와 제미나이를 비교 테스트했다. 그는 “제미나이가 약간 더 정확하지만, 비용이 10~20배 비싸다”며 “제브가 실제 확률을 반환하는 유일한 도구이기 때문에 워크플로우 자동화에 이상적”이라고 밝혔다.
글. 바이라인네트워크
<김우용 기자>yong2@byline.network
함께 보면 좋은 자료


