오픈AI・AWS도 참전, Jev가 터뜨린 ‘디시전 AI’ 전쟁
판단형 AI 모델 ‘제브(Jev)’가 등장 2주일 만에 수많은 경쟁작을 마주했다. 자연어 토큰을 생성하지 않고, 판단의 정확성 확률만 따지는 모델이 AI 에이전트 환경에서 LLM보다 훨씬 더 효율적이란 아이디어가 새로운 경쟁 시장을 형성한 것이다. LLM이 독점했던 AI 애플리케이션의 ‘판단(decision)’ 기능을 별도의 모델 계층으로 분리하려는 새로운 경쟁이 시작됐다. Jev가 던진 질문은 오픈AI와 AWS까지 2주 만에 뛰어들게 만들었다.
타입세이프AI의 Jev는 ‘시스템원모델(System One Model)’이란 개념을 구현한 첫 모델이다. 타입세이프AI는 작업 자동화 과정의 모든 판단에 LLM을 쓰는 게 비효율적이며, 시스템 작업 결과에 대한 선택지별 확률을 통해 ‘타입 안전성을 보장하는 구조화된 값’에 기반해 판단해야 한다는 아이디어를 구체화했다.
이에 따라 Jev는 LLM처럼 인간에게 선호되는 자연어 문자열을 생성하는 대신 확률을 생성한다. Jev의 모든 답변은 보정된 확률과 신뢰도 점수를 함께 제공한다. Jev는 기존 LLM과 유사한 수준의 지능을 달성하면서도 속도와 효율성을 대폭 향상시킬 수 있다. 자연어를 사용하지 않으므로 토큰을 출력하지 않아서, 출력 토큰이 무료다. Jev는 보정된 의사결정 기반 강화학습(RLCD)으로 최적화됐고, 속도가 LLM보다 어마어마하게 빠른 것으로 설명된다. 프론티어 모델의 전체 응답 시간이 3~329초 사이라면, Jev의 전체 응답 시간은 70ms~500ms다. 40~200배 더 빠른 속도다. 회사 측은 프런티어 모델과 비교해 193.6배 더 빠르고, 444.6배 더 저렴하다고 주장했다. 공개된 둠 게임 데모에서 제브는 초당 10개의 쿼리를 실행하는 데 시간당 약 7달러의 비용만 썼다.(본지 설명 기사 참고)
AI 활용이 단순 채팅에서 AI 에이전트로 진화하면서 실제 행위에 필요한 판단의 능력이 더 중요해졌다. 에이전트가 의사결정하는 단계에서 LLM 대신 Jev 같은 모델을 사용하면 속도와 정확도를 함께 높일 수 있고, 시간과 돈을 낭비하지 않아도 된다. 이에 전문가들은 판단 모델(Jev), 추론 모델(LLM), 도구 등으로 AI 에이전트 아키텍처를 분화시킬 수 있을 것으로 봤다. 입력 분류, 라우팅, 점수화 등을 디시전 모델에게 맡기고, 복잡한 분석과 계획, 추론을 고성능 LLM에게 맡기는 형태다.
Jev는 디시전(Decision) AI 모델이란 개념의 상징처럼 받아들여졌고, 단기간에 수많은 경쟁작을 만들어냈다. 경쟁의 방향은 Jev처럼 토큰 소비를 없애고 판단 속도를 높이는 것으로 같다. 단, 구현 방식은 두 갈래다. Jev와 동일 성과를 내는 새로운 AI 모델 개발과, 기존 LLM에 판단 전문 도구를 붙이는 변형 개발이다.
Laya
9월 21일 컨브AI이노베이션스(ConvAI Innovations)에서 개발한 오픈소스 모델 Laya가 발표됐다. ModernBERT-large 기반의 4억2100만(421M) 매개변수 체크포인트와 가중치가 아파치 2.0 라이선스 기반으로 완전 공개됐다. Laya는 로컬과 온프레미스 배포로 데이터 외부 유출을 방지할 수 있고, 30ms 대의 극초저지연 응답 성능을 제공한다고 한다.
Laya는 기존의 모델을 기반으로 시스템1 디시전 모델을 구현한 것이다. BERT 계열 인코더에 디시전 헤드를 더해 선택지와 점수, 정확도를 반환한다. Jev처럼 RLCD를 활용했다고 한다. 개발사는 시스템1 모델을 구현하려 굳이 새로운 AI 아키텍처를 만들어야 하냐는 전문가들의 질문을 구체화했다. 인코더를 판단 작업에 특화시키는 것만으로도 Jev와 유사한 기능을 구현할 수 있다는 것이다.

GLiNER2.5-Decide
지난달 24일 파스티노(Fastino)란 회사가 Jev보다 경량의 디시전 AI 모델인 ‘GLiNER2.5-Decide’를 아파치2.0 라이선스 기반의 오픈웨이트 모델로 발표했다. 모델에 텍스트와 타입화된 질문을 넣으면, 답과 확률, 확신도, 제약 조건의 실현 가능성(constraint feasibility) 등을 반환한다. Jev와 유사한 목적의 구현 방식인 BERT 계열 인코더 접근법을 개선한 것이다.
특이사항은 3억4000만개의 상대적으로 적은 매개변수 규모다. Jev보다 경량화돼 로컬 환경에서 돌릴 수 있다. 분류뿐 아니라 개체/관계 추출과 여러 출력 간 제약조건(constraint)도 처리할 수 있다고 한다.
AutoTrust Jev-27B
9월 27일 알리바바의 큐웬(Qwen) 3.8-27B에 1억900만 매개변수 규모의 디시전 블록을 결합한 ‘AutoTrust Jev-27B’도 나타났다.
큐웬3.8의 LLM을 그대로 활용하면서 디시전 모듈을 추가해 하나의 모델에서 빠른 판단(시스템1)과 복합 추론(시스템2)을 모두 사용할 수 있다는 게 특징이다. 제작사인 오토트러스트는 Jev 1.13과 6개 퍼블릭 디시전 벤치마크를 비교한 결과를 제시했는데, JEV-27B가 평균 84.07%, Jev가 83.85%로 더 앞섰다.
d1
9월 29일 리퀴드AI(Liquid AI)에서 ‘d1’이란 API형 상용 디시전 모델을 출시했다. 사용법은 Jev와 비슷하고, 상태와 타입화된 질문을 모델에 던지면, 선택지, 점수, 확신도(Noul)를 반환한다. 현재 ‘d1:free’란 API 모델로 제공된다. 독립적인 타입화된 질의 벤치마크에서 Jev와 비교한 결과를 제시했다. 400개 케이스, 총 2000개 디시전 평가에서 d1은 정확도 0.742를 기록했고, 같은 평가에서 Jev 1.13은 약 0.727 수준을 기록했다고 한다.
파스티노의 2차전 GliDE
파스티노는 9월30일 시스템1과 시스템2를 다시 합치는 ‘GliDE(Generalized Lightweight Decision Engine)’를 발표했다. 질문을 받았을 때 빠른 판단을 요구하는 지 추가 추론을 해야할 지 불확실한 경우가 있다는 게 핵심이다. GliDE는 주어진 문제가 빠르게 판단하기 어렵거나 불확실하면 추가적인 추론 연산을 하도록 설계됐다. 파스티노는 이같은 적응형 연산 구조를 ‘싱킹 디시전 모델(Thinking Decision Model)’이라 부른다.
GliDE는 수백개 도구 가운데 하나를 고르는 ‘도구 선정(tool selection), 수많은 경로 가운데 다음 액션을 결정하는 에이전트 라우팅, 추론 결과를 검증하는 저지(judge) 같은 복잡한 에이전트 작업을 겨냥했다.
오픈AI ‘디시전 API’로 참전
10월 들어 기존의 주요 기업에서도 Jev 경쟁작을 발표했다.
오픈AI가 9월29일 데브데이에서 ‘디시전 API(Decisions API)’를 제한적 프리뷰로 선보였다. 디시전 API는 판단을 해야 하는 상황에 사용할 수 있는 API다. Jev와 같은 문제를 겨냥하지만, 별도의 모델을 제공하는 대신 경량화 모델인 GPT-6 루나를 선택 문제에 집중시키는 접근법이다.
판단을 원하는 질문에 문장으로 답변하지 않고, 개발자가 미리 정의한 유한한 답변 선택지 중 가장 적절한 것을 고르는 게 된다. 오픈AI는 이를 분류, 요청 라우팅, 에이전트의 다음 액션 선정 등에 사용할 수 있다고 설명했다. 오픈AI는 텍스트뿐 아니라 이미지를 컨텍스트로 받아 판단할 수 있다고 강조했다. 제품 사진을 넣어 판단을 요구하면 Jev처럼 확률을 표출하는 것이다.
AWS의 스트랜즈 디사이더
지난 1일 아마존웹서비스(AWS)가 ‘스트랜즈 디사이더 2B(Strands Decider 2B)’를 발표했다. 19억(1.9B) 매개변수 규모의 디시전 모델이다. AWS는 공식 발표문에서 Jev를 명확히 지칭하며 디시전 모델 범주의 중요성을 강조하기도 했다. AWS도 에이전틱 워크플로우에서 모델 라우팅, 도구 선정, 인자 검사, 선별, 가드레일, 평가 등을 적용 분야로 제시했다.
테크크런치에 따르면, AWS의 마크 브루커 디스팅귀시드 엔지니어가 Jev를 접한 뒤 디시전 모델에 관심을 갖고 구현한 게 스트랜즈 디사이더다. AWS는 모델 가중치, 학습 데이터, 학습 스크립트 등까지 모두 아파치2.0 라이선스로 공개했다.
구조는 Qwen3.5-2.5B-Base를 기반으로 하면서, LLM의 언어 모델링 헤드를 제거하고, 100만 매개변수 규모의 프런티어 헤드를 붙였다. 모델에 질문과 선택지를 던지면, 문장을 생성하지 않고 각 선택지를 평가한 결과를 내놓는다. Jev와 동일하게 noul, choice, score라는 세 가지 디시전 타입을 지원한다.
AWS는 엔비디아 RTX 3090 환경에서 115ms의 속도를 내며, 여러 질문을 한번에 던졌을 때 입력 테스트를 1회 처리하고 추가 질문마다 필요한 부분만 증가하도록 설계됐다고 밝혔다. 이는 에이전트가 동일한 상태에 여러 판단을 내려야 할 때 유용하다는 설명이다.
AWS는 타입세이프AI의 새로운 아키텍처 도입 방법 대신 기존의 에이전트 프레임워크에 가져오는 방안을 구체화했다.
클라우드플레어의 Clef
AWS의 발표와 같은날인 1일 클라우드플레어는 Clef란 디시전 모델을 발표했다. Clef 27B와 속도에 초점을 맞춘 Clef-flash 9B 등 2종이 출시됐으며, 아파치 2.0 라이선스로 가중치를 사용할 수 있다. 클라우드플레어도 직접 Jev를 거론하고 같은 계열의 모델이라고 설명했다.
기본적인 아이디어가 Jev와 매우 유사하지만 구현법은 다르다. Qwen3.8-27B를 기본으로 두고 조인트 스키마 헤드를 별도로 붙였다. 이 헤드가 큐웬의 최종 히든 스테이트를 읽고 각 질문과 선택지에 필요한 정보를 찾아 점수를 계산한다. 클라우드플레어는 큐웬 백본을 두고 rank-256 LoRA와 라우팅 헤드를 최적화했다고 설명했다. 확률 교정(calibration)을 위해 Brier loss를 사용했고, RLCD도 적용했다고 한다.
클라우드플레어는 아예 Jev 호환성을 전면에 걸었다. Clef는 Jev API와 100% 호환된다. 엔드포인트와 모델만 Jev에서 Clef로 바꾸면 바로 사용가능하다는 것이다. 하나의 요청에 최대 64개의 질문을 처리할 수 있고, 텍스트 외에 JSON이나 이미지 및 비디오도 판단할 수 있다고 강조했다.
기존 모델 활용, 경쟁 오픈소스 속속 등장
이밖에 Jev 같은 디시전 모델을 기존 LLM 개조로 구현하는 프로젝트와 제품이 속속 등장하고 있으며, 아예 Jev와 동일한 목적을 달성하는 오픈 모델 개발 프로젝트(Mapika Decider)도 나타났다. FLock.io란 회사가 9월 25일 발표한 THIS/THAT이란 모델은 Mapika Decider-2b에서 파생됐다고 명시될 정도로 새로운 오픈소스 계보가 만들어지고 있다. 그밖에 대놓고 이름부터 Jev를 겨냥한 ‘Kev’, 이미지 지원 디시전 모델을 지향하는 오픈소스 프로젝트 ‘imajev’, 분류 위주의 오픈소스 프로젝트 ‘Plumb-4B’, 한노랩스(Hanno Labs)에서 공개한 오픈웨이트 모델 ‘Bosun v3.1’ 등도 있다.
엔비디아의 CLM-8B
엔비디아도 발을 걸쳤다. 엔비디아와 스탠포드대학교 연구진이 공동 개발한 ‘CLM-8B’다. CLM-8B는 Jev를 그대로 복제한 모델은 아니며, 반복 사용하는 액션의 벡터 변환(representation)을 캐시해 디시전 지연시간을 줄이는 접근법이다. 연구진 평가 결과 일부 워크로드에서 Jev보다 9배 빠른 것으로 나타났지만, 도구 호출 정확도에서 Jev보다 뒤졌다.
글. 바이라인네트워크
<김우용 기자>yong2@byline.network
함께 보면 좋은 자료


