결정 모델은 답변을 길게 생성하는 대신, 정해진 선택지 가운데 하나를 고르는 AI 모델이다. 예를 들어 에이전트가 “다음에 어떤 도구를 써야 할까?”라고 판단해야 할 때, 허용된 답과 각 답의 점수나 확률을 반환한다. 토큰을 하나씩 이어 문장을 만드는 방식보다 반복적이고 지연 시간에 민감한 판단에 적합하다. 다만 확률이나 신뢰도 점수는 선택이 반드시 옳다는 보증이 아니다.
11
12
네 가지 모델, 무엇이 다른가
- TypeSafe AI의 Jev: 선택지·점수·확률 등 구조화된 결과만 반환하는 호스팅 모델이다. 공개된 가격은 입력 토큰 100만 개당 0.042달러이며 출력 토큰 요금은 없다. 응답 시간은 약 70~500ms로 보고됐다. 앱 안에서 요청을 분류하거나 적절한 경로로 보내는 등 자주 발생하는 판단에 쓰일 수 있다. 다만 TypeSafe는 Jev의 구조를 자세히 공개하지 않았고 가중치도 공개하지 않았다. 따라서 성능 우위의 원인을 외부에서 독립적으로 확인하기 어렵고, 주요 비용·성능 비교도 회사가 제시한 수치에 기대고 있다.
3
5
6
7
- OpenAI의 Decisions API: 개발자가 질문과 답의 범위를 미리 정하고, 텍스트나 이미지를 입력해 분류·요청 라우팅·에이전트의 다음 행동을 선택하게 하는 API다. 현재는 제한된 고객을 대상으로 미리보기 형태로 제공된다. 출시 관련 보도에는 판단 한 건에 약 150ms가 걸린다는 수치가 등장했지만, Jev와 직접 비교할 수 있는 벤치마크나 API 가격은 공개되지 않았다.
12
3
4
- AWS의 Strands Decider 2B: 약 20억 개의 파라미터를 가진 오픈소스 모델이다. 정해진 선택지에 답하고 예·아니오 확률이나 점수를 반환하도록 설계됐다. 개발자는 모델을 직접 실행할 수 있고 공개된 학습 자료도 살펴볼 수 있어, 실험·수정이나 호스팅 API에 의존하기 어려운 환경에 적합하다. 약 106~115ms라는 중앙값 응답 시간은 사용 하드웨어와 측정 방식에 따라 달라진다. 모델 가중치는 무료로 공개됐지만 실행에 필요한 컴퓨팅 자원까지 무료인 것은 아니다.
17
18
19
- Cloudflare의 Clef와 Clef-flash: 두 모델 모두 가중치를 공개했으며, 직접 호스팅하거나 Cloudflare의 Workers AI에서 사용할 수 있다. Clef는 판단 품질에, 더 작은 Clef-flash는 낮은 지연 시간에 무게를 둔다. Workers AI에서 공개된 가격은 입력 토큰 100만 개당 각각 0.24달러와 0.09달러다. Cloudflare와 관련된 비교 자료에는 Clef-flash의 중앙값 응답 시간이 약 39ms로 제시돼 있다. 다만 이 수치만으로 Jev와 속도나 비용을 일대일로 비교할 수는 없다.
TypeSafe의 관건은 ‘먼저 출시했는가’보다 실사용 성능
경쟁 제품의 등장은 결정 모델 시장에 수요가 있다는 신호인 동시에 Jev의 독점적 위치를 약하게 만든다. OpenAI는 기존 모델을 활용한 호스팅 경로를 제공하고, AWS와 Cloudflare는 고객이 직접 운영할 수 있는 대안을 내놨다. Cloudflare는 호스팅 서비스도 제공한다.
12
19
TypeSafe가 계속 선택받으려면 ‘먼저 출시했다’거나 특정 지연 시간 수치가 낮다는 주장만으로는 부족하다. 고객의 실제 업무에서 판단 품질과 총비용이 더 나은지 보여줘야 한다. TypeSafe는 4,000만 달러의 초기 투자를 유치한 것으로 보도됐지만, 현재 자료만으로 신뢰할 만한 기업가치를 단정하기는 어렵다. Jev의 성능 우위 역시 조건을 맞춘 독립적인 비교로 확인됐다고 보기 어렵다.
11