TypeSafe Jev · System One 체험

텍스트를 생성하지 않는 판정 모델, LLM 과 나란히 재 봤습니다

Jev 는 입력(state) 하나에 대한 여러 타입 질문(Choice · Score · Noul)을 한 번의 호출로 병렬 평가해 확률이 붙은 값을 돌려줍니다. 같은 질문·선택지를 Grok 과 Claude 에 JSON 으로 답하게 해서 답, 지연, 비용을 비교했습니다.

속도와 비용

지연 중앙값 (낮을수록 좋음)

호출당 비용 (낮을수록 좋음)

무엇이 달랐나

세 예제 모두 네 모델이 같은 결론을 냈습니다. 차이는 답의 형태에서 나옵니다.

예제별 결과

Jev 칸의 막대는 모델이 돌려준 확률 분포입니다. LLM 의 괄호 값은 모델이 생성한 confidence 숫자입니다.

코딩 에이전트 명령 게이트

사용자 요청에이전트가 실행하려는 명령판정P(파괴적)action 확률지연

측정 방법