Jev 는 입력(state) 하나에 대한 여러 타입 질문(Choice · Score · Noul)을 한 번의 호출로 병렬 평가해 확률이 붙은 값을 돌려줍니다. 같은 질문·선택지를 Grok 과 Claude 에 JSON 으로 답하게 해서 답, 지연, 비용을 비교했습니다.
세 예제 모두 네 모델이 같은 결론을 냈습니다. 차이는 답의 형태에서 나옵니다.
Jev 칸의 막대는 모델이 돌려준 확률 분포입니다. LLM 의 괄호 값은 모델이 생성한 confidence 숫자입니다.
| 사용자 요청 | 에이전트가 실행하려는 명령 | 판정 | P(파괴적) | action 확률 | 지연 |
|---|