AI가 문의를 ‘결제 문제’로 분류하며 0.9를 내놓았다. 열 번 중 아홉 번 맞힌다는 뜻일까? Laya의 응답에는 서로 다른 계산을 담은 confidence와 answer_confidence가 함께 있다.

선택형 응답을 열어 보면

Laya는 텍스트를 읽고 주어진 선택지에서 답을 고르는 등의 판단을 수행한다. 여기서는 공개 Python 코드의 choice, 즉 선택형 응답만 살펴본다.

0.9와 0.531

결제 문제와 기술 문제, 두 선택지에 모델이 각각 0.9와 0.1을 배정했다고 가정하자. 추가 히스토그램 보정이 없는 경우 answer_confidence는 가장 큰 값인 0.9다. 반면 confidence는 약 0.531이다. 실제 모델을 돌린 결과가 아니라 공개 수식에 가상 값을 넣어 계산한 예다.

같은 입력, 서로 다른 두 점수

가상 입력 · 선택지 두 개

  • 결제 문제 0.9
  • 기술 문제 0.1

answer_confidence

0.9

가장 큰 선택지 확률

추가 히스토그램 보정이 없는 경우

confidence

약 0.531

확률이 한쪽에 몰린 정도

1 − 정규화한 엔트로피

두 선택지가 반반이면 0, 한쪽에 전부 몰리면 1

가상 입력 계산 · 추가 히스토그램 보정 없음 · 실측 정확도 아님

공개 수식에 가상 입력을 넣은 계산 예입니다. 실제 모델 실행이나 정답률 측정 결과가 아니며, 두 필드에 같은 기준선을 적용할 수 없습니다.

쏠림을 재는 숫자

confidence는 확률이 얼마나 한쪽으로 몰렸는지를 엔트로피로 계산한다. 두 선택지가 반반이면 0, 한쪽에 전부 몰리면 1이 된다. 같은 응답의 두 숫자는 서로 다른 것을 재고 있으므로 같은 기준선에 대입할 수 없다.

정답과 맞춰 보는 일

그렇다면 answer_confidence의 0.9는 믿어도 될까? 확률 보정은 이런 값을 낸 답들이 실제로 얼마나 맞는지 비교하는 문제다. 가령 0.9 부근의 답들을 모았을 때 정답 비율도 그에 가까운지, 학습·보정에 쓰지 않은 해당 업무의 정답 있는 사례로 확인해야 한다. 한 번의 답이 맞다는 보증은 아니다. Laya 문서도 배포 모델의 과신을 경고한다.

설정도 숫자를 바꾼다

선택형 응답의 기본값은 가장 큰 확률이지만, 별도 히스토그램 보정표를 설치하면 answer_confidence가 다시 조정될 수 있다. 기준보다 낮은 점수에 표시를 붙이는 min_confidence도 기본으로 켜져 있지 않다. 숫자만 복사하기 전에 모델·설정·필드 이름을 함께 남길 이유다.

V의 생각

V의 생각. 자동 분류를 맡긴다면 “0.9 이상만 통과”부터 정하기보다, 통과시킨 문의 중 무엇을 잘못 보냈는지 먼저 보고 싶다. 확신의 숫자를 읽는 일은 그 숫자가 무엇을 세는지 묻는 데서 시작한다.

2026년 10월 5일 확인한 Laya 0.3.27 코드, 커밋 8a6e1328의 설명이다. 설치·성능 시험은 하지 않았다. 예시를 한국어로 썼다는 것이 한국어 모델 품질 검증을 뜻하지는 않는다.