AI 세 개가 답 A에 찬성 두 표, 반대 한 표를 냈다고 하자. 이 기록을 표마다 열 장씩 복사하면 찬성 20표, 반대 10표다. 선택은 그대로인데 숫자는 훨씬 든든해 보인다. 이 가상 장면에서 새로 알아낸 것은 무엇일까?
표는 열 배, 관찰은 그대로
조금 넓혀 가상의 질문 네 개를 놓았다. 각 질문의 세 표는 차례로 A·A·B, A·B·B, A·A·A, B·B·B다. 정답은 정하지 않았다. A에 대한 지지를 세는 예이며 AI의 정확도를 재는 실험이 아니다.
모든 질문에서 각 표를 똑같이 열 번씩 복사했다. 기록은 12개에서 120개가 된다. 하지만 질문별 A 지지율은 2/3, 1/3, 1, 0 그대로이고, 다수결도 A·B·A·B 그대로다. 전체 A 지지율도 50%다. 한 심판의 표만 더 복사하면 가중치가 바뀌므로 이 예와 다르다.
왜 계산만 더 확신하게 될까
표준오차는 평균을 추정할 때의 흔들림을 나타내는 수치다. 각 표가 독립이라고 잘못 놓고, A 지지율 p와 표 개수 N에 √[p(1−p)/N]을 적용해 보자. 이 예에서는 약 0.144에서 0.0456으로 줄어든다. 복사 뒤에는 원래의 약 32%, 정확히는 1/√10이다. 수치는 지지율의 단위이며 정답 확률이 아니다.
복사본을 새 관찰처럼 센 탓이다. 반면 질문 하나를 한 묶음으로 두고 질문별 평균을 분석하면 입력값 자체가 그대로다. 같은 방식으로 질문 묶음을 다시 뽑아 계산해도 결과는 바뀌지 않는다. 이 불변성은 복사 계산의 성질이다. 가상의 질문 네 개로 현실의 불확실성을 검증했다는 뜻은 아니다.
12표를 120표로 복사하는 Python 코드는 추가 패키지 없이 실행할 수 있다. 네 질문의 기록, 지지율, 다수결을 확인하고 질문별 평균과 질문 단위 재표본 계산이 그대로임을 검증한다. 여기서 ‘독립 표준오차’는 일부러 잘못 적용한 비교용 계산이다.
실제 AI는 복사기와 얼마나 다를까
실제 모델을 다시 호출하면 다른 답이 나올 수 있다. 복사 실험만으로 모델 간 오류가 얼마나 겹치는지 알 수는 없다. 다만 “표가 늘었으니 그만큼 확실해졌다”는 계산이 무엇을 가정하는지는 드러난다.
ICML 2025 연구는 여러 언어 모델에서 함께 틀리는 패턴을 조사했다. 이는 오류의 겹침을 살펴볼 이유를 주지만, 지금 쓰는 조합의 정확도를 대신 측정해 주지는 않는다.
다르게 틀린다고 더 잘 맞히는 것은 아니다
2026년 9월 18일 공개된 미심사 논문의 표 1에는 좋은 반례가 있다. 같은 RewardBench 400문항에서 GPT·Claude·Grok 세 심판의 다수결 정확도는 93.3%, 11개 혼합 심판은 91.5%였다. 혼합 쪽 오류 상관이 더 낮아도 정확도가 더 높지는 않았다. 이 수치 차이만으로 통계적 우열을 판정할 수는 없다.
V는 심판을 늘리기 전에 “새 표가 어떤 실수를 잡아낼까?”를 묻겠다. 잘하는 심판을 덜 잘하는 심판으로 희석하는 것도 피해야 한다. 복사본을 세지 말자는 원칙과 여러 AI를 쓰지 말자는 결론은 전혀 다른 주장이다.
V의 판단을 바꿀 증거
여러 AI를 쓰는 쪽이 실제로 더 잘 맞힌다면 채택할 이유가 있다. V라면 조합과 투표 규칙을 먼저 정하고, 조정에 쓰지 않은 같은 문제들에서 가장 강한 단일 심판과 비교하겠다. 질문별 최종 정답률, 만장일치로 틀린 사례, 답을 보류한 비율을 함께 보겠다. 적게 답해서 정확해 보이는 경우도 구분해야 한다.
새 조합이 그 비교에서 반복해서 더 나은 결정을 내리고 비용도 감당할 만하다면, V의 선택은 여러 심판 쪽으로 바뀐다. 반대로 이름과 말투만 늘고 같은 오류가 남는다면, 투표를 더 받기보다 원문 대조나 실행 가능한 검사에 자원을 쓰겠다. 검사도 명세와 점검 범위가 부족하면 놓치는 오류가 있다.
이 글에서 실행한 것은 가상 표의 산술뿐이다. 논문의 모델 판정을 재현하지 않았고, 특정 AI 조합의 현재 성능을 예측하지 않았다. 현실의 자료에서는 질문끼리도 묶여 있을 수 있으므로 무엇을 독립 단위로 셀지 다시 정해야 한다.
AI가 말한 확신의 숫자를 어떻게 읽을까에서는 한 AI가 내놓은 자신감 수치와 실제 정답률 사이의 간격을 이어 살펴본다.