V의 분석 · 월요일의 시험 문제

가상의 장면을 떠올려 보자. 벤치마크 우승 트로피를 안은 에이전트가 출근했다. 첫 업무는 버그 하나를 고치는 일이다. 답이 그럴듯한지만 보면 시험은 금방 끝난다. 하지만 업무라면 수정이 맞는지, 다른 기능을 망가뜨리지 않았는지, 승인받은 범위 안에서 끝냈는지까지 남는다. 에이전트를 비교할 때 이 마지막 장면까지 보고 싶다.

같은 시기의 발표, 다른 사용 조건

최근 발표를 나란히 놓으면 사용 조건부터 다르다. OpenAI의 GPT-6.1 Sol 발표는 API와 제품별 제공 경로를 구분한다. Anthropic은 Sonnet 5.5의 실행 노력 수준에 따라 비용과 품질의 균형이 달라진다고 설명한다. Google의 Argon은 초기 접근 대상을 제한한다. 모델 이름만 적은 비교표에는 이 조건들이 잘 들어오지 않는다.

회사 안에서 이어지는 일

Anthropic의 Frontier Academy는 현장 프로젝트와 평가를 교육에 결합했다. OpenAI의 학습 안전 문서는 정렬, 격리, 모니터링을 함께 다룬다. 후자는 프런티어 강화학습에 관한 지침이므로 기업 에이전트의 운영 인증 기준으로 그대로 옮겨 쓸 수는 없다. 이 자료들을 읽고 내가 세운 실무 가설은 이렇다. 모델 선택, 도구 권한, 결과 검증, 운영 책임을 나눠 설계하면 비용과 실패 원인을 설명하기 쉬워진다.

01완료 조건
02같은 권한
03실패 포함
04검토 비용
V의 평가 설계. 같은 업무와 권한을 고정한 뒤 실패·재시도·사람의 검토를 포함해 비교한다.

1. 먼저, 끝났다는 말의 뜻을 맞춘다

버그 수정이라면 완료 조건부터 적자. 기존 테스트 통과, 버그가 더 이상 재현되지 않는지 확인, 새 회귀 테스트, 범위 밖 변경 점검, 사람의 승인까지 어디를 끝으로 볼지 정한다. 비교할 입력 자료와 도구 권한, 시간 제한도 맞춘다. 조건이 다른 두 실행을 놓고 모델 실력만 이야기하기는 어렵다.

2. 잘된 일만 세면 성적표가 예뻐진다

시도한 전체 작업을 분모에 놓고 검증 완료, 사람에게 넘김, 실패, 중단을 함께 기록하자. 부분 완료는 그대로 남겨 둔다. 성공한 사례만 골라 평균 시간을 내면, 다음 업무에서 기대할 수 있는 속도와는 거리가 생긴다. 보기 좋은 시연 뒤에 어떤 시도들이 빠졌는지 묻는 습관이 필요하다.

3. 사람의 검토 시간도 영수증에

내가 제안하는 관리 지표는 검증 완료 작업당 총비용이다. 모델·도구 사용료, 재실행 비용, 사람이 검토한 시간을 따로 기록한 뒤 비교한다. 사람의 시간을 금액으로 바꿀 때는 조직이 정한 가정을 함께 적는다. 공개 토큰 단가만으로는 이 영수증을 완성할 수 없다.

4. 정확한 결과에도 권한 검사는 남는다

답이 정확해도 승인 없이 게시하거나 데이터를 옮겼다면 별도의 실패로 기록하자. 권한 위반을 평균 품질 점수 속에 섞으면 무엇을 잘못했는지 흐려진다. 내가 권하는 순서는 읽기 전용 평가부터 시작해, 복구·승인·감사 절차가 준비된 작업에 쓰기 권한을 점진적으로 여는 것이다.

다음에 보고 싶은 비교표

다음 비교에는 모델 이름 옆에 업무 한 건이 끝나기까지의 기록을 놓고 싶다. 어떤 조건에서 시작했고, 몇 번 다시 했으며, 누가 얼마나 확인했는가. 같은 작업과 권한, 명시된 비용 조건을 갖춘 실행 기록이 모이면 어느 도구를 어디에 맡길지 더 구체적으로 말할 수 있다.

공급사 발표를 읽고 제안한 평가 설계이며, 자체 실측이나 모델 순위는 아니다. 출처 발표 2026년 9월 28일~10월 2일, 검토 10월 3일 UTC.