내 답은 “지금 필요한 일을 다시 적되, 그 요약부터 검토하자”다. 대화가 꼬였을 때 새 창을 여는 행동은 쉽다. 어려운 일은 그 창에 무엇을 가져갈지 결정하는 것이다. V는 현재 목표와 조건을 원자료에 대조해 확인한 작업 지시서를 먼저 만들 것을 권한다. 이는 실용적인 편집 제안이며, 오늘 쓰는 앱에서 효과를 측정한 처방은 아니다.

요약이 놓칠 수 있는 한 줄

가상의 예를 들어 보자. 처음에는 “부산 이틀 여행을 짜 줘”라고 하고, 나중에 “운전은 하지 않아”, 이어 “토요일 오후에는 해운대에 있어야 해”라고 덧붙였다. 앞선 조건을 바꾸지 않고 정보를 추가하는 상황이다. 독립된 지시서에는 이 셋이 함께 있어야 한다. “부산 여행을 추천해 줘”로 줄이면 짧아졌지만 충실해지지는 않았다.

여기서 검토할 대상은 문장의 유창함이 아니다. 날짜, 이동 조건, 반드시 있어야 할 장소가 빠지지 않았는지를 본다. “여유로운 일정” 같은 그럴듯한 표현이 필수 조건을 대신해서는 안 된다. 이 예는 실제 모델 응답이나 실험 사례가 아니라, 지시서를 검사하는 방법을 보여 주기 위해 만든 것이다.

숫자를 읽는 방법

2025년 5월 9일 논문의 표 2는 코드·데이터베이스·수학·행동 과제별 정확도의 평균(0~100)을 비교한다. 지시마다 10회씩 실행했다. 대상은 GPT-4o-mini와 GPT-4o다.

Concat은 조건을 처음부터 모두 주고, Sharded는 나눠 준다. Recap은 마지막에 다시 정리한다. Concat은 실패한 대화의 재시작이 아니다.

조건4o-mini4o
Concat84.490.9
Sharded50.459.1
Recap66.576.6

재진술로 평균 점수가 올랐지만 처음 격차의 절반가량이 남았다. 아래는 반올림된 평균값으로 계산했다.

4o-mini: 회복 47.4%(16.1점), 잔여 17.9점. 4o: 회복 55.0%(17.5점), 잔여 14.3점.
막대 안 숫자는 점수 차이다.

전체 격차는 Concat−Sharded다. 회복분은 Recap−Sharded, 잔여분은 Concat−Recap이다.

이런 비율의 분모는 원래 벌어진 점수 차이다. 개별 실패의 구제확률과 혼동하면 안 된다. 그림을 읽을 때는 회복한 몫과 남은 거리를 함께 보자.

설명과 구현 사이의 작은 틈

부록 M은 사용자의 발화를 모은다고 설명한다.

고정 커밋 c865793fe34a929d316119b0451d01bd9183bcfd의 recap 코드는 이전 기록을 복사한 뒤 과제의 통합 프롬프트로 새 메시지를 만든다. 확인한 코드는 발화 문자열을 직접 모으지 않는다. 별도 단일턴 코드는 시스템·사용자 메시지만 보낸다. 표를 만든 버전·실행 경로와 수치 영향은 확인되지 않았다. 따라서 코드만 보고 표의 수치를 수정할 수는 없다.

고정 코드

계속 대화해야 할 가장 강한 이유

새 대화로 옮기면서 이미 승인한 예시, 용어의 뜻, 예외를 둔 이유를 버릴 수 있다. 아직 문제를 탐색 중이라면 왕복 대화 자체가 중요한 작업물이다. 사용자가 생각을 바꾼 이유까지 한 줄로 압축하면, 잘못 이해한 목표를 오히려 단단히 굳힐 위험도 있다. 지시서를 확정하기 어려운 단계에서는 탐색 기록을 보존하는 편이 낫다는 것이 V의 판단이다.

2026-06-11 미심사 연구는 Qwen2.5-Math-1.5B-Instruct·Qwen3-4B-Thinking에 256토큰 순환 메모리를 쓰도록 학습했고, 전체 기록 추론에서도 개선을 보고했다. 수동 재시작 시험이 아니며 모델 계열 간 검증은 남았다.

이 반례는 대화가 길어지면 반드시 망가진다는 식의 결론을 경계하게 한다. 입력을 정리하는 사용자 습관과 대화를 다루도록 모델을 학습하는 연구는 각각 시험해야 할 선택지다. 한쪽의 결과로 다른 쪽의 효과를 보증할 수 없다.

V의 제안: 새 창보다 먼저 확인할 지시서

새 창을 무조건 열라는 규칙 대신, 옮길 수 있는 지시서를 만들어 보자. 목표 한 문장, 반드시 지켜야 할 조건, 근거 자료의 위치, 아직 결정하지 않은 질문을 적는다. 예외를 이해하는 데 필요한 승인된 예시도 남긴다. 바뀐 조건이 있다면 현재 조건과 대체된 조건을 분명히 구별한다.

그 다음 원문과 한 항목씩 대조한다. AI에게 초안을 맡겨도 확인 책임까지 넘기지는 않는다. 원문에서 반드시 남겨야 할 조건 하나를 골라 지시서에서 찾아보는 것도 시작점이다. 빠졌다면 더 줄이지 말고 복원한다. 지시서가 검토를 통과하면 기존 대화에 붙일 수도 있고 새 대화에 사용할 수도 있다. 어느 쪽이 더 나은지는 여기서 검증하지 않았다.

내 판단을 바꿀 시험

같은 모델·설정·과제에서 검증한 지시서를 똑같이 두고, 기존 기록에 추가하기와 빈 대화에 넣기를 비교하면 된다. 지시서를 추가하지 않고 이어 가는 조건도 둔다. 순서를 무작위로 바꾸고 반복하며, 평가자는 어느 조건인지 모른 채 각 요구의 충족 여부를 채점한다. 사용자가 들인 시간과 사라진 맥락 때문에 생긴 오류도 센다. 이는 제안한 시험 설계이며 실행한 실험은 아니다.

두 조건이 비슷하다면 새 창을 여는 수고를 권할 이유가 줄어든다. 새 대화에서 중요한 맥락이 더 자주 빠진다면 기존 기록을 유지하는 쪽으로 권고를 바꿔야 한다. 지금 당장 할 수 있는 일은 효과를 약속하는 재시작 요령을 외우는 것보다, 내가 원하는 작업을 다른 사람이 읽어도 확인할 수 있게 만드는 것이다.

이어 읽기

대화 맥락과 메모리의 차이

정보를 저장하는 방식과 꼬인 작업을 다시 정리하는 문제는 다르다. 저장 개념이 궁금하다면 이 배경 글로 이어 가자.

자료

2025 논문

단일턴 코드

2026 논문