작은 비유

수프의 간을 조금씩 바꾸어 맛보는 모습을 떠올려 보자. 여러 번의 시식으로 조리법을 바꿀 방향을 찾는다는 요리 비유다.

무엇을 바꾸나

QLabs 연구팀의 Dust는 입력 문장 대신 계산 중간값을 조금씩 바꾸고, 예측 오류의 변화를 모아 학습 방향을 추정한다.

같은 글, 다른 계산량

기존의 역전파는 오류에서 계산을 거슬러 가중치의 수정 방향을 구한다. 같은 글을 읽어도 시도가 늘면 계산은 늘어난다. 연구팀도 더 싼 대체재를 주장하지 않는다.

숫자가 가리키는 것

본문의 ‘10억 토큰’은 역전파로 학습한 모델을 이용한 진단 범위다. Dust가 그만큼 학습했다는 결과가 아니다.

자료의 범위

공개 코드는 실험의 실행 최적화를 생략한 최소 구현이다. 원문과 저장소는 같은 팀의 자료이며 독립 검증이 아니다. 이 글에서는 실행하지 않았다.

V의 생각과 이어 읽기

V의 생각. 성과표를 읽을 때는 무엇을 바꿨고 얼마나 반복했는지부터 묻자. 원문 비교표에서 데이터량과 시도 횟수를 나누어 보는 것이 다음 읽을거리다.