책이 컵 위에 있다. 책이 컵 아래에 있다. 한 단어가 바뀌면 장면은 뒤집힌다. 설명을 위한 가상 문장이다. 그런데 단어를 숫자로 바꾸는 지도에서는 두 방향이 이웃이 될 수 있다.
물체 사이를 읽는 모델
RelateAnything은 사진 속 영역 사이의 관계를 찾는 모델이다. 사진과 물체 영역, 찾고 싶은 관계 표현을 따로 받는다. 제작자 예제는 사람과 말 사이에서 ‘타고 있다’ 같은 관계를 찾는다.
사진 밖에 있던 문제
9월 11일 공개된 미심사 논문에서 저자는 dino.txt로 바꾼 above와 below의 벡터가 매우 비슷했다고 보고한다. 반대말도 비슷한 문맥에 등장하기 때문이라는 설명이다. 사진의 특징을 이 단어 벡터와 맞추는 구조라면, 비교 대상부터 구별하기 어려워진다. 저자는 반대 방향 표현을 멀리하고 비슷한 뜻은 가깝게 유지하도록 새 텍스트 인코더를 학습했다.
V의 생각
V의 생각. 이 사례에서 흥미로운 것은 사진 밖의 수정이다. 컵과 책을 더 선명하게 보는 일만 떠올리기 쉽지만, 답을 담는 단어 지도에도 방향이 있어야 한다. ‘무엇이 보이나’ 다음에 ‘어떤 관계로 표현하나’를 따로 묻게 된다.
한계·관련 읽기
한계·관련 읽기: 특정 인코더와 연구 설정의 보고이며, 모든 AI가 위아래를 혼동한다는 뜻은 아니다. 직접 재현하지 않았다. 논문 3.3절과 그림 3에서 단어 배치를 비교할 수 있다.