AI 서버를 고를 때 HBM 용량만 적어 두면 견적서의 중요한 줄이 빠진다. 오래 이어지는 대화의 정보를 어디에 보관하고, 필요할 때 얼마만큼 빨리 가져올지도 시스템 설계의 일부다. SK하이닉스의 최근 공개 자료를 함께 읽으면 이 질문이 선명해진다.
먼저, 캐시가 하는 일
가령 긴 설명서를 읽힌 뒤 후속 질문을 하는 상황을 떠올려 보자. KV 캐시는 앞선 토큰에서 계산한 수치 데이터를 남겨 같은 계산을 줄이는 장치다. 대화에 필요한 내용을 다시 제공하고 재사용 조건도 맞아야 그 이점을 얻는다. 사용자의 취향을 다음 대화로 가져오는 제품 메모리와는 역할이 다르다. 이 차이를 먼저 잡으면, 이 기사에서 말하는 “어디에 둘까”의 대상이 더 분명해진다. 다시 쓸 계산 데이터를 어느 메모리 계층에 보관할 것인가의 문제다.
부품 목록에서 계층 설계로
9월 28일 회사가 전한 TSMC OIP 행사에서는 HBM, 서버 DRAM, 기업용 SSD를 함께 전시했다. 행사 자체는 9월 23일 열렸다. 가속기 가까이 붙는 메모리에서 저장장치까지 여러 계층을 한 묶음으로 제시한 것이다. 발표일과 행사일은 구분해 읽어야 한다.
문맥을 어디에 둘 것인가
이 흐름은 9월 17일 공개한 AI Infra Summit 자료에서 더 구체적이다. 회사는 HBF를 HBM과 SSD 사이의 새 메모리 계층으로 설명하고 구조 모형을 전시했다. SALT-KV는 이전 계산 결과를 담는 KV 캐시를 문맥에 따라 나누고, 재사용 가치와 저장 비용을 고려해 HBM·DRAM·SSD에 배치하는 방식이라고 소개했다. 모형 전시와 상용 공급은 서로 다른 단계다.
연결에도 비용이 든다
10월 2일 SK하이닉스 뉴스룸에 실린 ETH 취리히 Onur Mutlu 교수의 기고도 데이터 이동을 줄이는 설계를 강조한다. 다만 자원을 나누어 연결할 때 통신이 지나치면 지연과 에너지 비용이 오를 수 있다고 짚는다. 이 글은 저자의 견해이며 회사의 공식 입장을 반드시 대변하지 않는다는 고지가 붙어 있다.
V의 분석 · 구매 질문이 넓어진다
V의 분석: 한국 메모리 업체가 제안하는 구매 단위가 칩의 용량에서 시스템의 데이터 배치로 넓어지고 있다. 이 변화가 흥미로운 이유는 소프트웨어 선택도 부품 선택과 함께 시험해야 하기 때문이다. 저장 공간을 늘린 뒤 응답이 느려지면, 확보한 용량만으로 성공을 말하기 어렵다.
짧은 요청과 긴 대화를 따로 시험하기
평가는 두 종류의 질문으로 나눌 만하다. 짧은 질문을 여러 명이 동시에 보내는 상황과, 긴 대화를 이어 가다 과거 내용을 다시 묻는 상황이다. 같은 모델과 답변 품질 조건에서 첫 응답까지의 시간, 이후 출력 속도, 전체 소비전력, 필요한 장비 구성을 기록한다. 이는 V가 제안하는 시험 설계다.
특히 캐시를 비운 첫 요청과 이미 문맥이 남은 재요청을 구별하자. 평균 한 줄에는 두 상황의 차이가 숨는다. 캐시를 계층 사이로 옮길 때 생기는 대기와, 더 많은 요청을 받아 얻는 이익을 함께 보면 선택지가 구체적이 된다. HBM 구매량을 먼저 정하기보다 실제 대화의 길이와 동시 사용량을 먼저 고정해 보자는 제안이다.
공식 전시 자료와 전문가 기고를 검토한 분석이다. 상용 제공 시점·가격·실제 환경의 성능을 독립 검증한 기사는 아니다.