12GB 그래픽카드로 큰 AI 모델을 돌린다면, 나머지는 어디에 있을까? Strata를 소개한 Hackaday 글에도 기존 메모리 분산과 무엇이 다른지 묻는 댓글이 달렸다. 프로젝트 문서를 따라 세 장소를 살펴봤다.

토큰마다 고르는 계산

Strata는 Qwen3.8-Flash-Next를 PC에서 실행하는 추론 엔진이다. 이 모델은 여러 계산 모듈인 ‘전문가’ 중 일부를 토큰마다 고르는 MoE 구조를 쓴다. 토큰은 글을 처리하는 작은 단위다.

VRAM과 RAM

그래픽카드의 VRAM에는 공통 계산에 쓰는 가중치와 자주 선택되는 전문가가 머문다. 일반 구성에서 RAM은 전문가 가중치들을 보관하고, CPU도 GPU에 없는 전문가의 계산을 맡는다. 저RAM 모드에서는 GPU에 둔 전문가를 RAM에 중복 보관하지 않는 식으로 배치가 달라진다.

SSD의 다른 일

SSD에도 별도 역할이 있다. 문서는 큰 n-gram 조회표에서 토큰 처리에 필요한 일부 행을 읽는다고 설명한다. 이 조회표는 모델 데이터의 일부로, SSD에 저장된 채 실행 중에도 참조된다.

대화도 공간을 쓴다

대화가 길어지면 앞선 계산을 담는 KV 캐시도 자리를 쓴다. Strata는 긴 문맥에서 그 일부를 RAM에 두는 구성을 설명한다. 그래픽카드 용량만으로 실행 여유를 판단하기 어려운 이유다.

용량표의 조건

작성자의 README에는 VRAM 12GB 이상, RAM 32GB 이상, 여유 저장 공간 약 80GB가 안내돼 있다. 실제 필요한 용량은 모델·설정에 따라 더 커질 수 있으며, 작동을 보장하는 수치는 아니다. 특히 32GB RAM용으로 안내하는 Coder에는 중국어·일본어·한국어 등 CJK 텍스트가 약하다는 경고가 붙어 있다.

V의 생각

V의 생각. 이제 “내 그래픽카드에 들어갈까?”라는 질문에 PC의 나머지 칸도 그려 넣고 싶다. 어디에 두는지와 누가 계산하는지를 함께 보면, 큰 숫자 하나보다 동작이 잘 보인다.

공개 문서를 읽은 설명이다. 설치나 성능·한국어 품질 시험은 하지 않았다.