0:00Your browser does not support theaudio element.구글 선호 매체 등록서강대학교(총장 심종혁) 컴퓨터공학과 DISCOS 연구실의 김준원(컴공 21), 유정현 박사과정, 김영재 교수 등이 저술한 「SurrogateKV: 어텐션 안정화 기반 의미보존 KV 캐시 압축」 논문이 지난 6월 24일부터 26일까지 제주국제컨벤션센터에서 열린 2026 한국컴퓨터종합학술대회(KCC2026)에서 컴퓨터시스템 부문 최우수논문상을 수상했다.▲ (좌측부터) 서강대학교 컴퓨터공학과 김영재 교수, 김준원(컴공 21), 유정현 박사과정광고대규모 언어 모델(LLM)은 이전 토큰에서 계산한 Key와 Value 텐서를 KV 캐시에 저장해 반복 계산을 줄인다. 그러나 장문 입력에서는 KV 캐시가 문맥 길이에 따라 커지면서 GPU 메모리 사용량과 데이터 전송량이 증가하고, 답변 시간에도 영향을 준다. 기존 압축 방식은 중요도가 낮은 구간을 제거하지만, 삭제된 구간이 decode 과정에서 어텐션 대상에서 완전히 제외되면서 어텐션 가중치가 남아있는 구간에 과도하게 재분배되고 문맥 정보가 손실될 수 있다.광고연구팀이 제안한 SurrogateKV는 중요도가 낮은 구간을 완전히 삭제하지 않고, 해당 구간을 대표하는 하나의 대체 KV 토큰으로 치환한다. 중요한 구간은 원본으로 유지하고, 제거 대상이 되는 구간은 어텐션이 계속 참조할 수 있는 압축된 Key·Value 표현으로 남긴다. 이를 통해 KV 캐시의 길이와 전송 비용을 줄이면서 기존 제거 방식에서 발생하는 문맥 정보 손실을 완화할 수 있다. 실험에서는 KV 캐시를 25%만 남긴 조건에서 PyramidKV보다 9.73점 높은 성능을 기록했으며, FullKV 대비 TTFT 증가폭은 최대 22.9ms로 제한됐다.광고광고SurrogateKV는 KV 캐시 압축을 단순한 ‘보존 또는 삭제’의 문제에서 벗어나, 삭제 대상 문맥도 모델이 참조할 수 있는 압축된 표현으로 남기는 방식으로 확장했다. 이를 통해 압축 과정에서 발생하는 문맥 손실을 완화하면서 메모리 사용량과 GPU 간 전송 비용을 줄일 수 있다. 장문 질의응답과 요약, 검색 기반 생성 등 긴 문맥을 처리하는 LLM 서비스의 효율성과 안정성을 높이는 데 활용될 수 있다.광고제1저자인 김준원(컴공 21) 학생은 "학부생으로서 직접 연구를 설계하고 구현, 실험한 결과가 좋은 성과로 이어졌으며, 이번 경험을 계기로 다양한 연구 기회에 적극적으로 도전하며 역량을 넓혀가고 싶다“라며 ”지도해 주신 김영재 교수님, 함께 연구해 주신 유정현 박사과정께 감사드린다"라고 소감을 전했다.<이 기사는 서강대학교에서 제공한 정보기사로 한겨레의 의견과 다를 수 있습니다.>