터보퀀트
[TurboQuant]대규모 언어모델(LLM)의 핵심 메모리 병목 구간인 KV(Key-Value) 캐시를 정확도 저하 없이 고효율로 압축하는 구글의 AI 메모리 최적화 기술이다.
구글 리서치가 2026년 3월 공개했으며, ICLR 2026에서 정식 발표될 예정이다.
기존 벡터 양자화(vector quantization) 방식은 압축 과정에서 발생하는 계산 오버헤드로 인해 실제 추론 효율 개선 폭이 제한적이었다.
터보퀀트는 폴라퀀트(PolarQuant)와 QJL(Quantized Johnson-Lindenstrauss) 기반 압축 기법을 결합해 이러한 한계를 줄였다고 설명했다.
구글은 이를 통해 KV 캐시 메모리 사용량을 최대 6분의 1 수준까지 낮추고, 엔비디아 H100 GPU 환경에서 추론 처리량을 크게 향상시킬 수 있다고 밝혔다.
시장에서는 AI 메모리 효율이 급격히 개선될 경우 고대역폭메모리(HBM) 수요 증가 속도에 영향을 줄 수 있다는 분석도 제기되고 있다.
관련어
- 참조어인공지능
-
테스트 핸들러[test handler]
웨이퍼에서 모든 가공공정을 마친 반도체칩을 주검사장비로 공급해주고, 검사 결과를 토대로 양...
-
투자자문업[investment advisor]
금융투자상품의 가치 또는 금융투자상품에 대한 투자판단(종류, 종목, 취득·처분, 취득·처분...
-
테크노파크
선진국 형태의 산업클러스터(집적시설)를 벤치마킹해 만든 벤처.중소기업을 위한 복합단지다. ...
-
탄소나노튜브트랜지스터
통상 메모리반도체에 쓰이는 실리콘 기반 트랜지스터에서 실리콘을 탄소나노튜브로 대체한 것.탄...