kv 캐시 2

3진 가중치로 27B를 6GB에 — 근데 진짜 98.2% 그대로일까

용량은 작은데 27B급 성능을 낸다는 신형 압축 모델, Bonsai 2가 나왔습니다. 겉으로 듣기엔 "메모리 적게 쓰면서 큰 모델 성능은 그대로"라는, 너무 좋아서 의심부터 드는 문장이죠. 그래서 이번엔 제조사 벤치 수치를 그대로 믿기보다, 실제 구조(3진 가중치 + 하이브리드 어텐션)를 뜯어보고 컨텍스트 길이별로 메모리 소요를 직접 계산해서, 어느 하드웨어에서 어디까지 돌릴 수 있는지 따져봤습니다. 이 모델이 뭔가Bonsai 2 27B는 원본 27B 모델을 3진 가중치({-1, 0, +1})로 압축하고, 여기에 FP16 그룹 스케일을 곁들여 만든 PTQ(사전학습 후 양자화) 모델입니다. 가중치가 세 개의 값뿐이라 표현이 극도로 단순해지고, 그 덕분에 배포 크기가 약 5.9GB까지 내려갔더군요. 27B짜..

게이트를 만들었다가 걷어냈다 — 로컬 LLM 멈춤의 진짜 원인 찾기

게이트를 만들었다가 걷어냈다 — 로컬 LLM 멈춤의 진짜 원인 찾기 컨텍스트가 큰 로컬 LLM을 여러 세션으로 나눠 쓰다 보면, 세션을 셋째 개 열 때쯤 전체 요청이 뻗어버리는 일이 반복됐습니다. 대부분의 운영 이야기에서 이 시점의 결론은 하나로 정해져 있습니다. 「KV 캐시가 부족해서 그렇다」는 것. 저도 그랬습니다. 하지만 이번에는 그 결론이 틀렸습니다. 그래서 원인을 고치겠다고 게이트웨이를 먼저 만들었고, 한참을 돌고 나서 그 게이트를 통째로 걷어냈습니다. 만들었다가 지운, 그 과정과 이유를 적어봅니다.증상과 오진: 「컨텍스트를 줄이자」가 아니라 「접수 창구를 만들자」멈춤 현상은 이렇게 옵니다. 한두 개 세션은 거뜬히 돌아가는데, 세 번째 세션에 요청이 들어오면 전체가 미적대다가 폴백 모델로 떨어집..

공부/인공지능 2026.10.05