트러블슈팅 3

모델은 256K인데 자꾸 128K로 나온다 — 로컬 LLM 컨텍스트 길이 함정

모델은 256K인데 자꾸 128K로 나온다 — 로컬 LLM 컨텍스트 길이 함정같은 모델을 쓰는데 어떤 세션에선 128K로, 또 어떤 세션에선 256K로 인식되는 일이 있었습니다. 모델이 바뀐 것도 아니고, 설정이 꼬인 것도 아닙니다. 클라이언트가 최대 컨텍스트 길이를 알아내는 방식에 구멍이 있었습니다. 원인과 해결 방법을 정리해 봅니다. 같은 모델인데 세션마다 다르게 보인다모델을 직접 붙이는 대신 프록시를 거쳐 여러 모델을 붙여 쓰는 구성입니다. 그래서 실제 최대 컨텍스트 길이가 262,144(256K)인 모델을 두고도, 세션에 따라 128K로 잡히는 일이 생겼습니다. 모델 스펙은 그대로인데 클라이언트가 "이 모델은 131,072까지"라고 알고 있는 셈이죠. 그 모델을 처음 붙였을 때부터 256K로 잘 ..

모델은 256K인데 자꾸 128K로 나온다 — 로컬 LLM 컨텍스트 길이 함정

모델은 256K인데 자꾸 128K로 나온다 — 로컬 LLM 컨텍스트 길이 함정같은 모델을 쓰는데 어떤 세션에선 128K로, 또 어떤 세션에선 256K로 인식되는 일이 있었습니다. 모델이 바뀐 것도 아니고, 설정이 꼬인 것도 아닙니다. 클라이언트가 최대 컨텍스트 길이를 알아내는 방식에 구멍이 있었습니다. 원인과 해결 방법을 정리해 봅니다. 같은 모델인데 세션마다 다르게 보인다모델을 직접 붙이는 대신 프록시를 거쳐 여러 모델을 붙여 쓰는 구성입니다. 그래서 실제 최대 컨텍스트 길이가 262,144(256K)인 모델을 두고도, 세션에 따라 128K로 잡히는 일이 생겼습니다. 모델 스펙은 그대로인데 클라이언트가 "이 모델은 131,072까지"라고 알고 있는 셈이죠. 그 모델을 처음 붙였을 때부터 256K로 잘 ..

게이트를 만들었다가 걷어냈다 — 로컬 LLM 멈춤의 진짜 원인 찾기

게이트를 만들었다가 걷어냈다 — 로컬 LLM 멈춤의 진짜 원인 찾기 컨텍스트가 큰 로컬 LLM을 여러 세션으로 나눠 쓰다 보면, 세션을 셋째 개 열 때쯤 전체 요청이 뻗어버리는 일이 반복됐습니다. 대부분의 운영 이야기에서 이 시점의 결론은 하나로 정해져 있습니다. 「KV 캐시가 부족해서 그렇다」는 것. 저도 그랬습니다. 하지만 이번에는 그 결론이 틀렸습니다. 그래서 원인을 고치겠다고 게이트웨이를 먼저 만들었고, 한참을 돌고 나서 그 게이트를 통째로 걷어냈습니다. 만들었다가 지운, 그 과정과 이유를 적어봅니다.증상과 오진: 「컨텍스트를 줄이자」가 아니라 「접수 창구를 만들자」멈춤 현상은 이렇게 옵니다. 한두 개 세션은 거뜬히 돌아가는데, 세 번째 세션에 요청이 들어오면 전체가 미적대다가 폴백 모델로 떨어집..

공부/인공지능 2026.10.05