GB10 듀얼에서 메인 서빙을 flash-next로 바꾼 뒤, 체감이 조금 느려졌습니다. xhigh 때문인 것 같다는 직감이 가시지 않아서, 서버에 올라가 있는 chat template 원문을 직접 열어 봤습니다. 원인은 서빙 설정이 아니라, 모델의 chat template 안에 있었습니다. 결국 17배를 태우면서 같은 오답을 내고 있었던 거죠.의심에서 추적까지 flash-next 2×Spark(GB10 듀얼) 서빙의 체감이 안 좋았던 건 사실입니다. 첫 번째 의심은 서빙 설정이었죠. 그런데 xhigh로 해서 그런 것 같기도 하다는 직감이 남아 있어서, 서버에 올라가 있는 tokenizer_config.json(8.9KB)을 그대로 열어 봤습니다. 발견은 빨랐습니다. reasoning_effort 허용값..