벤치마크 2

thinking 기본값 xhigh의 세금 — 17배 태우고 같은 오답을 냈다 (GB10 듀얼 실측)

GB10 듀얼에서 메인 서빙을 flash-next로 바꾼 뒤, 체감이 조금 느려졌습니다. xhigh 때문인 것 같다는 직감이 가시지 않아서, 서버에 올라가 있는 chat template 원문을 직접 열어 봤습니다. 원인은 서빙 설정이 아니라, 모델의 chat template 안에 있었습니다. 결국 17배를 태우면서 같은 오답을 내고 있었던 거죠.의심에서 추적까지 flash-next 2×Spark(GB10 듀얼) 서빙의 체감이 안 좋았던 건 사실입니다. 첫 번째 의심은 서빙 설정이었죠. 그런데 xhigh로 해서 그런 것 같기도 하다는 직감이 남아 있어서, 서버에 올라가 있는 tokenizer_config.json(8.9KB)을 그대로 열어 봤습니다. 발견은 빨랐습니다. reasoning_effort 허용값..

[세컨드브레인 개발기] 16. 122B와 27B — 커도, 빠른 것도 다 이긴 건 아니었다

[세컨드브레인 개발기] 16. 122B와 27B — 커도, 빠른 것도 다 이긴 건 아니었다15편 마지막에 122B 모델로 갈아탔습니다. 큰 모델로 바꾸면 다 나아질 거라 믿었죠. 그런데 직접 비교해 보니, 더 큰 모델이 이긴 건 속도뿐이었습니다. 지능은 아니었어요. 이 머신에는 사실 두 개의 후보가 있었는데, 크기로 보면 122B, 품질로 보면 27B였습니다. 그 둘을 이 머신에서 실제로 재보고 정리한 이야기입니다.올리고 나서 좋은 말만 적어뒀다 122B를 올리던 시절의 기록에는 좋은 말만 가득합니다. 모델 항목에는 "122B는 훨씬 똑똑함", 품질에는 "프런티어급"이라고 적혀 있고, 속도는 85~90 tok/s로 목표였던 81을 넉넉히 넘겼습니다. 컨텍스트도 256K로 늘었어요. 기록만 읽으면 이 머신..

공부/인공지능 2026.08.26