TechToast

  • 홈
  • 태그
  • 미디어로그
  • 위치로그
  • 방명록

LLM서빙 1

thinking 기본값 xhigh의 세금 — 17배 태우고 같은 오답을 냈다 (GB10 듀얼 실측)

GB10 듀얼에서 메인 서빙을 flash-next로 바꾼 뒤, 체감이 조금 느려졌습니다. xhigh 때문인 것 같다는 직감이 가시지 않아서, 서버에 올라가 있는 chat template 원문을 직접 열어 봤습니다. 원인은 서빙 설정이 아니라, 모델의 chat template 안에 있었습니다. 결국 17배를 태우면서 같은 오답을 내고 있었던 거죠.의심에서 추적까지 flash-next 2×Spark(GB10 듀얼) 서빙의 체감이 안 좋았던 건 사실입니다. 첫 번째 의심은 서빙 설정이었죠. 그런데 xhigh로 해서 그런 것 같기도 하다는 직감이 남아 있어서, 서버에 올라가 있는 tokenizer_config.json(8.9KB)을 그대로 열어 봤습니다. 발견은 빨랐습니다. reasoning_effort 허용값..

공부/인공지능 10:21:59
이전
1
다음
더보기
프로필사진

TechToast

가랑비에 옷 젖듯 글쓰기.

  • 분류 전체보기 (62) N
    • 공부 (28) N
      • 의료영상처리 (0)
      • 인공지능 (23) N
      • 텍스트 (1)
      • 잡소리 (4)
    • 리뷰 (25)
      • 제품 (11)
      • 여행 (0)
      • 기타 (14)
    • 모디아 프로젝트 (6)

Tag

Qwen3.8, 게임 스프라이트, 벤치마크, MiniMax H3, LLM서빙, 예비부부교실, Wan 2.2, 세컨드브레인, 122B, 1M 컨텍스트, DGXSpark, ComfyUI, ai 에이전트, ChatDev, dgx spark, Rag, AI 영상, 세컨드브레인 개발기, vllm, 건강가정지원센터,

최근글과 인기글

  • 최근글
  • 인기글

최근댓글

공지사항

페이스북 트위터 플러그인

  • Facebook
  • Twitter

Archives

Calendar

«   2026/09   »
일 월 화 수 목 금 토
1 2 3 4 5
6 7 8 9 10 11 12
13 14 15 16 17 18 19
20 21 22 23 24 25 26
27 28 29 30

방문자수Total

  • Today :
  • Yesterday :

Copyright © Daum Corp. All rights reserved.

티스토리툴바