TechToast

  • 홈
  • 태그
  • 미디어로그
  • 위치로그
  • 방명록

로컬llm 1

27B 로컬 LLM을 vLLM → llama.cpp로 갈아끼우며 동시성·속도 끌어올리기

연구실에 공용 LLM 서버를 돌리면서 생긴 일입니다. 27B짜리 dense(hybrid linear-attn) 모델을 워크스테이션과 리모트 서버에 올려서, 교수와 학생 7명이 매일같이 붙들고 썼는데, 문제가 하나 있었습니다. vLLM으로 FP8 양자화를 걸면 안정적이긴 한데 응답 속도가 아쉽고, 요청이 몰리면 속도가 급격히 떨어졌습니다. 그래서 저는 하드웨어를 더 사는 대신, 서빙 레이어만 통째로 바꾸는 쪽을 택했습니다. 왜 갈아탔나 — vLLM의 벽vLLM은 정말 잘 만들었습니다. 다만 이 모델이 hybrid linear-attention 구조라서, 카드 세 장을 TP=3으로 한 덩어리로 묶는 게 애초에 안 됩니다. "16 not divisible by 3"이라는 에러가 뜨면서 죽네요. 그래서 TP=2..

공부/인공지능 00:51:21
이전
1
다음
더보기
프로필사진

TechToast

가랑비에 옷 젖듯 글쓰기.

  • 분류 전체보기 (64) N
    • 공부 (30) N
      • 의료영상처리 (0)
      • 인공지능 (25) N
      • 텍스트 (1)
      • 잡소리 (4)
    • 리뷰 (25)
      • 제품 (11)
      • 여행 (0)
      • 기타 (14)
    • 모디아 프로젝트 (6)

Tag

1M 컨텍스트, AI 영상, DGXSpark, Qwen3.8, 건강가정지원센터, LLM서빙, 세컨드브레인 개발기, Rag, dgx spark, Wan 2.2, 로컬llm, LiteLLM, 게임 스프라이트, 예비부부교실, MiniMax H3, 벤치마크, 122B, vllm, ChatDev, 세컨드브레인,

최근글과 인기글

  • 최근글
  • 인기글

최근댓글

공지사항

페이스북 트위터 플러그인

  • Facebook
  • Twitter

Archives

Calendar

«   2026/09   »
일 월 화 수 목 금 토
1 2 3 4 5
6 7 8 9 10 11 12
13 14 15 16 17 18 19
20 21 22 23 24 25 26
27 28 29 30

방문자수Total

  • Today :
  • Yesterday :

Copyright © Daum Corp. All rights reserved.

티스토리툴바