TechToast

  • 홈
  • 태그
  • 미디어로그
  • 위치로그
  • 방명록

2026/10/11 1

2x DGX Spark에서 대형 로컬 모델 고르기: DeepSeek V4-Flash vs Qwen3.8 — 1M 컨텍스트와 동시성의 트레이드오프

연구실에서 지금 2x DGX Spark(GB10, 통합메모리 128GB × 2노드)로 로컬 LLM을 서빙하고 있습니다. 최근 딥시크가 DeepSeek V4.1-Flash를 공개하면서, "요새 뭐 써야 하나"를 다시 따져볼 때가 됐습니다. 랩 실측으로 다시 확인한 결론부터 말하자면, 램(파라미터 총량)이 어디까지 들어갈 수 있을지를 정하고, 활성 파라미터가 속도를 정하고, 양자화가 품질을 정합니다. 이 세 가지가 서로 다른 자리에 걸려 있는 게, 이 비교의 전부입니다. V4.1-Flash는 왜 2x Spark에서 "미지의 영역"인가DeepSeek V4.1-Flash는 552B backbone에 196B Engram을 얹은 구조이고, 네이티브(MXFP4/FP8)로 떠 올리면 약 511GB입니다. 2x Spa..

공부/인공지능 10:43:35
이전
1
다음
더보기
프로필사진

TechToast

가랑비에 옷 젖듯 글쓰기.

  • 분류 전체보기 (75) N
    • 공부 (40) N
      • 의료영상처리 (0)
      • 인공지능 (34) N
      • 텍스트 (1)
      • 잡소리 (5)
    • 리뷰 (25)
      • 제품 (11)
      • 여행 (0)
      • 기타 (14)
    • 모디아 프로젝트 (6)

Tag

Wan 2.2, 벤치마크, 세컨드브레인, deepseek, DGXSpark, AI 영상, 3진 가중치, 세컨드브레인 개발기, vllm, 건강가정지원센터, Rag, 예비부부교실, 컨텍스트 길이, 게임 스프라이트, kv 캐시, LiteLLM, LLM서빙, 개발기, 로컬 LLM, 트러블슈팅,

최근글과 인기글

  • 최근글
  • 인기글

최근댓글

공지사항

페이스북 트위터 플러그인

  • Facebook
  • Twitter

Archives

Calendar

«   2026/10   »
일 월 화 수 목 금 토
1 2 3
4 5 6 7 8 9 10
11 12 13 14 15 16 17
18 19 20 21 22 23 24
25 26 27 28 29 30 31

방문자수Total

  • Today :
  • Yesterday :

Copyright © Daum Corp. All rights reserved.

티스토리툴바