2x DGX Spark에서 대형 로컬 모델 고르기: DeepSeek V4-Flash vs Qwen3.8 — 1M 컨텍스트와 동시성의 트레이드오프
연구실에서 지금 2x DGX Spark(GB10, 통합메모리 128GB × 2노드)로 로컬 LLM을 서빙하고 있습니다. 최근 딥시크가 DeepSeek V4.1-Flash를 공개하면서, "요새 뭐 써야 하나"를 다시 따져볼 때가 됐습니다. 랩 실측으로 다시 확인한 결론부터 말하자면, 램(파라미터 총량)이 어디까지 들어갈 수 있을지를 정하고, 활성 파라미터가 속도를 정하고, 양자화가 품질을 정합니다. 이 세 가지가 서로 다른 자리에 걸려 있는 게, 이 비교의 전부입니다.

V4.1-Flash는 왜 2x Spark에서 "미지의 영역"인가
DeepSeek V4.1-Flash는 552B backbone에 196B Engram을 얹은 구조이고, 네이티브(MXFP4/FP8)로 떠 올리면 약 511GB입니다. 2x Spark의 UMA 128GB × 2, 즉 256GB에는 네이티브로는 절대 안 들어갑니다. 그렇다고 이 모델을 아예 쓸 수 없는 건 아니어서, EXL3 2bpw 양자화 팩이 나와 있습니다. 이건 라우트드 엑스퍼트만 2bpw로 깎고 Engram은 NVMe에 얹는 방식이라, 공개 레시피 기준으론 2x Spark에서 단일 스트림 prose 15~21 tok/s, 동시 2 스트림 하드캡 정도가 한계입니다.
다만 이름에 함정이 있습니다. "Flash"라는 이름은 사실 딥시크가 서빙할 때의 비용 기준이지, 제가 이걸 소유했을 때의 비용이 아닙니다. 모델을 들고 있냐 클라우드에서 불러 쓰냐는 전혀 다른 얘기라서요. 552B의 지능 상한은 확실히 높은데, 커뮤니티 정서는 이렇습니다. "2bpw는 q1~q2 품질이라 사실상 못 씁니다", "exl3 쓰레기", "3bpw로 가라". 지능 상한은 높아도 2bpw가 그걸 다 깎아먹는 그림이죠. 게다가 이 팩의 1M 롱컨텍스트 품질은 공개 벤치에 아예 없습니다. 램으로 세어 552B를 억지로 끼워 넣은 상태라, 그 지능이 양자화에 얼마나 버티는지를 실측한 기록이 안 남아 있는 거죠.

그래서 남은 진짜 비교: DSv4-Flash(-Vision) vs Qwen3.8
그럼 진짜 비교 대상은 "덜 깎인" 모델들끼리입니다. V4.1-Flash 2bpw는 접고, DeepSeek-V4-Flash-Vision-Exp와 Qwen3.8(Flash-Next / 27B) 사이에서 실전 선택을 하는 겁니다. 2x Spark 기준 커뮤니티·자체 실측 표를 그대로 적습니다.
| 항목 | DSv4-Flash-Vision-Exp | Qwen3.8-Flash-Next (NVFP4) |
|---|---|---|
| 단일 스트림 decode | 33-40 tok/s | 30-50 tok/s |
| 고부하 집계 | 130-150 tok/s (c6) | 181-195 tok/s (~9세션, 512K) |
| 동시성 | 6~8 스트림 | 9+ 스트림 |
| 프리필 | 스파크 특화 B12X 스택 | 240K에서 ~2.3k tok/s (TTFT ~103s) |
| KV pool | 2.1M~2.31M 토큰 | NVFP4 fp8-KV에서 3.65M 토큰 |
| 실행 포맷 | FP8/NVFP4, 네이티브 1M | NVFP4, 네이티브 262K → YaRN 1M |
이 표에서 수치를 보면 DSv4는 단일·고부하 속도가 전부 근소한 열세고, KV pool도 작습니다. 그런데 표를 다시 보면 결론이 뒤집힙니다. 바로 1M 컨텍스트가 갈림길이라는 점이죠.
DSv4는 네이티브 1M이고, KV가 효율적이라서 1M이 메모리 문제에서 일단 탈출합니다. 반면 Qwen3.8는 네이티브 262K가 한계라, 1M은 YaRN 확장으로 만들어 냅니다. 그런데 YaRN factor 4.0은 모델 트레이닝 범위를 초과하는 확장이라, 1M에서의 롱컨텍스트 답을 신뢰하려면 먼저 벤치해야 합니다. 2x Spark에서 1M 실측은 아직 없고, 512K까지는 needle-verified가 된 상태입니다. 즉 Qwen3.8의 1M은 "된다"가 아니라 "벤치해봐야 안다"인 거죠.
품질·할루 쪽 커뮤니티 평도 갈립니다. DSv4는 "시킨 것만 정확히 한다", 저할루 평이 지배적이지만 간혹 CJK가 섞인다는 후기가 나옵니다(논란 영역). Qwen3.8-Flash-Next는 FP8이라 품질 손실이 미미하지만, 레딧은 양분되어 있습니다. "리즈닝이 한 끗 낫다"를 주장하는 쪽과 "할루 많다 / 지시를 과잉해석한다 / xhigh는 예산을 다 먹고 빈응답"을 주장하는 쪽이 서로 그렇지 않다고 하는 거죠.
27B와 비교하면 — 속도는 Flash-Next가 이기는데, 신뢰성은 27B/DSv4가 진다
Qwen3.8-Flash-Next를 워크스테이션의 27B(dense)와 견주면 쓰로풋·에이전트 코딩 효율은 Flash-Next가 확실히 이깁니다. 약 177 tok/s에 MTP3, MoE 희소성까지 있어서다. 그런데 생산성·지속추론·예측가능성 자리에선 27B가 낫다는 평이 있습니다. Flash-Next는 "완료 선언 후 아무것도 내지 않는(phantom deliverable)" 증상, ARC에서 acceptance 붕괴, 그리고 "아직 프로덕션 부적합"이라 지적하는 상세 벤치까지 있어요.

Vision-Exp는 0731보다 나은가 (체감 + 커뮤니티)
그다음 궁금해할 게, 이 1M의 진짜 주인인 DSv4-Flash-Vision-Exp가 직전 프리뷰(0731)보다 나은가입니다. 결론부터 말하면, 아키텍처 자체가 같습니다. Vision-Exp는 0731과 같은 backbone에 비전(ViT + aligner)이 붙은 판이라, 텍스트 경로는 사실상 동일합니다. 그래서 "0731보다 빠릿하거나 롱컨텍스트가 낫다"고 느끼지 않는 게 정상입니다. 커뮤니티(g_rich)도 "비전 지원에 더해 점진적 개선"이라 표현하고, huxiaofengtiger는 "아주 긴 에이전트 체인이 0731보다 덜 예측 가능"하다고 합니다.
정직하게 치면, 이미지를 자주 안 쓴다면 Vision-Exp의 실질 이득은 거의 0입니다. 거기에 비전조차 stock vLLM으로 바로 안 돌아서, 전용 이미지가 필요했을 정도였습니다.
결론 — 그래서 뭘 쓸까
제 실제 선택입니다. 메인은 DSv4-Flash-Vision-Exp를 유지합니다. 8개 크론과 멀티세션 병행, 그리고 정확성 중시 연구 작업에서는 신뢰성이 우선이기 때문입니다. 보조는 Qwen3.8-27B를 창작·서브에이전트 계열로 두고, Qwen3.8-Flash-Next는 고부하 agentic 코딩 전용 보조 엔드포인트로만 씁니다. 연구 정확성이 필요한 작업에는 Flash-Next를 쓰지 않습니다. V4.1-Flash 2bpw는 접었습니다. 얻을 이득이 "네이티브 1M KV" 하나뿐인데, 그건 DSv4-Vision이 이미 커버하고 있으니까요.
커뮤니티 귀결도 이 결론을 지지합니다. agentic이거나 고볼륨 워크플로우라면 DSv4가 낫다는 쪽이 지배적입니다.
정직한 한계도 적어둡니다. Vision-Exp가 0731보다 빠릿하고 롱컨텍스트를 잘 핸들링한다는 느낌은 솔직히 덜 들었습니다. 이미지가 들어간다는 장점이 있긴 한데, 그렇게 자주 이용되지는 않는 것 같고요. Qwen3.8-Flash가 27B 대비 성능·속도가 그렇게 나은지 감각이 애매했습니다. 이번 조사로 확인한 건, 바로 이 "애매하다"는 감각이 커뮤니티와 일치한다는 점입니다. 속도는 Flash-Next가 이기지만, 신뢰성·예측가능성·지속추론은 27B와 DSv4가 우위라서, "애매하다"고 느끼는 게 맞다는 거죠.
후속 계획으로는 두 가지를 잡아뒀습니다. 우선 보류인 항목으로, Flash-Next를 보조 agentic 엔드포인트로 세팅해서 1M/262K 품질을 실제로 벤치해볼 수 있습니다. 단 그 전까지는 지금 구성이 가장 안전합니다. 또 컨텍스트 길이와 할루 항목을 별도 마이크로벤치로 확장해서, "빠르지만 신뢰성이 애매한" 모델을 정량 비교해보겠습니다.