← ON DATA 노트

실측 노트 #1

DGX Spark 1대에 27B LLM을 올려 잰 기록

공개 모델 nvidia/Qwen3.8-27B-NVFP4를 SGLang 0.5.19로 실행해, 추측 디코딩을 쓸 때와 쓰지 않을 때의 출력 처리량을 조건마다 3회씩 쟀습니다. 측정 조건과 실패, 이 결과로 말할 수 없는 것까지 함께 적습니다.

측정 완료 게시 레코멘데이션(ON DATA)

요약

  • ON DATA가 보유한 DGX Spark 1대에서 nvidia/Qwen3.8-27B-NVFP4를 SGLang 0.5.19로 실행했습니다. 추측 디코딩(DFlash2 드래프트 모델)을 쓴 구성과 모델 단독 구성을 조건마다 3회씩 쟀습니다.
  • 입력 45토큰·출력 128토큰으로 고정하고 요청 8개를 동시에 보낸 조건에서, 전체 출력 처리량의 3회 중앙값은 DFlash2 구성 189.56 tok/s, 모델 단독 80.52 tok/s였습니다.
  • 짧은 고정 입력에서 나온 값입니다. 긴 문서 입력, 답변 품질, 여러 대를 하나로 묶은 분산 추론은 이번에 재지 않았습니다.

왜 쟀나

사내 LLM을 검토하는 팀이 처음 묻는 것은 대개 두 가지입니다. 쓰려는 크기의 모델이 장비 1대에 올라가는지, 그리고 여러 사람이 동시에 쓰면 어느 정도 나오는지입니다.

DGX Spark 사양표에는 128GB 통합 시스템 메모리가 적혀 있습니다. GPU 전용 메모리(VRAM)가 아니라 CPU와 GPU가 함께 쓰는 메모리입니다. 이 숫자만으로는 두 질문에 답하기 어려워서, 보유 장비 1대에 27B 모델을 올리고 조건을 고정해 직접 쟀습니다.

측정 환경과 조건

측정 환경과 조건
항목내용
장비NVIDIA DGX Spark 1대(ON DATA 보유). 128GB LPDDR5x 통합 시스템 메모리, 20코어 Arm CPU — NVIDIA 공식 사양
대상 모델nvidia/Qwen3.8-27B-NVFP4 — Qwen3.8-27B를 NVIDIA가 양자화한 공개 체크포인트. 모델 카드 기준 MLP·출력층은 NVFP4, attention은 FP8
드래프트 모델incoai/Qwen3.8-27B-DFlash2 — 추측 디코딩용 드래프트 모델. DFlash2 구성에서만 사용
추론 엔진SGLang 0.5.19
비교한 구성① DFlash2 구성: 대상 모델 + 드래프트 모델 ② 모델 단독(target-only)
고정 길이 요청입력 45토큰, 출력 128토큰 고정. 생각(thinking) 모드 끔, temperature 0
도구 작업 요청로컬 정수 덧셈 도구를 호출하는 2턴 작업. 응답은 모델이 스스로 끝낼 때까지 생성
동시 요청 수고정 길이 요청 1개·8개, 도구 작업 8개
반복과 집계조건마다 3회 측정, 회차별 처리량의 중앙값
측정 구간SSH 실행 제어와 결과 전송 시간 포함, 서버 시작과 워밍업 제외
지표출력 토큰 처리량(tok/s). 동시 요청 조건은 전체 합계
측정 완료2026-10-01

결과

출력 토큰 처리량(tok/s) · 조건마다 3회 측정의 중앙값
조건DFlash2 구성모델 단독
요청 1개 · 입력 45 / 출력 128 고정39.7611.19
요청 8개 동시 · 입력 45 / 출력 128 고정 · 전체189.5680.52
요청 8개 동시 · 2턴 도구 작업 · 전체117.9345.89

읽을 때 주의할 점

  • 같은 장비, 같은 대상 모델에서 추측 디코딩을 쓰는지만 바꾼 비교입니다. 다른 장비나 다른 엔진과 비교한 값이 아닙니다.
  • 추측 디코딩은 작은 드래프트 모델이 다음 토큰 여러 개를 먼저 제안하고 대상 모델이 한 번에 검증하는 방식입니다. 드래프트 모델 카드는 temperature 0에서 대상 모델 단독과 같은 출력을 내도록 설계됐다고 설명합니다. 이번에는 두 구성의 출력이 실제로 같았는지 비교하지 않았습니다.
  • 도구 작업은 응답을 모델이 스스로 끝내게 둔 조건이라 구성마다 출력 길이가 다릅니다. 출력 길이를 고정한 결과와 같은 잣대로 보면 안 됩니다.

실패와 예외

  • 도구 작업 측정에서 응답이 최대 출력 길이에 닿아 끝난(length) 경우가 1회 있었습니다.
  • 이 글의 값은 내부 측정 기록에 정리된 조건별 중앙값입니다. 원본 로그는 측정 장비에 보관하고 있습니다.

이 결과로 말할 수 없는 것

  • 입력이 긴 경우의 속도. 사내 문서를 넣는 RAG처럼 입력이 길어지면 결과가 달라집니다. 이번 고정 길이 요청의 입력은 45토큰입니다.
  • 첫 토큰까지 걸리는 시간과 요청별 지연. 이번에는 출력 처리량만 집계했습니다.
  • 답변 품질과 업무 정확도.
  • 다른 모델·정밀도·엔진 버전에서의 결과.
  • 여러 대를 하나의 모델로 묶은 분산 추론 성능.
  • 오래 켜 두고 쓸 때의 안정성이나 서비스 수준.

우리 워크로드로 확인하려면

이 기록은 이 조건에서 이렇게 나왔다는 출발점입니다. 쓰려는 모델, 입력 길이, 동시 사용자 수가 다르면 결과도 달라집니다.

ON DATA는 DGX Spark 1~4대를 고객사 내부에 설치해, 구매 전에 우리 데이터와 워크로드로 직접 확인할 수 있게 돕습니다. 모델·소프트웨어 호환성과 설치 범위·일정은 개별로 확인합니다.

기록 정보

  • 측정 완료: 2026-10-01, ON DATA 보유 DGX Spark 1대(내부 측정)
  • 같은 측정 기록에는 4대가 같은 모델을 각자 실행한 결과도 있습니다. 하나의 모델을 여러 대에 나눠 실행하는 분산 추론과 섞이지 않도록, 분산 추론 측정과 함께 별도 노트에서 다룹니다.
  • 개정 이력: 2026-10-09 처음 게시

출처

  1. NVIDIA, DGX Spark User Guide — Hardware Overview
  2. Hugging Face, nvidia/Qwen3.8-27B-NVFP4 모델 카드
  3. Hugging Face, incoai/Qwen3.8-27B-DFlash2 모델 카드
  4. PyPI, sglang 0.5.19