RTX 5060 Ti에서 SGLang 돌려보려다 실패한 이유

로컬 LLM 서빙 속도를 높이려고 SGLang을 시도했다. RTX 5060 Ti (Blackwell 아키텍처)에서는 현재 안 된다는 결론. 과정 기록.

RTX 5060 Ti에서 SGLang 돌려보려다 실패한 이유

계기

현재 Ollama로 로컬 LLM을 서빙하고 있는데 속도가 느립니다. SGLang이 Ollama보다 훨씬 빠르다는 글을 봤습니다.

“SGLang is 5x faster than vLLM”

빠른 속도 = 봇 응답 속도 개선 = 자동화 품질 향상. 바로 시도해봤습니다.


시스템 구성

  • GPU: RTX 5060 Ti 16GB
  • 아키텍처: Blackwell (sm_100)
  • 모델: GGUF 포맷 사용 중
  • OS: Windows + Docker

시도 1 — Docker로 설치

docker pull lmsysorg/sglang:latest
docker run --gpus all lmsysorg/sglang:latest \
  python -m sglang.launch_server --model-path /models/qwen3-14b

에러:

RuntimeError: CUDA error: no kernel image is available for execution on the device

원인 파악

SGLang은 CUDA 컴파일 시 특정 아키텍처를 타겟으로 빌드됩니다.

RTX 5060 Ti는 **Blackwell 아키텍처 (sm_100)**입니다. 최신 아키텍처라 SGLang 공식 Docker 이미지에 포함된 CUDA 바이너리가 지원하지 않았습니다.

# SGLang 공식 이미지 지원 아키텍처 확인
# sm_70 (Volta), sm_75 (Turing), sm_80 (Ampere), sm_86 (Ampere), sm_89 (Ada)
# sm_100 (Blackwell) — 미포함

시도 2 — 소스 빌드

Blackwell 지원을 위해 직접 빌드를 시도했습니다.

# CUDA_ARCH_LIST에 sm_100 추가해서 빌드
CUDA_ARCH_LIST="8.0;8.6;8.9;10.0" pip install sglang --no-build-isolation

CUDA Toolkit 12.8 필요, 빌드 시간 30분+, 이후에도 다른 의존성 충돌.


시도 3 — GGUF 모델 호환 확인

SGLang은 HuggingFace 포맷 모델을 사용합니다. GGUF 포맷을 직접 지원하지 않습니다.

현재 모델들이 전부 GGUF라서, SGLang을 쓰려면 모델도 바꿔야 합니다. HuggingFace에서 full-precision 또는 GPTQ/AWQ 포맷을 받아야 하는데, 16GB VRAM으로 14B 파라미터 모델은 fp16으로 올리기가 빡빡합니다.


결론: 현재 환경에서는 SGLang 포기

문제내용
Blackwell (sm_100) 미지원공식 이미지로 바로 실행 불가
소스 빌드가능하나 불안정, 시간 많이 소요
GGUF 호환 없음모델 포맷 전환 필요
VRAM 16GB대형 모델 fp16 실행 한계

Ollama는 GGUF를 직접 지원하고, CUDA 아키텍처 호환도 자동 처리해줍니다. Blackwell GPU에서는 현재 Ollama가 가장 안정적인 선택입니다.

SGLang은 Blackwell 공식 지원이 추가되고, 모델을 HuggingFace 포맷으로 전환할 수 있을 때 다시 시도해볼 예정입니다.


참고 — Ollama에서 속도 개선 방법

SGLang 대신 Ollama에서 속도를 올리는 현실적인 방법:

# 동시 처리 늘리기
OLLAMA_NUM_PARALLEL=4 ollama serve

# 컨텍스트 길이 조정
ollama run qwen3:14b --ctx-size 2048  # 짧게 잡으면 빠름

# GPU 레이어 최대화
ollama run qwen3:14b --gpu-layers 999
#SGLang#로컬LLM#RTX 5060 Ti#Blackwell#GPU