RTX 5060 Ti에서 SGLang 돌려보려다 실패한 이유
로컬 LLM 서빙 속도를 높이려고 SGLang을 시도했다. RTX 5060 Ti (Blackwell 아키텍처)에서는 현재 안 된다는 결론. 과정 기록.
계기
현재 Ollama로 로컬 LLM을 서빙하고 있는데 속도가 느립니다. SGLang이 Ollama보다 훨씬 빠르다는 글을 봤습니다.
“SGLang is 5x faster than vLLM”
빠른 속도 = 봇 응답 속도 개선 = 자동화 품질 향상. 바로 시도해봤습니다.
시스템 구성
- GPU: RTX 5060 Ti 16GB
- 아키텍처: Blackwell (sm_100)
- 모델: GGUF 포맷 사용 중
- OS: Windows + Docker
시도 1 — Docker로 설치
docker pull lmsysorg/sglang:latest
docker run --gpus all lmsysorg/sglang:latest \
python -m sglang.launch_server --model-path /models/qwen3-14b
에러:
RuntimeError: CUDA error: no kernel image is available for execution on the device
원인 파악
SGLang은 CUDA 컴파일 시 특정 아키텍처를 타겟으로 빌드됩니다.
RTX 5060 Ti는 **Blackwell 아키텍처 (sm_100)**입니다. 최신 아키텍처라 SGLang 공식 Docker 이미지에 포함된 CUDA 바이너리가 지원하지 않았습니다.
# SGLang 공식 이미지 지원 아키텍처 확인
# sm_70 (Volta), sm_75 (Turing), sm_80 (Ampere), sm_86 (Ampere), sm_89 (Ada)
# sm_100 (Blackwell) — 미포함
시도 2 — 소스 빌드
Blackwell 지원을 위해 직접 빌드를 시도했습니다.
# CUDA_ARCH_LIST에 sm_100 추가해서 빌드
CUDA_ARCH_LIST="8.0;8.6;8.9;10.0" pip install sglang --no-build-isolation
CUDA Toolkit 12.8 필요, 빌드 시간 30분+, 이후에도 다른 의존성 충돌.
시도 3 — GGUF 모델 호환 확인
SGLang은 HuggingFace 포맷 모델을 사용합니다. GGUF 포맷을 직접 지원하지 않습니다.
현재 모델들이 전부 GGUF라서, SGLang을 쓰려면 모델도 바꿔야 합니다. HuggingFace에서 full-precision 또는 GPTQ/AWQ 포맷을 받아야 하는데, 16GB VRAM으로 14B 파라미터 모델은 fp16으로 올리기가 빡빡합니다.
결론: 현재 환경에서는 SGLang 포기
| 문제 | 내용 |
|---|---|
| Blackwell (sm_100) 미지원 | 공식 이미지로 바로 실행 불가 |
| 소스 빌드 | 가능하나 불안정, 시간 많이 소요 |
| GGUF 호환 없음 | 모델 포맷 전환 필요 |
| VRAM 16GB | 대형 모델 fp16 실행 한계 |
Ollama는 GGUF를 직접 지원하고, CUDA 아키텍처 호환도 자동 처리해줍니다. Blackwell GPU에서는 현재 Ollama가 가장 안정적인 선택입니다.
SGLang은 Blackwell 공식 지원이 추가되고, 모델을 HuggingFace 포맷으로 전환할 수 있을 때 다시 시도해볼 예정입니다.
참고 — Ollama에서 속도 개선 방법
SGLang 대신 Ollama에서 속도를 올리는 현실적인 방법:
# 동시 처리 늘리기
OLLAMA_NUM_PARALLEL=4 ollama serve
# 컨텍스트 길이 조정
ollama run qwen3:14b --ctx-size 2048 # 짧게 잡으면 빠름
# GPU 레이어 최대화
ollama run qwen3:14b --gpu-layers 999