Mac에서도 vLLM을 돌린다: vllm-metal
대형 언어 모델(LLM)을 로컬에서 고성능으로 서빙하려고 할 때, 대부분의 개발자는 자연스럽게 NVIDIA GPU와 CUDA 환경을 떠올립니다. 실제로 지금까지의 생태계는 그쪽에 강하게 최적화되어 있었기 때문입니다.
하지만 Apple Silicon 기반 Mac을 사용하는 개발자라면 한 번쯤 고민을 해봤을 겁니다.
“내 Mac으로는 제대로 된 LLM 서버를 못 돌리는 걸까?”
이 질문에 대한 가장 현실적인 해답 중 하나가 바로 vllm-metal입니다.
왜 vllm-metal이 필요했나
먼저 배경을 이해해야 합니다.
vLLM은 고성능 LLM 추론 엔진으로, 다음과 같은 특징을 갖습니다:
- 높은 처리량 (throughput)
- 효율적인 KV 캐시 관리 (PagedAttention)
- OpenAI API 호환 서버 제공
- 배치 및 스케줄링 최적화
하지만 CUDA 기반이라는 점이라는 결정적인 문제가 있었습니다.
- NVIDIA GPU 필수
- Mac에서는 사실상 사용 불가
Apple Silicon의 GPU는 CUDA를 지원하지 않기 때문에, 기존 vLLM 구조를 그대로 사용할 수 없었습니다.
vllm-metal이란 무엇인가
vllm-metal은 간단히 말해 Apple Silicon 환경에서 vLLM을 실행하기 위한 GPU 백엔드 플러그인
입니다.
기존 vLLM이 CUDA에 의존했다면, vllm-metal은 이를 완전히 다른 스택으로 대체합니다.
기존 구조
vLLM → CUDA → NVIDIA GPU
vllm-metal 구조
vLLM → MLX + PyTorch → Metal → Apple GPU
핵심은 CUDA를 제거하고, Apple 생태계에 맞게 재구성했다는 점입니다.
사용법
최근 vllm-metal의 base image가 최신화 되면서(v0.17.1) qwen3.5도 일부 지원이 되는듯 하다.
최신 vllm-metal 환경에서 mlx-vlm version만 0.3.12 로 업그레이드 시켰다.
- vllm-metal 설치 및 실행
- qwen3.5
$ curl -fsSL <https://raw.githubusercontent.com/vllm-project/vllm-metal/main/install.sh> | bash
$ vllm serve mlx-community/Qwen3.5-9B-4bit --port 8100 --host 0.0.0.0

참고
반응형
'AI > LLM' 카테고리의 다른 글
| 로컬 LLM 실행 및 관리를 위한 Ollama 가이드 (0) | 2026.03.21 |
|---|---|
| vLLM 기반 Qwen3.5 서빙 가이드 (0) | 2026.03.20 |
| DOCLAYOUT-YOLO: 빠르고 정확한 문서 레이아웃 분석의 새로운 패러다임 (9) | 2024.11.07 |
| WoT(Whiteboard-of-Thought) 대형 언어 모델의 한계를 넘다. 시각적 사고 구현하기. (6) | 2024.11.06 |
| OpenAI API의 Structured Outputs: 기능 호출과 JSON 스키마 활용법 (4) | 2024.10.23 |