본문 바로가기
AI/LLM

mac에서 qwen3.5 vllm-metal로 서빙하기

by 니나노뭉 2026. 3. 18.

Mac에서도 vLLM을 돌린다: vllm-metal

대형 언어 모델(LLM)을 로컬에서 고성능으로 서빙하려고 할 때, 대부분의 개발자는 자연스럽게 NVIDIA GPU와 CUDA 환경을 떠올립니다. 실제로 지금까지의 생태계는 그쪽에 강하게 최적화되어 있었기 때문입니다.

하지만 Apple Silicon 기반 Mac을 사용하는 개발자라면 한 번쯤 고민을 해봤을 겁니다.

“내 Mac으로는 제대로 된 LLM 서버를 못 돌리는 걸까?”

이 질문에 대한 가장 현실적인 해답 중 하나가 바로 vllm-metal입니다.


왜 vllm-metal이 필요했나

먼저 배경을 이해해야 합니다.

vLLM은 고성능 LLM 추론 엔진으로, 다음과 같은 특징을 갖습니다:

  • 높은 처리량 (throughput)
  • 효율적인 KV 캐시 관리 (PagedAttention)
  • OpenAI API 호환 서버 제공
  • 배치 및 스케줄링 최적화

하지만 CUDA 기반이라는 점이라는 결정적인 문제가 있었습니다.

  • NVIDIA GPU 필수
  • Mac에서는 사실상 사용 불가

Apple Silicon의 GPU는 CUDA를 지원하지 않기 때문에, 기존 vLLM 구조를 그대로 사용할 수 없었습니다.


vllm-metal이란 무엇인가

vllm-metal은 간단히 말해 Apple Silicon 환경에서 vLLM을 실행하기 위한 GPU 백엔드 플러그인

입니다.

기존 vLLM이 CUDA에 의존했다면, vllm-metal은 이를 완전히 다른 스택으로 대체합니다.

기존 구조

vLLM → CUDA → NVIDIA GPU

vllm-metal 구조

vLLM → MLX + PyTorch → Metal → Apple GPU

핵심은 CUDA를 제거하고, Apple 생태계에 맞게 재구성했다는 점입니다.


사용법

최근 vllm-metal의 base image가 최신화 되면서(v0.17.1) qwen3.5도 일부 지원이 되는듯 하다.

최신 vllm-metal 환경에서 mlx-vlm version만 0.3.12 로 업그레이드 시켰다.

  • vllm-metal 설치 및 실행
  • qwen3.5
$ curl -fsSL <https://raw.githubusercontent.com/vllm-project/vllm-metal/main/install.sh> | bash

$ vllm serve mlx-community/Qwen3.5-9B-4bit --port 8100 --host 0.0.0.0

참고

https://github.com/vllm-project/vllm-metal

https://huggingface.co/mlx-community/Qwen3.5-9B-4bit

반응형