의미없는 블로그

로컬 LLM (feat. 엔비디아 DGX Spark) 본문

# 나/technology

로컬 LLM (feat. 엔비디아 DGX Spark)

SaltLee 2026. 6. 24. 14:34

엔비디아 DGX Spark

  • 자체 AI 개발 목적으로 출시한 초소형 컴퓨터 (800만원 정도)
  • 여기다가 로컬 LLM 구축해서 폐쇄망에서도 LLM 쓸 수 있게 한다고 함
  • LLM 전용 이미지를 도커로 띄워서 자체 AI 서버를 만드는거임
  • 주기적으로 최신 데이터가 담긴 팩을 다운받아서 패치 해주면 최신 데이터 쓸 수 있다고 함

로컬 LLM으로 많이 쓰는 3대 조합

  • 모델 : DeepSeek(중국 회사꺼) or Llama(메타에서 만든거)
  • 엔진 : vLLM(UC 버클리에서 만들었다고 함)
  • 클라이언트 : Open WebUI(오픈소스 커뮤니티가 집단지성으로 만들었다고 함)

AI 오픈소스 커뮤니티 (AI의 깃헙 같은곳)


대충 이런식으로 구축

 

0. 사전 준비

# 1. GPU 인식 및 VRAM 상태 확인
nvidia-smi

# 2. 도커 및 엔비디아 컨테이너 툴킷 작동 확인
docker run --rm --gpus all nvidia/cuda:12.4.1-base-ubuntu22.04 nvidia-smi

 

1. 백엔드 엔진 구동 (vLLM)

# vllm 이미지를 컨테이너로 띄울 때 AI 모델을 같이 설정해줌

docker run -d --gpus '"device=0,1,2,3"' \
  --name vllm-deepseek \
  --ipc=host \
  -v /data/vllm_cache:/root/.cache/huggingface \
  -p 8000:8000 \
  vllm/vllm-openai:latest \
  --model deepseek-ai/DeepSeek-R1-Distill-Llama-70B \
  --tensor-parallel-size 4 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.90 \
  --trust-remote-code

 

2. 프론트엔드 구동 (Open WebUI)

# open-webui 이미지를 컨테이너로 띄움

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

 

3. 컨테이너 연동

1) 사내망 컴퓨터 혹은 DGX 로컬 브라우저에서 http://<DGX_서버_IP>:3000 주소로 접속합니다.

2) 첫 화면에서 관리자 계정(이메일, 패스워드)을 생성하고 로그인합니다. (최초 가입 계정이 Admin 최고 권한을 가집니다.)

3) 우측 하단의 계정 프로필 클릭 ➔ [관리자 설정 (Admin Settings)] ➔ [연결 (Connections)] 메뉴로 이동합니다.

4) OpenAI API 항목의 주소 입력창에 아래 주소를 입력하고 저장 버튼(우측 새로고침 아이콘)을 누릅니다.

- API URL: [http://host.docker.internal:8000/v1] (http://host.docker.internal:8000/v1)

- API Key: none (로컬 폐쇄망이므로 아무 값이나 입력해도 무방합니다.)

왜 굳이 DGX에다가 올리냐?

  • --tensor-parallel-size 4 옵션 써서 GPU 4대에 쪼개 올리려면 일반 컴으로는 안됨
  • DGX는 GPU들이 NVLink라는 초고속 링크를 사용한다고 함 (슈퍼 컴퓨터)
  • 메모리도 GPU 한 대당 80~140GB 정도 쓸 수 있다고 함

Hermes Agent 라고 오픈소스 AI 에이전트가 있다

Open WebUI 만 썼을 때 업무 흐름

  • Open WebUI(http://dgx-ip:3000)에 접속 한다
  • 점검할 코드 몇개를 복붙하고 '이 코드 취약점 분석해줘' 한다
  • AI가 화면에 답을 준다

Hermes Agent 를 썼을 때 업무 흐름

  • 터미널이나 메신저로 '깃헙 전체 스캔해서 보안 점검 수행해줘' 한다
  • 에이전트가 900개 레포지토리 git clone 한다
  • 내부 vLLM(DeepSeek)를 통해 취약점 분석한다
  • 취약점 직접 수정도 하고 git commit 도 한다 (클로드 코드 형태)

'# 나 > technology' 카테고리의 다른 글

[blockchain] CELO 코인  (0) 2026.08.31
[blockchain] Keplr 지갑에 대하여  (0) 2026.08.25
아마존 베드락 (Amazon Bedrock)  (0) 2026.06.23
Solana 변경사항 확인하는 방법  (0) 2026.06.12
코인 보내기  (0) 2026.05.29
Comments