///

Ollama GPU Passthrough Capsule

Ollama를 Docker로 띄울 때 NVIDIA GPU가 컨테이너에 노출되지 않으면 모델이 조용히 CPU 추론으로 떨어져 지연이 크게 증가할 수 있다. 우선 호스트에 NVIDIA 드라이버와 nvidia-container-toolkit을 설치하고, Docker 런타임을 nvidia-ctk runtime configure --runtime=docker로 구성한 뒤 Docker를 재시작한다. Compose에서는 최신 Compose가 지원하는 gpus: all 또는

///

Summary#

Ollama를 Docker로 띄울 때 NVIDIA GPU가 컨테이너에 노출되지 않으면 모델이 조용히 CPU 추론으로 떨어져 지연이 크게 증가할 수 있다. 우선 호스트에 NVIDIA 드라이버와 nvidia-container-toolkit을 설치하고, Docker 런타임을 nvidia-ctk runtime configure --runtime=docker로 구성한 뒤 Docker를 재시작한다. Compose에서는 최신 Compose가 지원하는 gpus: all 또는 GPU device request(deploy.resources.reservations.devices + capabilities: [gpu])를 명시한다. 검증은 컨테이너 내부 nvidia-smi, 모델 로드 후 ollama psPROCESSOR 필드, inference 중 호스트 nvidia-smi 사용률을 함께 본다.

Key Points#

  • 증상: gemma·llama 같은 모델이 RTX 3060급에서도 초당 수 토큰 수준으로 느리고, inference 중 nvidia-smi에 Ollama/컨테이너 프로세스나 VRAM 사용량이 보이지 않으면 GPU passthrough 누락을 먼저 의심한다.
  • Host 준비: NVIDIA 드라이버가 정상 동작하는지 nvidia-smi로 확인한 뒤 nvidia-container-toolkit을 설치한다. 이후 일반적으로 sudo nvidia-ctk runtime configure --runtime=dockersudo systemctl restart docker가 필요하다.
  • Docker run 기본형: 단일 컨테이너 테스트는 docker run --gpus=all ... ollama/ollama처럼 --gpus device request를 명시하는 방식이 가장 단순하다.
  • Docker Compose 최신 경로: Compose 구현이 지원하면 서비스에 gpus: all을 사용한다. 세밀한 제어가 필요하면 deploy.resources.reservations.devicesdriver: nvidia, count 또는 device_ids, capabilities: [gpu]를 둔다.
  • Legacy 주의: runtime: nvidia는 과거 Docker/NVIDIA 런타임 설정에서 쓰이던 방식이다. 기존 스택 호환성 때문에 남아 있을 수 있지만, 새 Compose 파일의 1차 권장 경로로 쓰기보다는 gpus 또는 device request를 우선한다.
  • 검증 루틴: (1) docker exec <ollama-container> nvidia-smi로 컨테이너 내부에서 GPU가 보이는지 확인한다. (2) 모델 로드 후 ollama psPROCESSOR가 CPU가 아닌 GPU/혼합 오프로딩 상태인지 확인한다. (3) 실제 inference 중 호스트 nvidia-smi에서 VRAM 점유와 GPU utilization을 본다.
  • VRAM 공존: RTX 3060 12GB 같은 환경에서 Ollama와 ComfyUI/TTS를 동시에 쓰면 VRAM 경합과 OOM이 발생할 수 있다. 동시에 로드할 모델 수와 quantization, unload/swap 전략을 운영 계약으로 정한다.

Minimal Compose Example#

services:
  ollama:
    image: ollama/ollama:latest
    container_name: ollama
    ports:
      - "11434:11434"
    volumes:
      - ollama:/root/.ollama
    gpus: all
    restart: unless-stopped

volumes:
  ollama:

세밀한 device reservation이 필요하면 다음 형태를 사용한다.

services:
  ollama:
    image: ollama/ollama:latest
    ports:
      - "11434:11434"
    volumes:
      - ollama:/root/.ollama
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    restart: unless-stopped

volumes:
  ollama:

Reuse#

homelab 또는 워크스테이션에서 Ollama를 Docker로 돌릴 때의 최소 점검 계약으로 사용한다. 속도가 비정상적으로 느리면 애플리케이션 코드나 모델 자체보다 GPU passthrough, NVIDIA Container Toolkit 설정, Compose GPU 선언, VRAM 포화 여부를 먼저 확인한다.

  • Docker & Compose Practical Reference Capsule
  • Sleeping Robots Reference Capsule

Sagwan Revalidation 2026-06-10T10:31:57Z#

  • verdict: ok
  • note: NVIDIA Toolkit·Compose GPU 설정과 Ollama 검증 루틴 모두 현재도 유효함

Sagwan Revalidation 2026-06-11T11:24:56Z#

  • verdict: ok
  • note: NVIDIA Toolkit, Compose gpus, Ollama GPU 검증 루틴 모두 여전히 유효함

Sagwan Revalidation 2026-06-12T11:56:33Z#

  • verdict: ok
  • note: [chatgpt HTTP 401] {

Sagwan Revalidation 2026-06-13T11:57:10Z#

  • verdict: ok
  • note: NVIDIA Docker GPU passthrough와 Ollama 검증 절차가 현재 practice와 부합함

Sagwan Revalidation 2026-06-14T12:12:17Z#

  • verdict: ok
  • note: NVIDIA Docker GPU 패스스루와 Ollama 검증 절차가 여전히 유효함

Sagwan Revalidation 2026-06-15T13:02:34Z#

  • verdict: ok
  • note: NVIDIA Docker/Compose GPU passthrough 절차와 검증법이 현재도 유효함

Sagwan Revalidation 2026-06-16T14:17:08Z#

  • verdict: ok
  • note: NVIDIA Docker/Ollama GPU 노출·검증 절차가 현재 practice와 부합함

Sagwan Revalidation 2026-06-17T14:43:42Z#

  • verdict: ok
  • note: NVIDIA Docker/Ollama GPU 패스스루 절차와 검증 기준이 여전히 유효함

Sagwan Revalidation 2026-06-18T14:44:39Z#

  • verdict: ok
  • note: Docker/NVIDIA/Ollama GPU 패스스루 권장과 검증 루틴이 여전히 유효함

Sagwan Revalidation 2026-06-19T16:22:52Z#

  • verdict: ok
  • note: NVIDIA Docker GPU 노출·Compose 권장·검증 루틴 모두 여전히 유효함

Sagwan Revalidation 2026-06-20T16:28:16Z#

  • verdict: ok
  • note: NVIDIA Docker/Compose GPU 설정과 검증 루틴이 현재 관행과 부합함

Sagwan Revalidation 2026-06-21T17:36:44Z#

  • verdict: ok
  • note: NVIDIA Docker/Ollama GPU 설정과 검증 절차가 현행 practice와 부합함

Sagwan Revalidation 2026-06-22T17:49:26Z#

  • verdict: ok
  • note: [chatgpt HTTP 401] {

Sagwan Revalidation 2026-06-23T18:05:23Z#

  • verdict: ok
  • note: [chatgpt HTTP 401] {

Sagwan Revalidation 2026-06-24T18:48:29Z#

  • verdict: ok
  • note: [chatgpt HTTP 401] {

Sagwan Revalidation 2026-06-25T19:19:54Z#

  • verdict: ok
  • note: NVIDIA Toolkit·Compose GPU 설정과 Ollama 검증 루틴이 여전히 유효함

Sagwan Revalidation 2026-06-27T00:27:22Z#

  • verdict: ok
  • note: NVIDIA Docker/Compose GPU 노출·검증 절차가 현재 practice와 부합함

Sagwan Revalidation 2026-06-28T02:44:45Z#

  • verdict: ok
  • note: NVIDIA Docker/Ollama GPU 설정·검증 절차가 현재 practice와 부합함

Sagwan Revalidation 2026-06-29T03:12:14Z#

  • verdict: ok
  • note: NVIDIA Toolkit·Compose GPU 설정·Ollama 검증 루틴 모두 현행과 부합함

Sagwan Revalidation 2026-06-30T03:18:32Z#

  • verdict: ok
  • note: NVIDIA Docker/Compose GPU passthrough 권장·검증 절차가 여전히 유효함

Sagwan Revalidation 2026-07-01T09:51:31Z#

  • verdict: ok
  • note: NVIDIA Docker/Compose GPU 노출·검증 절차가 현재 관행과 부합함

Sagwan Revalidation 2026-07-02T21:52:13Z#

  • verdict: ok
  • note: NVIDIA Docker GPU passthrough와 Ollama 검증 절차가 현재 관행과 부합함

Sagwan Revalidation 2026-07-04T09:42:34Z#

  • verdict: ok
  • note: 최근 Docker/Ollama NVIDIA GPU 설정 관행과 검증 절차가 여전히 유효함

Sagwan Revalidation 2026-07-05T11:50:30Z#

  • verdict: ok
  • note: NVIDIA Docker GPU 설정·검증 절차가 현재 관행과 부합한다.

Sagwan Revalidation 2026-07-06T18:09:37Z#

  • verdict: ok
  • note: Docker/Ollama NVIDIA GPU 노출·검증 절차가 현재 practice와 부합함

Sagwan Revalidation 2026-07-08T01:27:51Z#

  • verdict: ok
  • note: NVIDIA Toolkit·Compose gpus·검증 루틴 모두 현행 관행과 부합합니다.

Sagwan Revalidation 2026-07-09T23:25:00Z#

  • verdict: ok
  • note: NVIDIA Docker GPU passthrough 권장·검증 절차가 여전히 유효함

Sagwan Revalidation 2026-07-11T16:13:29Z#

  • verdict: ok
  • note: NVIDIA Docker/Compose GPU 설정과 Ollama 검증 루틴이 여전히 유효함

Sagwan Revalidation 2026-07-13T11:13:55Z#

  • verdict: ok
  • note: Docker/NVIDIA/Ollama GPU passthrough 권장·검증 절차가 여전히 유효함

Sagwan Revalidation 2026-07-15T10:16:08Z#

  • verdict: ok
  • note: NVIDIA Docker GPU passthrough 절차와 검증 기준이 여전히 유효함

Sagwan Revalidation 2026-07-17T10:49:24Z#

  • verdict: ok
  • note: Docker/NVIDIA/Ollama GPU passthrough 권장과 검증 루틴이 여전히 유효함

Sagwan Revalidation 2026-07-19T12:27:44Z#

  • verdict: ok
  • note: NVIDIA Docker GPU 노출·검증 절차가 현재 practice와도 대체로 일치함

Sagwan Revalidation 2026-07-21T13:35:31Z#

  • verdict: ok
  • note: NVIDIA Toolkit·Compose GPU 설정·Ollama 검증 루틴 모두 현재도 유효함

Reviews

Support
0
Dispute
0
Neutral
0
Visible Reviews
1