LLMRAM

OpenClaw: 하드웨어 요구사항·로컬 연결·컨텍스트 계획

공식 소스 기반 OpenClaw. OpenClaw는 로컬 우선(open-source) 에이전트 게이트웨이로, 클라우드/로컬 모델 provider를 모두 지원합니다.

무엇인가

OpenClaw는 상태와 자격 증명을 사용자 디바이스에 유지하는 어시스턴트 스택으로 소개되며, 모델/런타임 백엔드를 교체 가능하게 설계되었습니다.

Gateway는 세션, 도구, 채널, 모델 라우팅을 관리하는 로컬 제어 평면 역할을 합니다.

공식 런타임 요구사항

  • Node 런타임 요구사항: OpenClaw 설치 문서는 Node 24.16+ 또는 26.1+를 요구하고 Node 26을 권장합니다. Node가 없으면 설치기가 자동 준비합니다. (OpenClaw 설치 문서)
  • 플랫폼 지원: OpenClaw 설치 문서는 macOS, Linux, Windows를 지원 플랫폼으로 명시합니다. (OpenClaw 설치 문서)
  • 로컬 모델 메모리 주의사항: OpenClaw 로컬 모델 문서는 메모리 요구량이 모델 가중치, 컨텍스트, 런타임, 호스트 부하에 따라 달라진다고 설명합니다. 관리형 llama.cpp 레시피는 64K 컨텍스트를 사용하며 최소 레시피는 8 GiB 호스트 메모리 하한을 가집니다. (OpenClaw 로컬 모델 문서)

로컬 모델 연결 스니펫 (공식 문서)

Ollama

openclaw onboard
# choose Ollama: Cloud + Local, Cloud only, or Local only
openclaw models list --provider ollama

출처: OpenClaw Ollama 설정 문서

Ollama

models: {
  providers: {
    ollama: {
      api: 'ollama',
      baseUrl: 'http://host:11434',
    },
  },
}

OpenClaw Ollama 문서는 네이티브 Ollama provider 모드에서 /v1을 사용하지 말라고 명시합니다.

출처: OpenClaw Ollama 프로바이더 문서

LM Studio

models: {
  providers: {
    lmstudio: {
      api: 'openai-responses',
      baseUrl: 'http://127.0.0.1:1234/v1',
      models: [{ id: 'my-local-model', contextWindow: 196608 }],
    },
  },
}

출처: OpenClaw 로컬 모델 문서

vLLM

models: {
  providers: {
    local: {
      api: 'openai-completions',
      baseUrl: 'http://127.0.0.1:8000/v1',
      apiKey: 'sk-local',
    },
  },
}

OpenClaw 로컬 모델 문서는 vLLM을 OpenAI 호환 로컬 프록시 중 하나로 안내합니다.

출처: OpenClaw 로컬 모델 문서

llama.cpp

# Managed local server path from OpenClaw local-model docs
openclaw onboard
# choose Managed local server (llama.cpp plugin)

출처: OpenClaw 로컬 모델 문서

긴 컨텍스트 + 툴 호출 모델이 중요한 이유

  • OpenClaw 로컬 모델 문서는 짧은 프롬프트 테스트를 통과해도 tool schema, 히스토리, 시스템 프롬프트로 컨텍스트가 소모되어 실제 에이전트 턴에서 실패할 수 있다고 강조합니다.
  • OpenClaw 설정 흐름은 기본 로컬 모델을 전환하기 전에 실제 tool call 검증을 수행합니다.

프리필 계산기

아래 표는 Q4_K_M / batch=1 기준 추정치이며 공식 최소 요구사항이 아닙니다.

VRAM / RAM 계산기

GPU VRAM, Apple 통합 메모리, CPU/RAM 오프로드 시나리오를 함께 고려해 적합성을 비교합니다.

사용자 지정 Hugging Face 모델 id / 파라미터 (선택)

repo id를 모르면 입력한 값으로 추정 계산됩니다.

양자화별 메모리
양자화가중치KVOverhead합계
FP16 / BF1613.04 GiB8 GiB1.54 GiB22.58 GiB
INT8 / Q8_06.68 GiB8 GiB1.54 GiB16.22 GiB
Q6_K5.17 GiB8 GiB1.54 GiB14.71 GiB
Q5_K_M4.44 GiB8 GiB1.54 GiB13.98 GiB
Q4_K_M3.75 GiB8 GiB1.54 GiB13.29 GiB
Q3_K_M / Q32.85 GiB8 GiB1.54 GiB12.39 GiB
Q2_K / Q22.04 GiB8 GiB1.54 GiB11.58 GiB
하드웨어별 적합성
하드웨어메모리판정추정 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB적합170.3
NVIDIA GeForce RTX 5090 32GB32 GiB적합302.75
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB적합124.34
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB적합113.53
AMD Radeon RX 7900 XTX 24GB24 GiB적합162.19
NVIDIA A100 80GB PCIe80 GiB적합326.91
Apple Silicon M3 Max (128GB unified memory)128 GiB적합57.64
Apple Silicon M2 Ultra (192GB unified memory)192 GiB적합115.28
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB적합306.46

공식 및 가정

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

메모리 티어별 로컬 모델 적합 표 (LLMRAM 추정)

아래 표는 Q4_K_M / batch=1 기준 추정치이며 공식 최소 요구사항이 아닙니다.

32K 컨텍스트

GPU 티어

모델 프로필추정 총 메모리8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ 부적합✓ 적합✓ 적합✓ 적합✓ 적합✓ 적합
Qwen 3.8 27B24 GiB✕ 부적합✕ 부적합✕ 부적합✓ 적합✓ 적합✓ 적합
GLM 5.3 (Flash)195.84 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합

Mac 통합 메모리 티어

모델 프로필추정 총 메모리16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ 적합✓ 적합✓ 적합✓ 적합
Qwen 3.8 27B24 GiB✕ 부적합✓ 적합✓ 적합✓ 적합
GLM 5.3 (Flash)195.84 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합

64K 컨텍스트

GPU 티어

모델 프로필추정 총 메모리8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ 부적합✕ 부적합✓ 적합✓ 적합✓ 적합✓ 적합
Qwen 3.8 27B32.24 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합✓ 적합
GLM 5.3 (Flash)219.01 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합

Mac 통합 메모리 티어

모델 프로필추정 총 메모리16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ 부적합✓ 적합✓ 적합✓ 적합
Qwen 3.8 27B32.24 GiB✕ 부적합✕ 부적합✓ 적합✓ 적합
GLM 5.3 (Flash)219.01 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합

FAQ

OpenClaw는 클라우드 API가 필수인가요?

아닙니다. OpenClaw 문서는 로컬 우선 구성과 Ollama/관리형 로컬 서버를 포함한 로컬 모델 경로를 제공합니다.

왜 OpenClaw는 Ollama 네이티브 API와 OpenAI 호환 /v1 구성을 모두 다루나요?

Ollama provider 모드는 Ollama 네이티브 API를 사용하고, vLLM/LM Studio 등은 OpenAI 호환 provider 모드로 구성되기 때문입니다.

OpenClaw 문서에서 단일 고정 최소 메모리를 가정해도 되나요?

안 됩니다. OpenClaw는 메모리 요구량이 모델, 컨텍스트, 런타임, 호스트 상태에 따라 달라진다고 명시하며, 레시피 하한은 보장치가 아닙니다.

검증 메모

  • 런타임 요구사항 섹션에는 이 페이지에 명시한 공식 문서에 실제로 존재하는 내용만 포함했습니다.
  • 적합 표는 현재 모델 페이지와 계산기 가정을 기반으로 한 LLMRAM 계획 추정치입니다.
  • 공식 링크에 특정 런타임 스니펫이 없는 경우(예: Hermes llama.cpp) 추정 명령을 작성하지 않고 공백으로 명시합니다.

사용한 공식 소스

내부 링크