LLMRAM

OpenClaw: requisitos de hardware, conexão local e planejamento de contexto

Guia oficial para OpenClaw. OpenClaw é um gateway de agentes open source e local-first que suporta provedores de modelo em cloud e local.

O que é

O OpenClaw se apresenta como uma stack de assistente onde estado e credenciais ficam nos seus dispositivos, com backends de modelo/runtime plugáveis.

O Gateway atua como plano de controle local para sessões, ferramentas, canais e roteamento de modelos.

Requisitos oficiais de runtime

  • Requisito de runtime Node: A documentação de instalação do OpenClaw exige Node 24.16+ ou 26.1+, e recomenda Node 26. O instalador provisiona Node se estiver ausente. (Documentação de instalação do OpenClaw)
  • Suporte de plataforma: A documentação de instalação do OpenClaw lista macOS, Linux e Windows como plataformas suportadas. (Documentação de instalação do OpenClaw)
  • Nota de memória para modelos locais: A documentação local-models do OpenClaw afirma que a memória depende de pesos do modelo, contexto, runtime e carga do host; receitas gerenciadas de llama.cpp usam contexto 64K e a menor receita indica piso de 8 GiB de memória de host. (Documentação de modelos locais do OpenClaw)

Snippets de conexão local (docs oficiais)

Ollama

models: {
  providers: {
    ollama: {
      api: 'ollama',
      baseUrl: 'http://host:11434',
    },
  },
}

A documentação Ollama do OpenClaw alerta explicitamente para não usar /v1 no modo provider nativo do Ollama.

Fonte: Documentação do provedor Ollama no OpenClaw

LM Studio

models: {
  providers: {
    lmstudio: {
      api: 'openai-responses',
      baseUrl: 'http://127.0.0.1:1234/v1',
      models: [{ id: 'my-local-model', contextWindow: 196608 }],
    },
  },
}

Fonte: Documentação de modelos locais do OpenClaw

vLLM

models: {
  providers: {
    local: {
      api: 'openai-completions',
      baseUrl: 'http://127.0.0.1:8000/v1',
      apiKey: 'sk-local',
    },
  },
}

A documentação local-models do OpenClaw lista vLLM entre os proxies locais compatíveis com OpenAI.

Fonte: Documentação de modelos locais do OpenClaw

Por que contexto longo e tool-calling importam

  • A documentação local-models do OpenClaw destaca que um modelo pode passar em prompts curtos e ainda falhar em turnos completos de agente, porque schema de ferramentas, histórico e prompts consomem contexto extra.
  • O setup do OpenClaw valida um tool call real antes de trocar o modelo local padrão no fluxo gerenciado.

Calculadora pré-preenchida

Esta matriz é uma estimativa de planejamento (Q4_K_M, batch=1), não um mínimo oficial do fornecedor.

Calculadora de VRAM / RAM

Compare cenários com VRAM dedicada, memória unificada da Apple e offload CPU/RAM.

ID do Hugging Face / parâmetros customizados (opcional)

Se o repo for desconhecido, a calculadora usa seus valores como estimativa.

Memória por quantização
QuantPesosKVOverheadTotal
FP16 / BF1613.04 GiB8 GiB1.54 GiB22.58 GiB
INT8 / Q8_06.68 GiB8 GiB1.54 GiB16.22 GiB
Q6_K5.17 GiB8 GiB1.54 GiB14.71 GiB
Q5_K_M4.44 GiB8 GiB1.54 GiB13.98 GiB
Q4_K_M3.75 GiB8 GiB1.54 GiB13.29 GiB
Q3_K_M / Q32.85 GiB8 GiB1.54 GiB12.39 GiB
Q2_K / Q22.04 GiB8 GiB1.54 GiB11.58 GiB
Cabe / não cabe por hardware
HardwareMemóriaResultadotok/s est.
NVIDIA GeForce RTX 4090 24GB24 GiBCabe170.3
NVIDIA GeForce RTX 5090 32GB32 GiBCabe302.75
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBCabe124.34
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBCabe113.53
AMD Radeon RX 7900 XTX 24GB24 GiBCabe162.19
NVIDIA A100 80GB PCIe80 GiBCabe326.91
Apple Silicon M3 Max (128GB unified memory)128 GiBCabe57.64
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCabe115.28
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCabe306.46

Fórmulas e premissas

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Tabela de ajuste por faixas de memória (estimativa LLMRAM)

Esta matriz é uma estimativa de planejamento (Q4_K_M, batch=1), não um mínimo oficial do fornecedor.

Contexto 32K

Faixas de GPU

Perfil do modeloMemória total estimada8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ Não cabe✓ Cabe✓ Cabe✓ Cabe✓ Cabe✓ Cabe
Qwen 3.8 27B24 GiB✕ Não cabe✕ Não cabe✕ Não cabe✓ Cabe✓ Cabe✓ Cabe
GLM 5.3 (Flash)195.84 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe

Faixas de memória unificada Mac

Perfil do modeloMemória total estimada16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ Cabe✓ Cabe✓ Cabe✓ Cabe
Qwen 3.8 27B24 GiB✕ Não cabe✓ Cabe✓ Cabe✓ Cabe
GLM 5.3 (Flash)195.84 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe

Contexto 64K

Faixas de GPU

Perfil do modeloMemória total estimada8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ Não cabe✕ Não cabe✓ Cabe✓ Cabe✓ Cabe✓ Cabe
Qwen 3.8 27B32.24 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✓ Cabe
GLM 5.3 (Flash)219.01 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe

Faixas de memória unificada Mac

Perfil do modeloMemória total estimada16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ Não cabe✓ Cabe✓ Cabe✓ Cabe
Qwen 3.8 27B32.24 GiB✕ Não cabe✕ Não cabe✓ Cabe✓ Cabe
GLM 5.3 (Flash)219.01 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe

FAQ

OpenClaw exige APIs cloud obrigatoriamente?

Não. A documentação do OpenClaw cobre setups local-first e rotas de modelos locais, incluindo Ollama e servidores locais gerenciados.

Por que o OpenClaw documenta tanto Ollama nativo quanto backends /v1 compatíveis com OpenAI?

No modo provider Ollama usa-se a API nativa do Ollama; para vLLM/LM Studio/proxies usa-se configuração provider compatível com OpenAI.

Posso assumir um mínimo fixo de memória com base na documentação do OpenClaw?

Não. O OpenClaw afirma que a memória depende de modelo, contexto, runtime e condição do host; pisos de receita não são garantia de fit.

Notas de verificação

  • A seção de requisitos de runtime inclui apenas afirmações presentes na documentação oficial do framework listada nesta página.
  • As tabelas de ajuste são estimativas de planejamento do LLMRAM derivadas das páginas de modelo atuais e das premissas da calculadora.
  • Quando faltar um snippet específico de runtime nos links oficiais fornecidos (por exemplo, Hermes llama.cpp), esta página marca a lacuna explicitamente.

Fontes oficiais usadas

Links internos