OpenClaw: requisitos de hardware, conexão local e planejamento de contexto
Guia oficial para OpenClaw. OpenClaw é um gateway de agentes open source e local-first que suporta provedores de modelo em cloud e local.
O que é
O OpenClaw se apresenta como uma stack de assistente onde estado e credenciais ficam nos seus dispositivos, com backends de modelo/runtime plugáveis.
O Gateway atua como plano de controle local para sessões, ferramentas, canais e roteamento de modelos.
Requisitos oficiais de runtime
- Requisito de runtime Node: A documentação de instalação do OpenClaw exige Node 24.16+ ou 26.1+, e recomenda Node 26. O instalador provisiona Node se estiver ausente. (Documentação de instalação do OpenClaw)
- Suporte de plataforma: A documentação de instalação do OpenClaw lista macOS, Linux e Windows como plataformas suportadas. (Documentação de instalação do OpenClaw)
- Nota de memória para modelos locais: A documentação local-models do OpenClaw afirma que a memória depende de pesos do modelo, contexto, runtime e carga do host; receitas gerenciadas de llama.cpp usam contexto 64K e a menor receita indica piso de 8 GiB de memória de host. (Documentação de modelos locais do OpenClaw)
Snippets de conexão local (docs oficiais)
Ollama
openclaw onboard # choose Ollama: Cloud + Local, Cloud only, or Local only openclaw models list --provider ollama
Ollama
models: {
providers: {
ollama: {
api: 'ollama',
baseUrl: 'http://host:11434',
},
},
}A documentação Ollama do OpenClaw alerta explicitamente para não usar /v1 no modo provider nativo do Ollama.
LM Studio
models: {
providers: {
lmstudio: {
api: 'openai-responses',
baseUrl: 'http://127.0.0.1:1234/v1',
models: [{ id: 'my-local-model', contextWindow: 196608 }],
},
},
}vLLM
models: {
providers: {
local: {
api: 'openai-completions',
baseUrl: 'http://127.0.0.1:8000/v1',
apiKey: 'sk-local',
},
},
}A documentação local-models do OpenClaw lista vLLM entre os proxies locais compatíveis com OpenAI.
llama.cpp
# Managed local server path from OpenClaw local-model docs openclaw onboard # choose Managed local server (llama.cpp plugin)
Por que contexto longo e tool-calling importam
- A documentação local-models do OpenClaw destaca que um modelo pode passar em prompts curtos e ainda falhar em turnos completos de agente, porque schema de ferramentas, histórico e prompts consomem contexto extra.
- O setup do OpenClaw valida um tool call real antes de trocar o modelo local padrão no fluxo gerenciado.
Calculadora pré-preenchida
Esta matriz é uma estimativa de planejamento (Q4_K_M, batch=1), não um mínimo oficial do fornecedor.
Calculadora de VRAM / RAM
Compare cenários com VRAM dedicada, memória unificada da Apple e offload CPU/RAM.
ID do Hugging Face / parâmetros customizados (opcional)
Se o repo for desconhecido, a calculadora usa seus valores como estimativa.
| Quant | Pesos | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 13.04 GiB | 8 GiB | 1.54 GiB | 22.58 GiB |
| INT8 / Q8_0 | 6.68 GiB | 8 GiB | 1.54 GiB | 16.22 GiB |
| Q6_K | 5.17 GiB | 8 GiB | 1.54 GiB | 14.71 GiB |
| Q5_K_M | 4.44 GiB | 8 GiB | 1.54 GiB | 13.98 GiB |
| Q4_K_M | 3.75 GiB | 8 GiB | 1.54 GiB | 13.29 GiB |
| Q3_K_M / Q3 | 2.85 GiB | 8 GiB | 1.54 GiB | 12.39 GiB |
| Q2_K / Q2 | 2.04 GiB | 8 GiB | 1.54 GiB | 11.58 GiB |
| Hardware | Memória | Resultado | tok/s est. |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Cabe | 170.3 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Cabe | 302.75 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | Cabe | 124.34 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | Cabe | 113.53 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Cabe | 162.19 |
| NVIDIA A100 80GB PCIe | 80 GiB | Cabe | 326.91 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Cabe | 57.64 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Cabe | 115.28 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Cabe | 306.46 |
Fórmulas e premissas
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
- Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
Tabela de ajuste por faixas de memória (estimativa LLMRAM)
Esta matriz é uma estimativa de planejamento (Q4_K_M, batch=1), não um mínimo oficial do fornecedor.
Contexto 32K
Faixas de GPU
| Perfil do modelo | Memória total estimada | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| Qwen 3.8 27B | 24 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe |
Faixas de memória unificada Mac
| Perfil do modelo | Memória total estimada | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✓ Cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| Qwen 3.8 27B | 24 GiB | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe |
Contexto 64K
Faixas de GPU
| Perfil do modelo | Memória total estimada | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ Não cabe | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| Qwen 3.8 27B | 32.24 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✓ Cabe |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe |
Faixas de memória unificada Mac
| Perfil do modelo | Memória total estimada | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| Qwen 3.8 27B | 32.24 GiB | ✕ Não cabe | ✕ Não cabe | ✓ Cabe | ✓ Cabe |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe |
FAQ
OpenClaw exige APIs cloud obrigatoriamente?
Não. A documentação do OpenClaw cobre setups local-first e rotas de modelos locais, incluindo Ollama e servidores locais gerenciados.
Por que o OpenClaw documenta tanto Ollama nativo quanto backends /v1 compatíveis com OpenAI?
No modo provider Ollama usa-se a API nativa do Ollama; para vLLM/LM Studio/proxies usa-se configuração provider compatível com OpenAI.
Posso assumir um mínimo fixo de memória com base na documentação do OpenClaw?
Não. O OpenClaw afirma que a memória depende de modelo, contexto, runtime e condição do host; pisos de receita não são garantia de fit.
Notas de verificação
- A seção de requisitos de runtime inclui apenas afirmações presentes na documentação oficial do framework listada nesta página.
- As tabelas de ajuste são estimativas de planejamento do LLMRAM derivadas das páginas de modelo atuais e das premissas da calculadora.
- Quando faltar um snippet específico de runtime nos links oficiais fornecidos (por exemplo, Hermes llama.cpp), esta página marca a lacuna explicitamente.