OpenClaw: 硬件要求、本地模型接入与上下文规划
基于官方资料的 OpenClaw. OpenClaw 是开源的本地优先代理网关,支持云端与本地模型提供商,并提供 Ollama、LM Studio 及其他 OpenAI 兼容运行时接入路径。
它是什么
OpenClaw 将自己定义为“状态与凭据保留在设备本地”的助手栈,同时允许灵活切换模型与运行时后端。
其 Gateway 充当本地控制平面,用于会话、工具、渠道与模型路由。
官方运行要求
- Node 运行时要求: OpenClaw 安装文档要求 Node 24.16+ 或 26.1+,并推荐 Node 26;若缺失 Node,安装器会自动配置。 (OpenClaw 安装文档)
- 平台支持: OpenClaw 安装文档列出 macOS、Linux、Windows 为支持的平台。 (OpenClaw 安装文档)
- 本地模型内存说明: OpenClaw 本地模型文档强调内存占用取决于模型权重、上下文、运行时与主机负载;其托管 llama.cpp 配方采用 64K 上下文,最小配方标注 8 GiB 主机内存下限。 (OpenClaw 本地模型文档)
本地模型接入示例(官方文档)
Ollama
openclaw onboard # choose Ollama: Cloud + Local, Cloud only, or Local only openclaw models list --provider ollama
Ollama
models: {
providers: {
ollama: {
api: 'ollama',
baseUrl: 'http://host:11434',
},
},
}OpenClaw Ollama 文档明确提醒:在 Ollama 原生 provider 模式下不要使用 /v1。
LM Studio
models: {
providers: {
lmstudio: {
api: 'openai-responses',
baseUrl: 'http://127.0.0.1:1234/v1',
models: [{ id: 'my-local-model', contextWindow: 196608 }],
},
},
}来源: OpenClaw 本地模型文档
vLLM
models: {
providers: {
local: {
api: 'openai-completions',
baseUrl: 'http://127.0.0.1:8000/v1',
apiKey: 'sk-local',
},
},
}OpenClaw 本地模型文档将 vLLM 列为 OpenAI 兼容本地代理之一。
来源: OpenClaw 本地模型文档
llama.cpp
# Managed local server path from OpenClaw local-model docs openclaw onboard # choose Managed local server (llama.cpp plugin)
来源: OpenClaw 本地模型文档
为什么代理需要长上下文 + 工具调用模型
- OpenClaw 本地模型文档指出:即使模型能通过短提示测试,也可能因工具 schema、历史和系统提示占用上下文而在完整代理回合失败。
- OpenClaw 的设置流程会在切换默认本地模型前执行一次真实工具调用校验。
预填计算器
下表是 LLMRAM 在 Q4_K_M + batch=1 下的规划估算,不是厂商官方最低要求。
显存 / 内存计算器
选择模型、量化、上下文长度、batch 和目标硬件。结果同时适用于 GPU 显存、Apple 统一内存与 CPU/RAM offload 规划。
自定义 Hugging Face 模型 id / 参数(可选)
若仓库 id 未匹配,计算器会使用你填写的参数并标记为估算值。
| 量化 | 权重 | KV | Overhead | 总计 |
|---|---|---|---|---|
| FP16 / BF16 | 13.04 GiB | 8 GiB | 1.54 GiB | 22.58 GiB |
| INT8 / Q8_0 | 6.68 GiB | 8 GiB | 1.54 GiB | 16.22 GiB |
| Q6_K | 5.17 GiB | 8 GiB | 1.54 GiB | 14.71 GiB |
| Q5_K_M | 4.44 GiB | 8 GiB | 1.54 GiB | 13.98 GiB |
| Q4_K_M | 3.75 GiB | 8 GiB | 1.54 GiB | 13.29 GiB |
| Q3_K_M / Q3 | 2.85 GiB | 8 GiB | 1.54 GiB | 12.39 GiB |
| Q2_K / Q2 | 2.04 GiB | 8 GiB | 1.54 GiB | 11.58 GiB |
| 硬件 | 内存 | 结论 | 估算 tok/s |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | 可运行 | 170.3 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | 可运行 | 302.75 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | 可运行 | 124.34 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | 可运行 | 113.53 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | 可运行 | 162.19 |
| NVIDIA A100 80GB PCIe | 80 GiB | 可运行 | 326.91 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | 可运行 | 57.64 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | 可运行 | 115.28 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | 可运行 | 306.46 |
公式与假设
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
- Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
按内存档位的本地模型适配表(LLMRAM 估算)
下表是 LLMRAM 在 Q4_K_M + batch=1 下的规划估算,不是厂商官方最低要求。
32K 上下文
GPU 档位
| 模型档位 | 估算总内存 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| Qwen 3.8 27B | 24 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 |
Mac 统一内存档位
| 模型档位 | 估算总内存 | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| Qwen 3.8 27B | 24 GiB | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 |
64K 上下文
GPU 档位
| 模型档位 | 估算总内存 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ 不适配 | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| Qwen 3.8 27B | 32.24 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✓ 可运行 |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 |
Mac 统一内存档位
| 模型档位 | 估算总内存 | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| Qwen 3.8 27B | 32.24 GiB | ✕ 不适配 | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 |
常见问题
OpenClaw 必须依赖云端 API 吗?
不需要。OpenClaw 文档覆盖了本地优先模式,以及包括 Ollama 和托管本地服务在内的本地模型路线。
为什么 OpenClaw 同时提供 Ollama 原生接口与 OpenAI 兼容 /v1 接口?
Ollama provider 模式走 Ollama 原生 API;而 vLLM、LM Studio 等代理后端通过 OpenAI 兼容 provider 模式配置。
能否从 OpenClaw 文档得到一个固定内存最低值?
不能。OpenClaw 明确说明内存需求依赖模型、上下文、运行时和主机状态;配方下限并不等同于通用可运行保证。
核验说明
- 运行时要求仅收录本页列出的官方文档中明确出现的陈述。
- 适配表是 LLMRAM 基于模型页与计算器假设生成的规划估算值。
- 当官方链接里缺少某运行时的明确示例(例如 Hermes llama.cpp)时,本页会显式标注缺口而不补写推测命令。