LLMRAM

OpenClaw: 硬件要求、本地模型接入与上下文规划

基于官方资料的 OpenClaw. OpenClaw 是开源的本地优先代理网关,支持云端与本地模型提供商,并提供 Ollama、LM Studio 及其他 OpenAI 兼容运行时接入路径。

它是什么

OpenClaw 将自己定义为“状态与凭据保留在设备本地”的助手栈,同时允许灵活切换模型与运行时后端。

其 Gateway 充当本地控制平面,用于会话、工具、渠道与模型路由。

官方运行要求

  • Node 运行时要求: OpenClaw 安装文档要求 Node 24.16+ 或 26.1+,并推荐 Node 26;若缺失 Node,安装器会自动配置。 (OpenClaw 安装文档)
  • 平台支持: OpenClaw 安装文档列出 macOS、Linux、Windows 为支持的平台。 (OpenClaw 安装文档)
  • 本地模型内存说明: OpenClaw 本地模型文档强调内存占用取决于模型权重、上下文、运行时与主机负载;其托管 llama.cpp 配方采用 64K 上下文,最小配方标注 8 GiB 主机内存下限。 (OpenClaw 本地模型文档)

本地模型接入示例(官方文档)

Ollama

openclaw onboard
# choose Ollama: Cloud + Local, Cloud only, or Local only
openclaw models list --provider ollama

来源: OpenClaw Ollama 配置文档

Ollama

models: {
  providers: {
    ollama: {
      api: 'ollama',
      baseUrl: 'http://host:11434',
    },
  },
}

OpenClaw Ollama 文档明确提醒:在 Ollama 原生 provider 模式下不要使用 /v1。

来源: OpenClaw Ollama 提供商文档

LM Studio

models: {
  providers: {
    lmstudio: {
      api: 'openai-responses',
      baseUrl: 'http://127.0.0.1:1234/v1',
      models: [{ id: 'my-local-model', contextWindow: 196608 }],
    },
  },
}

来源: OpenClaw 本地模型文档

vLLM

models: {
  providers: {
    local: {
      api: 'openai-completions',
      baseUrl: 'http://127.0.0.1:8000/v1',
      apiKey: 'sk-local',
    },
  },
}

OpenClaw 本地模型文档将 vLLM 列为 OpenAI 兼容本地代理之一。

来源: OpenClaw 本地模型文档

llama.cpp

# Managed local server path from OpenClaw local-model docs
openclaw onboard
# choose Managed local server (llama.cpp plugin)

来源: OpenClaw 本地模型文档

为什么代理需要长上下文 + 工具调用模型

  • OpenClaw 本地模型文档指出:即使模型能通过短提示测试,也可能因工具 schema、历史和系统提示占用上下文而在完整代理回合失败。
  • OpenClaw 的设置流程会在切换默认本地模型前执行一次真实工具调用校验。

预填计算器

下表是 LLMRAM 在 Q4_K_M + batch=1 下的规划估算,不是厂商官方最低要求。

显存 / 内存计算器

选择模型、量化、上下文长度、batch 和目标硬件。结果同时适用于 GPU 显存、Apple 统一内存与 CPU/RAM offload 规划。

自定义 Hugging Face 模型 id / 参数(可选)

若仓库 id 未匹配,计算器会使用你填写的参数并标记为估算值。

按量化查看内存
量化权重KVOverhead总计
FP16 / BF1613.04 GiB8 GiB1.54 GiB22.58 GiB
INT8 / Q8_06.68 GiB8 GiB1.54 GiB16.22 GiB
Q6_K5.17 GiB8 GiB1.54 GiB14.71 GiB
Q5_K_M4.44 GiB8 GiB1.54 GiB13.98 GiB
Q4_K_M3.75 GiB8 GiB1.54 GiB13.29 GiB
Q3_K_M / Q32.85 GiB8 GiB1.54 GiB12.39 GiB
Q2_K / Q22.04 GiB8 GiB1.54 GiB11.58 GiB
按硬件查看可运行性
硬件内存结论估算 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB可运行170.3
NVIDIA GeForce RTX 5090 32GB32 GiB可运行302.75
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB可运行124.34
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB可运行113.53
AMD Radeon RX 7900 XTX 24GB24 GiB可运行162.19
NVIDIA A100 80GB PCIe80 GiB可运行326.91
Apple Silicon M3 Max (128GB unified memory)128 GiB可运行57.64
Apple Silicon M2 Ultra (192GB unified memory)192 GiB可运行115.28
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB可运行306.46

公式与假设

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

按内存档位的本地模型适配表(LLMRAM 估算)

下表是 LLMRAM 在 Q4_K_M + batch=1 下的规划估算,不是厂商官方最低要求。

32K 上下文

GPU 档位

模型档位估算总内存8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ 不适配✓ 可运行✓ 可运行✓ 可运行✓ 可运行✓ 可运行
Qwen 3.8 27B24 GiB✕ 不适配✕ 不适配✕ 不适配✓ 可运行✓ 可运行✓ 可运行
GLM 5.3 (Flash)195.84 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配

Mac 统一内存档位

模型档位估算总内存16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ 可运行✓ 可运行✓ 可运行✓ 可运行
Qwen 3.8 27B24 GiB✕ 不适配✓ 可运行✓ 可运行✓ 可运行
GLM 5.3 (Flash)195.84 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配

64K 上下文

GPU 档位

模型档位估算总内存8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ 不适配✕ 不适配✓ 可运行✓ 可运行✓ 可运行✓ 可运行
Qwen 3.8 27B32.24 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配✓ 可运行
GLM 5.3 (Flash)219.01 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配

Mac 统一内存档位

模型档位估算总内存16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ 不适配✓ 可运行✓ 可运行✓ 可运行
Qwen 3.8 27B32.24 GiB✕ 不适配✕ 不适配✓ 可运行✓ 可运行
GLM 5.3 (Flash)219.01 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配

常见问题

OpenClaw 必须依赖云端 API 吗?

不需要。OpenClaw 文档覆盖了本地优先模式,以及包括 Ollama 和托管本地服务在内的本地模型路线。

为什么 OpenClaw 同时提供 Ollama 原生接口与 OpenAI 兼容 /v1 接口?

Ollama provider 模式走 Ollama 原生 API;而 vLLM、LM Studio 等代理后端通过 OpenAI 兼容 provider 模式配置。

能否从 OpenClaw 文档得到一个固定内存最低值?

不能。OpenClaw 明确说明内存需求依赖模型、上下文、运行时和主机状态;配方下限并不等同于通用可运行保证。

核验说明

  • 运行时要求仅收录本页列出的官方文档中明确出现的陈述。
  • 适配表是 LLMRAM 基于模型页与计算器假设生成的规划估算值。
  • 当官方链接里缺少某运行时的明确示例(例如 Hermes llama.cpp)时,本页会显式标注缺口而不补写推测命令。

使用的官方来源

站内链接