Hermes Agent: 硬件要求、本地模型接入与上下文规划
基于官方资料的 Hermes Agent. Hermes Agent 是可自托管的 AI 代理框架,支持终端工具、提供商路由,以及包含 Ollama 在内的本地模型后端。
它是什么
Hermes Agent 在官方描述中是由 Nous Research 构建的自改进代理,支持长会话、工具调用与消息接口。
其 provider 系统同时支持托管 API 与自托管端点,因此你可以在不改写代理逻辑的情况下切换模型后端。
官方运行要求
- 安装器托管运行时: 当前官方安装路径运行在 Python 3.14 上;安装器托管工具链包含 Python、Node.js、npm、ripgrep 与 FFmpeg。 (Hermes 安装文档)
- 源码安装前置条件: POSIX 源码安装需要 Git、curl、tar 与 SHA-256 工具。 (Hermes 安装文档)
- 本地 Ollama 指南基线: 指南表格给出 8 GB RAM 最低值(3B 模型)、32+ GB 推荐值(27B+)、至少 5 GB 空闲存储,并说明可选 NVIDIA GPU(8+ GB VRAM)可提升推理速度。 (Hermes 本地 Ollama 配置指南)
本地模型接入示例(官方文档)
Ollama
curl -fsSL https://ollama.com/install.sh | sh ollama pull gemma4:31b hermes setup # provider: Custom Endpoint # base URL: http://localhost:11434/v1
Ollama
cat > ~/.hermes/cache/scratch/Modelfile << 'EOF' FROM gemma4:31b PARAMETER num_ctx 64000 EOF ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile
来自 Hermes Ollama 指南中的 context window 小节。
vLLM
model: default: your-model-name provider: custom base_url: http://localhost:8000/v1 api_key: your-key-or-leave-empty-for-local
Hermes 文档通过 Custom Endpoint 流程描述了包含 vLLM 在内的自托管端点接入。
来源: Hermes 提供商集成文档
LM Studio
model: default: your-model-name provider: custom base_url: http://localhost:1234/v1 api_key: your-key-or-leave-empty-for-local
Hermes providers 页面列出了 LM Studio 与 custom endpoint 的配置模式。
来源: Hermes 提供商集成文档
llama.cpp
No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.
在你提供的 Hermes 官方链接中未看到显式的 llama.cpp provider 配置示例,因此这里明确标注为空缺而不杜撰命令。
来源: Hermes 提供商集成文档
为什么代理需要长上下文 + 工具调用模型
- Hermes 本地 Ollama 指南明确写明:代理式工具工作流至少需要 64,000 token 上下文。
- 同一指南还指出:不支持工具调用的模型可以聊天,但无法执行 Hermes 代理动作(如文件编辑、命令执行)。
预填计算器
下表是 LLMRAM 在 Q4_K_M + batch=1 下的规划估算,不是厂商官方最低要求。
显存 / 内存计算器
选择模型、量化、上下文长度、batch 和目标硬件。结果同时适用于 GPU 显存、Apple 统一内存与 CPU/RAM offload 规划。
自定义 Hugging Face 模型 id / 参数(可选)
若仓库 id 未匹配,计算器会使用你填写的参数并标记为估算值。
| 量化 | 权重 | KV | Overhead | 总计 |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 16 GiB | 1.78 GiB | 68.07 GiB |
| INT8 / Q8_0 | 25.77 GiB | 16 GiB | 1.78 GiB | 43.55 GiB |
| Q6_K | 19.96 GiB | 16 GiB | 1.78 GiB | 37.74 GiB |
| Q5_K_M | 17.13 GiB | 16 GiB | 1.78 GiB | 34.91 GiB |
| Q4_K_M | 14.46 GiB | 16 GiB | 1.78 GiB | 32.24 GiB |
| Q3_K_M / Q3 | 11 GiB | 16 GiB | 1.78 GiB | 28.78 GiB |
| Q2_K / Q2 | 7.86 GiB | 16 GiB | 1.78 GiB | 25.64 GiB |
| 硬件 | 内存 | 结论 | 估算 tok/s |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | 不可运行 | n/a (不可运行) |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | 不可运行 | n/a (不可运行) |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | 不可运行 | n/a (不可运行) |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | 不可运行 | n/a (不可运行) |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | 不可运行 | n/a (不可运行) |
| NVIDIA A100 80GB PCIe | 80 GiB | 可运行 | 84.75 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | 可运行 | 14.94 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | 可运行 | 29.89 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | 可运行 | 79.45 |
公式与假设
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
- Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
按内存档位的本地模型适配表(LLMRAM 估算)
下表是 LLMRAM 在 Q4_K_M + batch=1 下的规划估算,不是厂商官方最低要求。
32K 上下文
GPU 档位
| 模型档位 | 估算总内存 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| Qwen 3.8 27B | 24 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 |
Mac 统一内存档位
| 模型档位 | 估算总内存 | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| Qwen 3.8 27B | 24 GiB | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 |
64K 上下文
GPU 档位
| 模型档位 | 估算总内存 | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ 不适配 | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| Qwen 3.8 27B | 32.24 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✓ 可运行 |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 |
Mac 统一内存档位
| 模型档位 | 估算总内存 | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 | ✓ 可运行 |
| Qwen 3.8 27B | 32.24 GiB | ✕ 不适配 | ✕ 不适配 | ✓ 可运行 | ✓ 可运行 |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 | ✕ 不适配 |
常见问题
Hermes 可以在不填 API key 的情况下全本地运行吗?
可以。Hermes Ollama 指南提供了纯本地后端路径,并明确该路径无需 API key。
为什么长上下文与工具调用能力对代理框架很关键?
Hermes 文档说明其代理工具工作流需要更大的上下文窗口;不支持工具调用的模型在 Hermes 中仅能用于聊天。
Hermes 是否强制绑定某一个 provider?
不会。Hermes provider 文档描述了云端与自托管两类路线,可通过 provider/model 配置切换后端。
核验说明
- 运行时要求仅收录本页列出的官方文档中明确出现的陈述。
- 适配表是 LLMRAM 基于模型页与计算器假设生成的规划估算值。
- 当官方链接里缺少某运行时的明确示例(例如 Hermes llama.cpp)时,本页会显式标注缺口而不补写推测命令。