LLMRAM

Hermes Agent: 硬件要求、本地模型接入与上下文规划

基于官方资料的 Hermes Agent. Hermes Agent 是可自托管的 AI 代理框架,支持终端工具、提供商路由,以及包含 Ollama 在内的本地模型后端。

它是什么

Hermes Agent 在官方描述中是由 Nous Research 构建的自改进代理,支持长会话、工具调用与消息接口。

其 provider 系统同时支持托管 API 与自托管端点,因此你可以在不改写代理逻辑的情况下切换模型后端。

官方运行要求

  • 安装器托管运行时: 当前官方安装路径运行在 Python 3.14 上;安装器托管工具链包含 Python、Node.js、npm、ripgrep 与 FFmpeg。 (Hermes 安装文档)
  • 源码安装前置条件: POSIX 源码安装需要 Git、curl、tar 与 SHA-256 工具。 (Hermes 安装文档)
  • 本地 Ollama 指南基线: 指南表格给出 8 GB RAM 最低值(3B 模型)、32+ GB 推荐值(27B+)、至少 5 GB 空闲存储,并说明可选 NVIDIA GPU(8+ GB VRAM)可提升推理速度。 (Hermes 本地 Ollama 配置指南)

本地模型接入示例(官方文档)

Ollama

curl -fsSL https://ollama.com/install.sh | sh
ollama pull gemma4:31b
hermes setup
# provider: Custom Endpoint
# base URL: http://localhost:11434/v1

来源: Hermes 本地 Ollama 配置指南

Ollama

cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile

来自 Hermes Ollama 指南中的 context window 小节。

来源: Hermes 本地 Ollama 配置指南

vLLM

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:8000/v1
  api_key: your-key-or-leave-empty-for-local

Hermes 文档通过 Custom Endpoint 流程描述了包含 vLLM 在内的自托管端点接入。

来源: Hermes 提供商集成文档

LM Studio

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:1234/v1
  api_key: your-key-or-leave-empty-for-local

Hermes providers 页面列出了 LM Studio 与 custom endpoint 的配置模式。

来源: Hermes 提供商集成文档

llama.cpp

No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.

在你提供的 Hermes 官方链接中未看到显式的 llama.cpp provider 配置示例,因此这里明确标注为空缺而不杜撰命令。

来源: Hermes 提供商集成文档

为什么代理需要长上下文 + 工具调用模型

  • Hermes 本地 Ollama 指南明确写明:代理式工具工作流至少需要 64,000 token 上下文。
  • 同一指南还指出:不支持工具调用的模型可以聊天,但无法执行 Hermes 代理动作(如文件编辑、命令执行)。

预填计算器

下表是 LLMRAM 在 Q4_K_M + batch=1 下的规划估算,不是厂商官方最低要求。

显存 / 内存计算器

选择模型、量化、上下文长度、batch 和目标硬件。结果同时适用于 GPU 显存、Apple 统一内存与 CPU/RAM offload 规划。

自定义 Hugging Face 模型 id / 参数(可选)

若仓库 id 未匹配,计算器会使用你填写的参数并标记为估算值。

按量化查看内存
量化权重KVOverhead总计
FP16 / BF1650.29 GiB16 GiB1.78 GiB68.07 GiB
INT8 / Q8_025.77 GiB16 GiB1.78 GiB43.55 GiB
Q6_K19.96 GiB16 GiB1.78 GiB37.74 GiB
Q5_K_M17.13 GiB16 GiB1.78 GiB34.91 GiB
Q4_K_M14.46 GiB16 GiB1.78 GiB32.24 GiB
Q3_K_M / Q311 GiB16 GiB1.78 GiB28.78 GiB
Q2_K / Q27.86 GiB16 GiB1.78 GiB25.64 GiB
按硬件查看可运行性
硬件内存结论估算 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB不可运行n/a (不可运行)
NVIDIA GeForce RTX 5090 32GB32 GiB不可运行n/a (不可运行)
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB不可运行n/a (不可运行)
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB不可运行n/a (不可运行)
AMD Radeon RX 7900 XTX 24GB24 GiB不可运行n/a (不可运行)
NVIDIA A100 80GB PCIe80 GiB可运行84.75
Apple Silicon M3 Max (128GB unified memory)128 GiB可运行14.94
Apple Silicon M2 Ultra (192GB unified memory)192 GiB可运行29.89
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB可运行79.45

公式与假设

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

按内存档位的本地模型适配表(LLMRAM 估算)

下表是 LLMRAM 在 Q4_K_M + batch=1 下的规划估算,不是厂商官方最低要求。

32K 上下文

GPU 档位

模型档位估算总内存8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ 不适配✓ 可运行✓ 可运行✓ 可运行✓ 可运行✓ 可运行
Qwen 3.8 27B24 GiB✕ 不适配✕ 不适配✕ 不适配✓ 可运行✓ 可运行✓ 可运行
GLM 5.3 (Flash)195.84 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配

Mac 统一内存档位

模型档位估算总内存16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ 可运行✓ 可运行✓ 可运行✓ 可运行
Qwen 3.8 27B24 GiB✕ 不适配✓ 可运行✓ 可运行✓ 可运行
GLM 5.3 (Flash)195.84 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配

64K 上下文

GPU 档位

模型档位估算总内存8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ 不适配✕ 不适配✓ 可运行✓ 可运行✓ 可运行✓ 可运行
Qwen 3.8 27B32.24 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配✓ 可运行
GLM 5.3 (Flash)219.01 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配✕ 不适配

Mac 统一内存档位

模型档位估算总内存16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ 不适配✓ 可运行✓ 可运行✓ 可运行
Qwen 3.8 27B32.24 GiB✕ 不适配✕ 不适配✓ 可运行✓ 可运行
GLM 5.3 (Flash)219.01 GiB✕ 不适配✕ 不适配✕ 不适配✕ 不适配

常见问题

Hermes 可以在不填 API key 的情况下全本地运行吗?

可以。Hermes Ollama 指南提供了纯本地后端路径,并明确该路径无需 API key。

为什么长上下文与工具调用能力对代理框架很关键?

Hermes 文档说明其代理工具工作流需要更大的上下文窗口;不支持工具调用的模型在 Hermes 中仅能用于聊天。

Hermes 是否强制绑定某一个 provider?

不会。Hermes provider 文档描述了云端与自托管两类路线,可通过 provider/model 配置切换后端。

核验说明

  • 运行时要求仅收录本页列出的官方文档中明确出现的陈述。
  • 适配表是 LLMRAM 基于模型页与计算器假设生成的规划估算值。
  • 当官方链接里缺少某运行时的明确示例(例如 Hermes llama.cpp)时,本页会显式标注缺口而不补写推测命令。

使用的官方来源

站内链接