Hermes Agent: requisitos de hardware, conexão local e planejamento de contexto
Guia oficial para Hermes Agent. Hermes Agent é um framework de agentes de IA auto-hospedável, com ferramentas de terminal, roteamento de provedores e opções de modelo local incluindo Ollama.
O que é
O Hermes Agent se descreve como um agente de IA autoevolutivo da Nous Research, com sessões longas, uso de ferramentas e interfaces de mensagens.
O sistema de providers suporta APIs hospedadas e endpoints self-hosted, permitindo trocar o backend de modelo sem reescrever a lógica do agente.
Requisitos oficiais de runtime
- Runtime gerenciado pelo instalador: As instalações oficiais atuais rodam em Python 3.14; a toolchain gerenciada inclui Python, Node.js, npm, ripgrep e FFmpeg. (Documentação de instalação do Hermes)
- Pré-requisitos para instalação por código-fonte: A instalação por source em POSIX requer Git, curl, tar e utilitários SHA-256. (Documentação de instalação do Hermes)
- Base do guia Ollama local: A tabela do guia lista 8 GB RAM mínimo (modelos 3B), 32+ GB recomendado (27B+), 5 GB de espaço livre mínimo e GPU NVIDIA opcional com 8+ GB VRAM para inferência mais rápida. (Guia Hermes para Ollama local)
Snippets de conexão local (docs oficiais)
Ollama
curl -fsSL https://ollama.com/install.sh | sh ollama pull gemma4:31b hermes setup # provider: Custom Endpoint # base URL: http://localhost:11434/v1
Ollama
cat > ~/.hermes/cache/scratch/Modelfile << 'EOF' FROM gemma4:31b PARAMETER num_ctx 64000 EOF ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile
Trecho da seção de context-window no guia Ollama do Hermes.
vLLM
model: default: your-model-name provider: custom base_url: http://localhost:8000/v1 api_key: your-key-or-leave-empty-for-local
A documentação do Hermes descreve endpoints self-hosted incluindo vLLM via fluxo de Custom Endpoint.
LM Studio
model: default: your-model-name provider: custom base_url: http://localhost:1234/v1 api_key: your-key-or-leave-empty-for-local
A página de providers do Hermes lista padrões de configuração para LM Studio e custom endpoint.
llama.cpp
No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.
Não há snippet explícito de provider llama.cpp nos links oficiais do Hermes fornecidos; por isso a lacuna é declarada em vez de inventar comando.
Por que contexto longo e tool-calling importam
- O guia local de Ollama do Hermes afirma explicitamente que o trabalho agentic com ferramentas exige pelo menos 64.000 tokens de contexto.
- O mesmo guia também diz que modelos sem suporte a tool-calling podem conversar, mas não executar ações de agente como edição de arquivos e comandos.
Calculadora pré-preenchida
Esta matriz é uma estimativa de planejamento (Q4_K_M, batch=1), não um mínimo oficial do fornecedor.
Calculadora de VRAM / RAM
Compare cenários com VRAM dedicada, memória unificada da Apple e offload CPU/RAM.
ID do Hugging Face / parâmetros customizados (opcional)
Se o repo for desconhecido, a calculadora usa seus valores como estimativa.
| Quant | Pesos | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 16 GiB | 1.78 GiB | 68.07 GiB |
| INT8 / Q8_0 | 25.77 GiB | 16 GiB | 1.78 GiB | 43.55 GiB |
| Q6_K | 19.96 GiB | 16 GiB | 1.78 GiB | 37.74 GiB |
| Q5_K_M | 17.13 GiB | 16 GiB | 1.78 GiB | 34.91 GiB |
| Q4_K_M | 14.46 GiB | 16 GiB | 1.78 GiB | 32.24 GiB |
| Q3_K_M / Q3 | 11 GiB | 16 GiB | 1.78 GiB | 28.78 GiB |
| Q2_K / Q2 | 7.86 GiB | 16 GiB | 1.78 GiB | 25.64 GiB |
| Hardware | Memória | Resultado | tok/s est. |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Não cabe | n/a (Não cabe) |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Não cabe | n/a (Não cabe) |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | Não cabe | n/a (Não cabe) |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | Não cabe | n/a (Não cabe) |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Não cabe | n/a (Não cabe) |
| NVIDIA A100 80GB PCIe | 80 GiB | Cabe | 84.75 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Cabe | 14.94 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Cabe | 29.89 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Cabe | 79.45 |
Fórmulas e premissas
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
- Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
Tabela de ajuste por faixas de memória (estimativa LLMRAM)
Esta matriz é uma estimativa de planejamento (Q4_K_M, batch=1), não um mínimo oficial do fornecedor.
Contexto 32K
Faixas de GPU
| Perfil do modelo | Memória total estimada | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| Qwen 3.8 27B | 24 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe |
Faixas de memória unificada Mac
| Perfil do modelo | Memória total estimada | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✓ Cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| Qwen 3.8 27B | 24 GiB | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe |
Contexto 64K
Faixas de GPU
| Perfil do modelo | Memória total estimada | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ Não cabe | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| Qwen 3.8 27B | 32.24 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✓ Cabe |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe |
Faixas de memória unificada Mac
| Perfil do modelo | Memória total estimada | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ Não cabe | ✓ Cabe | ✓ Cabe | ✓ Cabe |
| Qwen 3.8 27B | 32.24 GiB | ✕ Não cabe | ✕ Não cabe | ✓ Cabe | ✓ Cabe |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe | ✕ Não cabe |
FAQ
O Hermes roda 100% local sem API key?
Sim. O guia Ollama do Hermes documenta um caminho local-only com Ollama e informa que esse caminho não exige API key.
Por que contexto longo e tool-calling são importantes?
O Hermes documenta que fluxos agentic com ferramentas precisam de janela de contexto grande e que modelos sem tool-calling ficam limitados ao chat.
O Hermes obriga um único provider?
Não. A documentação de providers descreve rotas cloud e self-hosted, com troca por configuração de provider/model.
Notas de verificação
- A seção de requisitos de runtime inclui apenas afirmações presentes na documentação oficial do framework listada nesta página.
- As tabelas de ajuste são estimativas de planejamento do LLMRAM derivadas das páginas de modelo atuais e das premissas da calculadora.
- Quando faltar um snippet específico de runtime nos links oficiais fornecidos (por exemplo, Hermes llama.cpp), esta página marca a lacuna explicitamente.