LLMRAM

Hermes Agent: requisitos de hardware, conexão local e planejamento de contexto

Guia oficial para Hermes Agent. Hermes Agent é um framework de agentes de IA auto-hospedável, com ferramentas de terminal, roteamento de provedores e opções de modelo local incluindo Ollama.

O que é

O Hermes Agent se descreve como um agente de IA autoevolutivo da Nous Research, com sessões longas, uso de ferramentas e interfaces de mensagens.

O sistema de providers suporta APIs hospedadas e endpoints self-hosted, permitindo trocar o backend de modelo sem reescrever a lógica do agente.

Requisitos oficiais de runtime

  • Runtime gerenciado pelo instalador: As instalações oficiais atuais rodam em Python 3.14; a toolchain gerenciada inclui Python, Node.js, npm, ripgrep e FFmpeg. (Documentação de instalação do Hermes)
  • Pré-requisitos para instalação por código-fonte: A instalação por source em POSIX requer Git, curl, tar e utilitários SHA-256. (Documentação de instalação do Hermes)
  • Base do guia Ollama local: A tabela do guia lista 8 GB RAM mínimo (modelos 3B), 32+ GB recomendado (27B+), 5 GB de espaço livre mínimo e GPU NVIDIA opcional com 8+ GB VRAM para inferência mais rápida. (Guia Hermes para Ollama local)

Snippets de conexão local (docs oficiais)

Ollama

curl -fsSL https://ollama.com/install.sh | sh
ollama pull gemma4:31b
hermes setup
# provider: Custom Endpoint
# base URL: http://localhost:11434/v1

Fonte: Guia Hermes para Ollama local

Ollama

cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile

Trecho da seção de context-window no guia Ollama do Hermes.

Fonte: Guia Hermes para Ollama local

vLLM

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:8000/v1
  api_key: your-key-or-leave-empty-for-local

A documentação do Hermes descreve endpoints self-hosted incluindo vLLM via fluxo de Custom Endpoint.

Fonte: Documentação de integrações de provedores do Hermes

LM Studio

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:1234/v1
  api_key: your-key-or-leave-empty-for-local

A página de providers do Hermes lista padrões de configuração para LM Studio e custom endpoint.

Fonte: Documentação de integrações de provedores do Hermes

llama.cpp

No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.

Não há snippet explícito de provider llama.cpp nos links oficiais do Hermes fornecidos; por isso a lacuna é declarada em vez de inventar comando.

Fonte: Documentação de integrações de provedores do Hermes

Por que contexto longo e tool-calling importam

  • O guia local de Ollama do Hermes afirma explicitamente que o trabalho agentic com ferramentas exige pelo menos 64.000 tokens de contexto.
  • O mesmo guia também diz que modelos sem suporte a tool-calling podem conversar, mas não executar ações de agente como edição de arquivos e comandos.

Calculadora pré-preenchida

Esta matriz é uma estimativa de planejamento (Q4_K_M, batch=1), não um mínimo oficial do fornecedor.

Calculadora de VRAM / RAM

Compare cenários com VRAM dedicada, memória unificada da Apple e offload CPU/RAM.

ID do Hugging Face / parâmetros customizados (opcional)

Se o repo for desconhecido, a calculadora usa seus valores como estimativa.

Memória por quantização
QuantPesosKVOverheadTotal
FP16 / BF1650.29 GiB16 GiB1.78 GiB68.07 GiB
INT8 / Q8_025.77 GiB16 GiB1.78 GiB43.55 GiB
Q6_K19.96 GiB16 GiB1.78 GiB37.74 GiB
Q5_K_M17.13 GiB16 GiB1.78 GiB34.91 GiB
Q4_K_M14.46 GiB16 GiB1.78 GiB32.24 GiB
Q3_K_M / Q311 GiB16 GiB1.78 GiB28.78 GiB
Q2_K / Q27.86 GiB16 GiB1.78 GiB25.64 GiB
Cabe / não cabe por hardware
HardwareMemóriaResultadotok/s est.
NVIDIA GeForce RTX 4090 24GB24 GiBNão caben/a (Não cabe)
NVIDIA GeForce RTX 5090 32GB32 GiBNão caben/a (Não cabe)
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBNão caben/a (Não cabe)
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBNão caben/a (Não cabe)
AMD Radeon RX 7900 XTX 24GB24 GiBNão caben/a (Não cabe)
NVIDIA A100 80GB PCIe80 GiBCabe84.75
Apple Silicon M3 Max (128GB unified memory)128 GiBCabe14.94
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCabe29.89
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCabe79.45

Fórmulas e premissas

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Tabela de ajuste por faixas de memória (estimativa LLMRAM)

Esta matriz é uma estimativa de planejamento (Q4_K_M, batch=1), não um mínimo oficial do fornecedor.

Contexto 32K

Faixas de GPU

Perfil do modeloMemória total estimada8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ Não cabe✓ Cabe✓ Cabe✓ Cabe✓ Cabe✓ Cabe
Qwen 3.8 27B24 GiB✕ Não cabe✕ Não cabe✕ Não cabe✓ Cabe✓ Cabe✓ Cabe
GLM 5.3 (Flash)195.84 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe

Faixas de memória unificada Mac

Perfil do modeloMemória total estimada16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ Cabe✓ Cabe✓ Cabe✓ Cabe
Qwen 3.8 27B24 GiB✕ Não cabe✓ Cabe✓ Cabe✓ Cabe
GLM 5.3 (Flash)195.84 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe

Contexto 64K

Faixas de GPU

Perfil do modeloMemória total estimada8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ Não cabe✕ Não cabe✓ Cabe✓ Cabe✓ Cabe✓ Cabe
Qwen 3.8 27B32.24 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✓ Cabe
GLM 5.3 (Flash)219.01 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe

Faixas de memória unificada Mac

Perfil do modeloMemória total estimada16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ Não cabe✓ Cabe✓ Cabe✓ Cabe
Qwen 3.8 27B32.24 GiB✕ Não cabe✕ Não cabe✓ Cabe✓ Cabe
GLM 5.3 (Flash)219.01 GiB✕ Não cabe✕ Não cabe✕ Não cabe✕ Não cabe

FAQ

O Hermes roda 100% local sem API key?

Sim. O guia Ollama do Hermes documenta um caminho local-only com Ollama e informa que esse caminho não exige API key.

Por que contexto longo e tool-calling são importantes?

O Hermes documenta que fluxos agentic com ferramentas precisam de janela de contexto grande e que modelos sem tool-calling ficam limitados ao chat.

O Hermes obriga um único provider?

Não. A documentação de providers descreve rotas cloud e self-hosted, com troca por configuração de provider/model.

Notas de verificação

  • A seção de requisitos de runtime inclui apenas afirmações presentes na documentação oficial do framework listada nesta página.
  • As tabelas de ajuste são estimativas de planejamento do LLMRAM derivadas das páginas de modelo atuais e das premissas da calculadora.
  • Quando faltar um snippet específico de runtime nos links oficiais fornecidos (por exemplo, Hermes llama.cpp), esta página marca a lacuna explicitamente.

Fontes oficiais usadas

Links internos