LLMRAM

Hermes Agent: requisitos de hardware, conexión local y planificación de contexto

Guía oficial para Hermes Agent. Hermes Agent es un framework de agentes IA autoalojable con herramientas de terminal, ruteo de proveedores y rutas de modelo local, incluida Ollama.

Qué es

Hermes Agent se describe como un agente IA auto-mejorable de Nous Research, con sesiones largas, uso de herramientas e interfaces de mensajería.

Su sistema de providers soporta APIs alojadas y endpoints autoalojados, por lo que puedes cambiar el backend de modelo sin reescribir la lógica del agente.

Requisitos oficiales de runtime

  • Runtime gestionado por el instalador: Las instalaciones oficiales actuales se ejecutan sobre Python 3.14; la toolchain gestionada incluye Python, Node.js, npm, ripgrep y FFmpeg. (Documentación de instalación de Hermes)
  • Requisitos previos para instalación desde fuente: La instalación desde fuente en POSIX requiere Git, curl, tar y utilidades SHA-256. (Documentación de instalación de Hermes)
  • Base del tutorial local de Ollama: La tabla del tutorial lista 8 GB RAM mínimo (modelos 3B), 32+ GB recomendado (27B+), 5 GB de almacenamiento libre mínimo y GPU NVIDIA opcional con 8+ GB VRAM para inferencia más rápida. (Guía local de Ollama para Hermes)

Snippets de conexión local (docs oficiales)

Ollama

curl -fsSL https://ollama.com/install.sh | sh
ollama pull gemma4:31b
hermes setup
# provider: Custom Endpoint
# base URL: http://localhost:11434/v1

Fuente: Guía local de Ollama para Hermes

Ollama

cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile

Tomado de la sección de ventana de contexto en la guía de Ollama para Hermes.

Fuente: Guía local de Ollama para Hermes

vLLM

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:8000/v1
  api_key: your-key-or-leave-empty-for-local

La documentación de Hermes describe endpoints autoalojados, incluido vLLM, mediante el flujo de Custom Endpoint.

Fuente: Documentación de proveedores de Hermes

LM Studio

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:1234/v1
  api_key: your-key-or-leave-empty-for-local

La página de providers de Hermes lista patrones de configuración para LM Studio y custom endpoint.

Fuente: Documentación de proveedores de Hermes

llama.cpp

No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.

En los enlaces oficiales proporcionados de Hermes no aparece un snippet explícito para provider llama.cpp; por eso se marca la brecha sin inventar comandos.

Fuente: Documentación de proveedores de Hermes

Por qué importan contexto largo y tool-calling

  • La guía local de Hermes con Ollama indica explícitamente que se requiere un contexto de al menos 64,000 tokens para trabajo agéntico con herramientas.
  • La misma guía también dice que los modelos sin tool-calling pueden chatear, pero no ejecutar acciones de agente como edición de archivos o comandos.

Calculadora precargada

Esta matriz es una estimación de planificación (Q4_K_M, batch=1), no un mínimo oficial del proveedor.

Calculadora VRAM / RAM

Compara escenarios de VRAM dedicada, memoria unificada de Apple y offload CPU/RAM.

ID de Hugging Face / parámetros personalizados (opcional)

Si el repo no es conocido, se usarán tus valores como estimación.

Memoria por cuantización
QuantPesosKVOverheadTotal
FP16 / BF1650.29 GiB16 GiB1.78 GiB68.07 GiB
INT8 / Q8_025.77 GiB16 GiB1.78 GiB43.55 GiB
Q6_K19.96 GiB16 GiB1.78 GiB37.74 GiB
Q5_K_M17.13 GiB16 GiB1.78 GiB34.91 GiB
Q4_K_M14.46 GiB16 GiB1.78 GiB32.24 GiB
Q3_K_M / Q311 GiB16 GiB1.78 GiB28.78 GiB
Q2_K / Q27.86 GiB16 GiB1.78 GiB25.64 GiB
Compatible / no compatible por hardware
HardwareMemoriaVeredictotok/s est.
NVIDIA GeForce RTX 4090 24GB24 GiBNo compatiblen/a (No compatible)
NVIDIA GeForce RTX 5090 32GB32 GiBNo compatiblen/a (No compatible)
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBNo compatiblen/a (No compatible)
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBNo compatiblen/a (No compatible)
AMD Radeon RX 7900 XTX 24GB24 GiBNo compatiblen/a (No compatible)
NVIDIA A100 80GB PCIe80 GiBCompatible84.75
Apple Silicon M3 Max (128GB unified memory)128 GiBCompatible14.94
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCompatible29.89
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCompatible79.45

Fórmulas y supuestos

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Tabla de ajuste por niveles de memoria (estimación LLMRAM)

Esta matriz es una estimación de planificación (Q4_K_M, batch=1), no un mínimo oficial del proveedor.

Contexto 32K

Niveles GPU

Perfil de modeloMemoria total estimada8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ No ajusta✓ Ajusta✓ Ajusta✓ Ajusta✓ Ajusta✓ Ajusta
Qwen 3.8 27B24 GiB✕ No ajusta✕ No ajusta✕ No ajusta✓ Ajusta✓ Ajusta✓ Ajusta
GLM 5.3 (Flash)195.84 GiB✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta

Niveles de memoria unificada Mac

Perfil de modeloMemoria total estimada16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ Ajusta✓ Ajusta✓ Ajusta✓ Ajusta
Qwen 3.8 27B24 GiB✕ No ajusta✓ Ajusta✓ Ajusta✓ Ajusta
GLM 5.3 (Flash)195.84 GiB✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta

Contexto 64K

Niveles GPU

Perfil de modeloMemoria total estimada8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ No ajusta✕ No ajusta✓ Ajusta✓ Ajusta✓ Ajusta✓ Ajusta
Qwen 3.8 27B32.24 GiB✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta✓ Ajusta
GLM 5.3 (Flash)219.01 GiB✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta

Niveles de memoria unificada Mac

Perfil de modeloMemoria total estimada16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ No ajusta✓ Ajusta✓ Ajusta✓ Ajusta
Qwen 3.8 27B32.24 GiB✕ No ajusta✕ No ajusta✓ Ajusta✓ Ajusta
GLM 5.3 (Flash)219.01 GiB✕ No ajusta✕ No ajusta✕ No ajusta✕ No ajusta

FAQ

¿Hermes puede ejecutarse totalmente en local sin API key?

Sí. La guía de Ollama para Hermes documenta una ruta completamente local y aclara que no requiere API key.

¿Por qué importan contexto largo y tool-calling en agentes?

Hermes documenta que sus flujos de herramientas agénticas necesitan una ventana de contexto grande y que, sin tool-calling, los modelos quedan en modo chat.

¿Hermes obliga a usar un único provider?

No. Las docs de providers describen rutas cloud y self-hosted, con cambio mediante configuración provider/model.

Notas de verificación

  • La sección de requisitos runtime solo incluye afirmaciones presentes en la documentación oficial del framework listada en esta página.
  • Las tablas de ajuste son estimaciones de planificación de LLMRAM derivadas de las páginas de modelo actuales y de los supuestos de la calculadora.
  • Cuando falta un snippet específico de runtime en los enlaces oficiales proporcionados (por ejemplo, Hermes llama.cpp), esta página marca explícitamente esa brecha.

Fuentes oficiales usadas

Enlaces internos