Hermes Agent: requisitos de hardware, conexión local y planificación de contexto
Guía oficial para Hermes Agent. Hermes Agent es un framework de agentes IA autoalojable con herramientas de terminal, ruteo de proveedores y rutas de modelo local, incluida Ollama.
Qué es
Hermes Agent se describe como un agente IA auto-mejorable de Nous Research, con sesiones largas, uso de herramientas e interfaces de mensajería.
Su sistema de providers soporta APIs alojadas y endpoints autoalojados, por lo que puedes cambiar el backend de modelo sin reescribir la lógica del agente.
Requisitos oficiales de runtime
- Runtime gestionado por el instalador: Las instalaciones oficiales actuales se ejecutan sobre Python 3.14; la toolchain gestionada incluye Python, Node.js, npm, ripgrep y FFmpeg. (Documentación de instalación de Hermes)
- Requisitos previos para instalación desde fuente: La instalación desde fuente en POSIX requiere Git, curl, tar y utilidades SHA-256. (Documentación de instalación de Hermes)
- Base del tutorial local de Ollama: La tabla del tutorial lista 8 GB RAM mínimo (modelos 3B), 32+ GB recomendado (27B+), 5 GB de almacenamiento libre mínimo y GPU NVIDIA opcional con 8+ GB VRAM para inferencia más rápida. (Guía local de Ollama para Hermes)
Snippets de conexión local (docs oficiales)
Ollama
curl -fsSL https://ollama.com/install.sh | sh ollama pull gemma4:31b hermes setup # provider: Custom Endpoint # base URL: http://localhost:11434/v1
Fuente: Guía local de Ollama para Hermes
Ollama
cat > ~/.hermes/cache/scratch/Modelfile << 'EOF' FROM gemma4:31b PARAMETER num_ctx 64000 EOF ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile
Tomado de la sección de ventana de contexto en la guía de Ollama para Hermes.
Fuente: Guía local de Ollama para Hermes
vLLM
model: default: your-model-name provider: custom base_url: http://localhost:8000/v1 api_key: your-key-or-leave-empty-for-local
La documentación de Hermes describe endpoints autoalojados, incluido vLLM, mediante el flujo de Custom Endpoint.
LM Studio
model: default: your-model-name provider: custom base_url: http://localhost:1234/v1 api_key: your-key-or-leave-empty-for-local
La página de providers de Hermes lista patrones de configuración para LM Studio y custom endpoint.
llama.cpp
No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.
En los enlaces oficiales proporcionados de Hermes no aparece un snippet explícito para provider llama.cpp; por eso se marca la brecha sin inventar comandos.
Por qué importan contexto largo y tool-calling
- La guía local de Hermes con Ollama indica explícitamente que se requiere un contexto de al menos 64,000 tokens para trabajo agéntico con herramientas.
- La misma guía también dice que los modelos sin tool-calling pueden chatear, pero no ejecutar acciones de agente como edición de archivos o comandos.
Calculadora precargada
Esta matriz es una estimación de planificación (Q4_K_M, batch=1), no un mínimo oficial del proveedor.
Calculadora VRAM / RAM
Compara escenarios de VRAM dedicada, memoria unificada de Apple y offload CPU/RAM.
ID de Hugging Face / parámetros personalizados (opcional)
Si el repo no es conocido, se usarán tus valores como estimación.
| Quant | Pesos | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 16 GiB | 1.78 GiB | 68.07 GiB |
| INT8 / Q8_0 | 25.77 GiB | 16 GiB | 1.78 GiB | 43.55 GiB |
| Q6_K | 19.96 GiB | 16 GiB | 1.78 GiB | 37.74 GiB |
| Q5_K_M | 17.13 GiB | 16 GiB | 1.78 GiB | 34.91 GiB |
| Q4_K_M | 14.46 GiB | 16 GiB | 1.78 GiB | 32.24 GiB |
| Q3_K_M / Q3 | 11 GiB | 16 GiB | 1.78 GiB | 28.78 GiB |
| Q2_K / Q2 | 7.86 GiB | 16 GiB | 1.78 GiB | 25.64 GiB |
| Hardware | Memoria | Veredicto | tok/s est. |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | No compatible | n/a (No compatible) |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | No compatible | n/a (No compatible) |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | No compatible | n/a (No compatible) |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | No compatible | n/a (No compatible) |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | No compatible | n/a (No compatible) |
| NVIDIA A100 80GB PCIe | 80 GiB | Compatible | 84.75 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Compatible | 14.94 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Compatible | 29.89 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Compatible | 79.45 |
Fórmulas y supuestos
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
- Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
Tabla de ajuste por niveles de memoria (estimación LLMRAM)
Esta matriz es una estimación de planificación (Q4_K_M, batch=1), no un mínimo oficial del proveedor.
Contexto 32K
Niveles GPU
| Perfil de modelo | Memoria total estimada | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✕ No ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta |
| Qwen 3.8 27B | 24 GiB | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta |
Niveles de memoria unificada Mac
| Perfil de modelo | Memoria total estimada | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta |
| Qwen 3.8 27B | 24 GiB | ✕ No ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta |
Contexto 64K
Niveles GPU
| Perfil de modelo | Memoria total estimada | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ No ajusta | ✕ No ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta |
| Qwen 3.8 27B | 32.24 GiB | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✓ Ajusta |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta |
Niveles de memoria unificada Mac
| Perfil de modelo | Memoria total estimada | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ No ajusta | ✓ Ajusta | ✓ Ajusta | ✓ Ajusta |
| Qwen 3.8 27B | 32.24 GiB | ✕ No ajusta | ✕ No ajusta | ✓ Ajusta | ✓ Ajusta |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta | ✕ No ajusta |
FAQ
¿Hermes puede ejecutarse totalmente en local sin API key?
Sí. La guía de Ollama para Hermes documenta una ruta completamente local y aclara que no requiere API key.
¿Por qué importan contexto largo y tool-calling en agentes?
Hermes documenta que sus flujos de herramientas agénticas necesitan una ventana de contexto grande y que, sin tool-calling, los modelos quedan en modo chat.
¿Hermes obliga a usar un único provider?
No. Las docs de providers describen rutas cloud y self-hosted, con cambio mediante configuración provider/model.
Notas de verificación
- La sección de requisitos runtime solo incluye afirmaciones presentes en la documentación oficial del framework listada en esta página.
- Las tablas de ajuste son estimaciones de planificación de LLMRAM derivadas de las páginas de modelo actuales y de los supuestos de la calculadora.
- Cuando falta un snippet específico de runtime en los enlaces oficiales proporcionados (por ejemplo, Hermes llama.cpp), esta página marca explícitamente esa brecha.