Hermes Agent: требования к железу, локальное подключение и планирование контекста
Официальный гайд для Hermes Agent. Hermes Agent — self-hosted фреймворк AI-агентов с терминальными инструментами, маршрутизацией провайдеров и локальными путями моделей, включая Ollama.
Что это
Hermes Agent описывается как самоулучшающийся AI-агент от Nous Research с долгими сессиями, использованием инструментов и интерфейсами сообщений.
Система providers поддерживает и облачные API, и self-hosted endpoints, поэтому можно менять модельный backend без переписывания логики агента.
Официальные требования к рантайму
- Runtime под управлением установщика: Текущие официальные установки работают на Python 3.14; управляемая toolchain включает Python, Node.js, npm, ripgrep и FFmpeg. (Документация по установке Hermes)
- Предусловия для установки из исходников: Для POSIX source-установки требуются Git, curl, tar и утилиты SHA-256. (Документация по установке Hermes)
- Базовые значения из локального гайда Ollama: Таблица в гайде указывает минимум 8 GB RAM (модели 3B), рекомендацию 32+ GB (27B+), минимум 5 GB свободного места и опциональный NVIDIA GPU с 8+ GB VRAM для ускорения инференса. (Гайд Hermes по локальному Ollama)
Сниппеты локального подключения (официальные docs)
Ollama
curl -fsSL https://ollama.com/install.sh | sh ollama pull gemma4:31b hermes setup # provider: Custom Endpoint # base URL: http://localhost:11434/v1
Источник: Гайд Hermes по локальному Ollama
Ollama
cat > ~/.hermes/cache/scratch/Modelfile << 'EOF' FROM gemma4:31b PARAMETER num_ctx 64000 EOF ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile
Из раздела context-window в гайде Hermes Ollama.
Источник: Гайд Hermes по локальному Ollama
vLLM
model: default: your-model-name provider: custom base_url: http://localhost:8000/v1 api_key: your-key-or-leave-empty-for-local
Документация Hermes описывает self-hosted endpoints, включая vLLM, через поток Custom Endpoint.
LM Studio
model: default: your-model-name provider: custom base_url: http://localhost:1234/v1 api_key: your-key-or-leave-empty-for-local
На странице providers Hermes перечислены шаблоны конфигурации для LM Studio и custom endpoint.
llama.cpp
No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.
В предоставленных официальных ссылках Hermes нет явного snippet для llama.cpp provider; поэтому пробел отмечен явно без выдуманных команд.
Почему важны длинный контекст и tool-calling
- В локальном гайде Hermes для Ollama прямо сказано, что для agentic-работы с инструментами нужен контекст не менее 64 000 токенов.
- Там же указано, что модели без tool-calling могут только чатиться и не выполняют агентные действия Hermes (редактирование файлов, команды).
Предзаполненный калькулятор
Матрица ниже — оценка планирования (Q4_K_M, batch=1), а не официальный минимум вендора.
Калькулятор VRAM / RAM
Сравнивайте сценарии для дискретной VRAM, unified memory Apple и CPU/RAM offload.
Пользовательский Hugging Face id / параметры (опционально)
Если repo id неизвестен, расчёт будет выполнен по вашим значениям как по оценке.
| Квант | Весы | KV | Overhead | Итого |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 16 GiB | 1.78 GiB | 68.07 GiB |
| INT8 / Q8_0 | 25.77 GiB | 16 GiB | 1.78 GiB | 43.55 GiB |
| Q6_K | 19.96 GiB | 16 GiB | 1.78 GiB | 37.74 GiB |
| Q5_K_M | 17.13 GiB | 16 GiB | 1.78 GiB | 34.91 GiB |
| Q4_K_M | 14.46 GiB | 16 GiB | 1.78 GiB | 32.24 GiB |
| Q3_K_M / Q3 | 11 GiB | 16 GiB | 1.78 GiB | 28.78 GiB |
| Q2_K / Q2 | 7.86 GiB | 16 GiB | 1.78 GiB | 25.64 GiB |
| Железо | Память | Вердикт | tok/s (оценка) |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Не подходит | n/a (Не подходит) |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Не подходит | n/a (Не подходит) |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | Не подходит | n/a (Не подходит) |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | Не подходит | n/a (Не подходит) |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Не подходит | n/a (Не подходит) |
| NVIDIA A100 80GB PCIe | 80 GiB | Подходит | 84.75 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Подходит | 14.94 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Подходит | 29.89 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Подходит | 79.45 |
Формулы и допущения
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
- Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
Таблица fit по классам памяти (оценка LLMRAM)
Матрица ниже — оценка планирования (Q4_K_M, batch=1), а не официальный минимум вендора.
Контекст 32K
Классы GPU
| Профиль модели | Оценка total memory | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✕ Не подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит |
| Qwen 3.8 27B | 24 GiB | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит |
Классы unified memory Mac
| Профиль модели | Оценка total memory | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✓ Подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит |
| Qwen 3.8 27B | 24 GiB | ✕ Не подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит |
Контекст 64K
Классы GPU
| Профиль модели | Оценка total memory | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ Не подходит | ✕ Не подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит |
| Qwen 3.8 27B | 32.24 GiB | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✓ Подходит |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит |
Классы unified memory Mac
| Профиль модели | Оценка total memory | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ Не подходит | ✓ Подходит | ✓ Подходит | ✓ Подходит |
| Qwen 3.8 27B | 32.24 GiB | ✕ Не подходит | ✕ Не подходит | ✓ Подходит | ✓ Подходит |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит | ✕ Не подходит |
FAQ
Можно ли запускать Hermes полностью локально без API key?
Да. В гайде Hermes Ollama описан локальный-only путь на Ollama и прямо сказано, что API key для него не нужен.
Почему для агентных фреймворков важны длинный контекст и tool-calling?
Hermes документирует, что его tool-workflows требуют большого контекста; модели без tool-calling в Hermes ограничены режимом чата.
Hermes привязан к одному provider?
Нет. В docs providers описаны облачные и self-hosted маршруты, а переключение выполняется через конфигурацию provider/model.
Заметки по верификации
- Раздел runtime-требований содержит только утверждения, которые присутствуют в официальной документации фреймворков, перечисленной на этой странице.
- Таблицы fit — это планировочные оценки LLMRAM на основе текущих страниц моделей и предположений калькулятора.
- Если в официальных ссылках нет runtime-специфичного snippet (например, Hermes llama.cpp), страница явно отмечает этот пробел.