LLMRAM

Hermes Agent: требования к железу, локальное подключение и планирование контекста

Официальный гайд для Hermes Agent. Hermes Agent — self-hosted фреймворк AI-агентов с терминальными инструментами, маршрутизацией провайдеров и локальными путями моделей, включая Ollama.

Что это

Hermes Agent описывается как самоулучшающийся AI-агент от Nous Research с долгими сессиями, использованием инструментов и интерфейсами сообщений.

Система providers поддерживает и облачные API, и self-hosted endpoints, поэтому можно менять модельный backend без переписывания логики агента.

Официальные требования к рантайму

  • Runtime под управлением установщика: Текущие официальные установки работают на Python 3.14; управляемая toolchain включает Python, Node.js, npm, ripgrep и FFmpeg. (Документация по установке Hermes)
  • Предусловия для установки из исходников: Для POSIX source-установки требуются Git, curl, tar и утилиты SHA-256. (Документация по установке Hermes)
  • Базовые значения из локального гайда Ollama: Таблица в гайде указывает минимум 8 GB RAM (модели 3B), рекомендацию 32+ GB (27B+), минимум 5 GB свободного места и опциональный NVIDIA GPU с 8+ GB VRAM для ускорения инференса. (Гайд Hermes по локальному Ollama)

Сниппеты локального подключения (официальные docs)

Ollama

cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile

Из раздела context-window в гайде Hermes Ollama.

Источник: Гайд Hermes по локальному Ollama

llama.cpp

No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.

В предоставленных официальных ссылках Hermes нет явного snippet для llama.cpp provider; поэтому пробел отмечен явно без выдуманных команд.

Источник: Документация по интеграциям провайдеров Hermes

Почему важны длинный контекст и tool-calling

  • В локальном гайде Hermes для Ollama прямо сказано, что для agentic-работы с инструментами нужен контекст не менее 64 000 токенов.
  • Там же указано, что модели без tool-calling могут только чатиться и не выполняют агентные действия Hermes (редактирование файлов, команды).

Предзаполненный калькулятор

Матрица ниже — оценка планирования (Q4_K_M, batch=1), а не официальный минимум вендора.

Калькулятор VRAM / RAM

Сравнивайте сценарии для дискретной VRAM, unified memory Apple и CPU/RAM offload.

Пользовательский Hugging Face id / параметры (опционально)

Если repo id неизвестен, расчёт будет выполнен по вашим значениям как по оценке.

Память по квантизациям
КвантВесыKVOverheadИтого
FP16 / BF1650.29 GiB16 GiB1.78 GiB68.07 GiB
INT8 / Q8_025.77 GiB16 GiB1.78 GiB43.55 GiB
Q6_K19.96 GiB16 GiB1.78 GiB37.74 GiB
Q5_K_M17.13 GiB16 GiB1.78 GiB34.91 GiB
Q4_K_M14.46 GiB16 GiB1.78 GiB32.24 GiB
Q3_K_M / Q311 GiB16 GiB1.78 GiB28.78 GiB
Q2_K / Q27.86 GiB16 GiB1.78 GiB25.64 GiB
Подходит / не подходит по железу
ЖелезоПамятьВердиктtok/s (оценка)
NVIDIA GeForce RTX 4090 24GB24 GiBНе подходитn/a (Не подходит)
NVIDIA GeForce RTX 5090 32GB32 GiBНе подходитn/a (Не подходит)
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBНе подходитn/a (Не подходит)
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBНе подходитn/a (Не подходит)
AMD Radeon RX 7900 XTX 24GB24 GiBНе подходитn/a (Не подходит)
NVIDIA A100 80GB PCIe80 GiBПодходит84.75
Apple Silicon M3 Max (128GB unified memory)128 GiBПодходит14.94
Apple Silicon M2 Ultra (192GB unified memory)192 GiBПодходит29.89
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBПодходит79.45

Формулы и допущения

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Таблица fit по классам памяти (оценка LLMRAM)

Матрица ниже — оценка планирования (Q4_K_M, batch=1), а не официальный минимум вендора.

Контекст 32K

Классы GPU

Профиль моделиОценка total memory8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ Не подходит✓ Подходит✓ Подходит✓ Подходит✓ Подходит✓ Подходит
Qwen 3.8 27B24 GiB✕ Не подходит✕ Не подходит✕ Не подходит✓ Подходит✓ Подходит✓ Подходит
GLM 5.3 (Flash)195.84 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит

Классы unified memory Mac

Профиль моделиОценка total memory16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ Подходит✓ Подходит✓ Подходит✓ Подходит
Qwen 3.8 27B24 GiB✕ Не подходит✓ Подходит✓ Подходит✓ Подходит
GLM 5.3 (Flash)195.84 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит

Контекст 64K

Классы GPU

Профиль моделиОценка total memory8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ Не подходит✕ Не подходит✓ Подходит✓ Подходит✓ Подходит✓ Подходит
Qwen 3.8 27B32.24 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✓ Подходит
GLM 5.3 (Flash)219.01 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит

Классы unified memory Mac

Профиль моделиОценка total memory16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ Не подходит✓ Подходит✓ Подходит✓ Подходит
Qwen 3.8 27B32.24 GiB✕ Не подходит✕ Не подходит✓ Подходит✓ Подходит
GLM 5.3 (Flash)219.01 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит

FAQ

Можно ли запускать Hermes полностью локально без API key?

Да. В гайде Hermes Ollama описан локальный-only путь на Ollama и прямо сказано, что API key для него не нужен.

Почему для агентных фреймворков важны длинный контекст и tool-calling?

Hermes документирует, что его tool-workflows требуют большого контекста; модели без tool-calling в Hermes ограничены режимом чата.

Hermes привязан к одному provider?

Нет. В docs providers описаны облачные и self-hosted маршруты, а переключение выполняется через конфигурацию provider/model.

Заметки по верификации

  • Раздел runtime-требований содержит только утверждения, которые присутствуют в официальной документации фреймворков, перечисленной на этой странице.
  • Таблицы fit — это планировочные оценки LLMRAM на основе текущих страниц моделей и предположений калькулятора.
  • Если в официальных ссылках нет runtime-специфичного snippet (например, Hermes llama.cpp), страница явно отмечает этот пробел.

Использованные официальные источники

Внутренние ссылки