LLMRAM

Hermes Agent: exigences matérielles, connexion locale et planification contexte

Guide officiel pour Hermes Agent. Hermes Agent est un framework d'agents IA auto-hébergeable avec outillage terminal, routage de fournisseurs et options de modèles locaux dont Ollama.

Présentation

Hermes Agent se présente comme un agent IA auto-améliorant créé par Nous Research, avec sessions longues, usage d'outils et interfaces de messagerie.

Son système de providers prend en charge API hébergées et endpoints auto-hébergés, ce qui permet de changer de backend modèle sans réécrire la logique d'agent.

Exigences runtime officielles

  • Runtime géré par l'installateur: Les installations officielles actuelles tournent sur Python 3.14 ; la toolchain gérée inclut Python, Node.js, npm, ripgrep et FFmpeg. (Documentation d'installation Hermes)
  • Pré-requis pour installation depuis les sources: L'installation source POSIX exige Git, curl, tar et des utilitaires SHA-256. (Documentation d'installation Hermes)
  • Base du guide Ollama local: Le tableau du guide indique 8 GB RAM minimum (modèles 3B), 32+ GB recommandés (27B+), 5 GB d'espace libre minimum, et un GPU NVIDIA optionnel avec 8+ GB VRAM pour accélérer l'inférence. (Guide Hermes Ollama local)

Snippets de connexion locale (docs officielles)

Ollama

curl -fsSL https://ollama.com/install.sh | sh
ollama pull gemma4:31b
hermes setup
# provider: Custom Endpoint
# base URL: http://localhost:11434/v1

Source: Guide Hermes Ollama local

Ollama

cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile

Extrait de la section context-window du guide Hermes Ollama.

Source: Guide Hermes Ollama local

vLLM

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:8000/v1
  api_key: your-key-or-leave-empty-for-local

La doc Hermes décrit les endpoints auto-hébergés, y compris vLLM, via le flux Custom Endpoint.

Source: Documentation des fournisseurs Hermes

LM Studio

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:1234/v1
  api_key: your-key-or-leave-empty-for-local

La page providers de Hermes liste les schémas de configuration LM Studio et custom endpoint.

Source: Documentation des fournisseurs Hermes

llama.cpp

No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.

Aucun snippet explicite de provider llama.cpp n'apparaît dans les liens officiels fournis ; la lacune est signalée au lieu d'inventer une commande.

Source: Documentation des fournisseurs Hermes

Pourquoi le long contexte et le tool-calling comptent

  • Le guide Hermes Ollama local indique explicitement qu'au moins 64 000 tokens de contexte sont requis pour les workflows agentiques avec outils.
  • Le même guide précise que les modèles sans tool-calling peuvent discuter, mais ne peuvent pas exécuter les actions d'agent (édition de fichier, commande shell).

Calculateur prérempli

Ce tableau est une estimation de planification (Q4_K_M, batch=1), pas une exigence officielle minimale.

Calculateur VRAM / RAM

Comparez l’adéquation sur VRAM GPU, mémoire unifiée Apple et scénarios d’offload CPU/RAM.

ID Hugging Face / paramètres personnalisés (optionnel)

Si l’ID repo est inconnu, vos valeurs sont utilisées en mode estimation.

Mémoire par quantification
QuantPoidsKVOverheadTotal
FP16 / BF1650.29 GiB16 GiB1.78 GiB68.07 GiB
INT8 / Q8_025.77 GiB16 GiB1.78 GiB43.55 GiB
Q6_K19.96 GiB16 GiB1.78 GiB37.74 GiB
Q5_K_M17.13 GiB16 GiB1.78 GiB34.91 GiB
Q4_K_M14.46 GiB16 GiB1.78 GiB32.24 GiB
Q3_K_M / Q311 GiB16 GiB1.78 GiB28.78 GiB
Q2_K / Q27.86 GiB16 GiB1.78 GiB25.64 GiB
Compatible / incompatible par matériel
MatérielMémoireVerdicttok/s estimés
NVIDIA GeForce RTX 4090 24GB24 GiBIncompatiblen/a (Incompatible)
NVIDIA GeForce RTX 5090 32GB32 GiBIncompatiblen/a (Incompatible)
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBIncompatiblen/a (Incompatible)
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBIncompatiblen/a (Incompatible)
AMD Radeon RX 7900 XTX 24GB24 GiBIncompatiblen/a (Incompatible)
NVIDIA A100 80GB PCIe80 GiBCompatible84.75
Apple Silicon M3 Max (128GB unified memory)128 GiBCompatible14.94
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCompatible29.89
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCompatible79.45

Formules et hypothèses

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Table de compatibilité par palier mémoire (estimation LLMRAM)

Ce tableau est une estimation de planification (Q4_K_M, batch=1), pas une exigence officielle minimale.

Contexte 32K

Paliers GPU

Profil modèleMémoire totale estimée8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ Non compatible✓ Compatible✓ Compatible✓ Compatible✓ Compatible✓ Compatible
Qwen 3.8 27B24 GiB✕ Non compatible✕ Non compatible✕ Non compatible✓ Compatible✓ Compatible✓ Compatible
GLM 5.3 (Flash)195.84 GiB✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible

Paliers mémoire unifiée Mac

Profil modèleMémoire totale estimée16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ Compatible✓ Compatible✓ Compatible✓ Compatible
Qwen 3.8 27B24 GiB✕ Non compatible✓ Compatible✓ Compatible✓ Compatible
GLM 5.3 (Flash)195.84 GiB✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible

Contexte 64K

Paliers GPU

Profil modèleMémoire totale estimée8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ Non compatible✕ Non compatible✓ Compatible✓ Compatible✓ Compatible✓ Compatible
Qwen 3.8 27B32.24 GiB✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible✓ Compatible
GLM 5.3 (Flash)219.01 GiB✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible

Paliers mémoire unifiée Mac

Profil modèleMémoire totale estimée16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ Non compatible✓ Compatible✓ Compatible✓ Compatible
Qwen 3.8 27B32.24 GiB✕ Non compatible✕ Non compatible✓ Compatible✓ Compatible
GLM 5.3 (Flash)219.01 GiB✕ Non compatible✕ Non compatible✕ Non compatible✕ Non compatible

FAQ

Hermes peut-il fonctionner entièrement en local sans clé API ?

Oui. Le guide Hermes Ollama documente un setup local-only avec Ollama et précise qu'aucune clé API n'est requise pour ce chemin.

Pourquoi le long contexte et le tool-calling sont-ils importants ?

Hermes indique que ses workflows agentiques nécessitent un grand contexte et que les modèles sans tool-calling restent limités au chat dans Hermes.

Hermes impose-t-il un provider unique ?

Non. Les docs providers décrivent des routes cloud et self-hosted, avec bascule via la configuration provider/model.

Notes de vérification

  • La section des exigences runtime ne contient que des affirmations présentes dans les docs officielles du framework listées sur cette page.
  • Les tableaux de compatibilité sont des estimations de planification LLMRAM dérivées des pages modèles actuelles et des hypothèses du calculateur.
  • Quand un snippet spécifique à un runtime manque dans les liens officiels fournis (ex. Hermes llama.cpp), la lacune est indiquée explicitement.

Sources officielles utilisées

Liens internes