Hermes Agent: exigences matérielles, connexion locale et planification contexte
Guide officiel pour Hermes Agent. Hermes Agent est un framework d'agents IA auto-hébergeable avec outillage terminal, routage de fournisseurs et options de modèles locaux dont Ollama.
Présentation
Hermes Agent se présente comme un agent IA auto-améliorant créé par Nous Research, avec sessions longues, usage d'outils et interfaces de messagerie.
Son système de providers prend en charge API hébergées et endpoints auto-hébergés, ce qui permet de changer de backend modèle sans réécrire la logique d'agent.
Exigences runtime officielles
- Runtime géré par l'installateur: Les installations officielles actuelles tournent sur Python 3.14 ; la toolchain gérée inclut Python, Node.js, npm, ripgrep et FFmpeg. (Documentation d'installation Hermes)
- Pré-requis pour installation depuis les sources: L'installation source POSIX exige Git, curl, tar et des utilitaires SHA-256. (Documentation d'installation Hermes)
- Base du guide Ollama local: Le tableau du guide indique 8 GB RAM minimum (modèles 3B), 32+ GB recommandés (27B+), 5 GB d'espace libre minimum, et un GPU NVIDIA optionnel avec 8+ GB VRAM pour accélérer l'inférence. (Guide Hermes Ollama local)
Snippets de connexion locale (docs officielles)
Ollama
curl -fsSL https://ollama.com/install.sh | sh ollama pull gemma4:31b hermes setup # provider: Custom Endpoint # base URL: http://localhost:11434/v1
Source: Guide Hermes Ollama local
Ollama
cat > ~/.hermes/cache/scratch/Modelfile << 'EOF' FROM gemma4:31b PARAMETER num_ctx 64000 EOF ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile
Extrait de la section context-window du guide Hermes Ollama.
Source: Guide Hermes Ollama local
vLLM
model: default: your-model-name provider: custom base_url: http://localhost:8000/v1 api_key: your-key-or-leave-empty-for-local
La doc Hermes décrit les endpoints auto-hébergés, y compris vLLM, via le flux Custom Endpoint.
LM Studio
model: default: your-model-name provider: custom base_url: http://localhost:1234/v1 api_key: your-key-or-leave-empty-for-local
La page providers de Hermes liste les schémas de configuration LM Studio et custom endpoint.
llama.cpp
No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.
Aucun snippet explicite de provider llama.cpp n'apparaît dans les liens officiels fournis ; la lacune est signalée au lieu d'inventer une commande.
Pourquoi le long contexte et le tool-calling comptent
- Le guide Hermes Ollama local indique explicitement qu'au moins 64 000 tokens de contexte sont requis pour les workflows agentiques avec outils.
- Le même guide précise que les modèles sans tool-calling peuvent discuter, mais ne peuvent pas exécuter les actions d'agent (édition de fichier, commande shell).
Calculateur prérempli
Ce tableau est une estimation de planification (Q4_K_M, batch=1), pas une exigence officielle minimale.
Calculateur VRAM / RAM
Comparez l’adéquation sur VRAM GPU, mémoire unifiée Apple et scénarios d’offload CPU/RAM.
ID Hugging Face / paramètres personnalisés (optionnel)
Si l’ID repo est inconnu, vos valeurs sont utilisées en mode estimation.
| Quant | Poids | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 16 GiB | 1.78 GiB | 68.07 GiB |
| INT8 / Q8_0 | 25.77 GiB | 16 GiB | 1.78 GiB | 43.55 GiB |
| Q6_K | 19.96 GiB | 16 GiB | 1.78 GiB | 37.74 GiB |
| Q5_K_M | 17.13 GiB | 16 GiB | 1.78 GiB | 34.91 GiB |
| Q4_K_M | 14.46 GiB | 16 GiB | 1.78 GiB | 32.24 GiB |
| Q3_K_M / Q3 | 11 GiB | 16 GiB | 1.78 GiB | 28.78 GiB |
| Q2_K / Q2 | 7.86 GiB | 16 GiB | 1.78 GiB | 25.64 GiB |
| Matériel | Mémoire | Verdict | tok/s estimés |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Incompatible | n/a (Incompatible) |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Incompatible | n/a (Incompatible) |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | Incompatible | n/a (Incompatible) |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | Incompatible | n/a (Incompatible) |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Incompatible | n/a (Incompatible) |
| NVIDIA A100 80GB PCIe | 80 GiB | Compatible | 84.75 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Compatible | 14.94 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Compatible | 29.89 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Compatible | 79.45 |
Formules et hypothèses
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
- Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
Table de compatibilité par palier mémoire (estimation LLMRAM)
Ce tableau est une estimation de planification (Q4_K_M, batch=1), pas une exigence officielle minimale.
Contexte 32K
Paliers GPU
| Profil modèle | Mémoire totale estimée | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✕ Non compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible |
| Qwen 3.8 27B | 24 GiB | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible |
Paliers mémoire unifiée Mac
| Profil modèle | Mémoire totale estimée | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✓ Compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible |
| Qwen 3.8 27B | 24 GiB | ✕ Non compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible |
Contexte 64K
Paliers GPU
| Profil modèle | Mémoire totale estimée | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ Non compatible | ✕ Non compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible |
| Qwen 3.8 27B | 32.24 GiB | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✓ Compatible |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible |
Paliers mémoire unifiée Mac
| Profil modèle | Mémoire totale estimée | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ Non compatible | ✓ Compatible | ✓ Compatible | ✓ Compatible |
| Qwen 3.8 27B | 32.24 GiB | ✕ Non compatible | ✕ Non compatible | ✓ Compatible | ✓ Compatible |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible | ✕ Non compatible |
FAQ
Hermes peut-il fonctionner entièrement en local sans clé API ?
Oui. Le guide Hermes Ollama documente un setup local-only avec Ollama et précise qu'aucune clé API n'est requise pour ce chemin.
Pourquoi le long contexte et le tool-calling sont-ils importants ?
Hermes indique que ses workflows agentiques nécessitent un grand contexte et que les modèles sans tool-calling restent limités au chat dans Hermes.
Hermes impose-t-il un provider unique ?
Non. Les docs providers décrivent des routes cloud et self-hosted, avec bascule via la configuration provider/model.
Notes de vérification
- La section des exigences runtime ne contient que des affirmations présentes dans les docs officielles du framework listées sur cette page.
- Les tableaux de compatibilité sont des estimations de planification LLMRAM dérivées des pages modèles actuelles et des hypothèses du calculateur.
- Quand un snippet spécifique à un runtime manque dans les liens officiels fournis (ex. Hermes llama.cpp), la lacune est indiquée explicitement.