Hermes Agent: ハードウェア要件・ローカル接続・コンテキスト計画
公式ソースに基づく Hermes Agent. Hermes Agent はセルフホスト可能な AI エージェント基盤で、端末ツール、プロバイダー切替、Ollama を含むローカル実行経路を備えています。
概要
Hermes Agent は Nous Research が開発する自己改善型エージェントとして説明され、長時間セッション、ツール実行、メッセージ連携を提供します。
provider システムはホステッド API とセルフホスト endpoint の両方に対応し、エージェントロジックを書き換えずにモデルバックエンドを切り替えられます。
公式ランタイム要件
- インストーラー管理ランタイム: 現行の公式インストールは Python 3.14 で動作し、インストーラー管理ツールチェーンには Python、Node.js、npm、ripgrep、FFmpeg が含まれます。 (Hermes インストールドキュメント)
- ソースインストール前提: POSIX でのソースインストールには Git、curl、tar、SHA-256 ユーティリティが必要です。 (Hermes インストールドキュメント)
- ローカル Ollama ガイドの基準: ガイド表では 8 GB RAM 最低(3B モデル)、32+ GB 推奨(27B+)、5 GB 以上の空き容量、さらに高速化のため任意で NVIDIA GPU(8+ GB VRAM)を記載しています。 (Hermes ローカル Ollama セットアップガイド)
ローカルモデル接続スニペット(公式)
Ollama
curl -fsSL https://ollama.com/install.sh | sh ollama pull gemma4:31b hermes setup # provider: Custom Endpoint # base URL: http://localhost:11434/v1
Ollama
cat > ~/.hermes/cache/scratch/Modelfile << 'EOF' FROM gemma4:31b PARAMETER num_ctx 64000 EOF ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile
Hermes Ollama ガイドのコンテキストウィンドウ節に基づく内容です。
vLLM
model: default: your-model-name provider: custom base_url: http://localhost:8000/v1 api_key: your-key-or-leave-empty-for-local
Hermes docs は Custom Endpoint フローで vLLM を含むセルフホスト endpoint を説明しています。
LM Studio
model: default: your-model-name provider: custom base_url: http://localhost:1234/v1 api_key: your-key-or-leave-empty-for-local
Hermes providers ページに LM Studio と custom endpoint の設定パターンが示されています。
llama.cpp
No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.
提示された Hermes 公式リンク内には llama.cpp provider の明示スニペットがないため、コマンドを推測せず不足として明記しています。
長文脈とツール呼び出し対応が重要な理由
- Hermes のローカル Ollama ガイドは、ツールを使うエージェント作業には少なくとも 64,000 トークンのコンテキストが必要と明記しています。
- 同ガイドでは、ツール呼び出し非対応モデルはチャットは可能でも、Hermes のエージェント操作(ファイル編集・コマンド実行)はできないと説明しています。
プリセット計算機
以下は Q4_K_M / batch=1 の推定であり、公式最小要件ではありません。
VRAM / RAM 計算ツール
GPU VRAM、Apple統合メモリ、CPU/RAMオフロードを想定して、モデル適合性を比較できます。
カスタム Hugging Face モデルID / パラメータ(任意)
未知のrepo idの場合は手入力値で推定計算します。
| 量子化 | 重み | KV | Overhead | 合計 |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 16 GiB | 1.78 GiB | 68.07 GiB |
| INT8 / Q8_0 | 25.77 GiB | 16 GiB | 1.78 GiB | 43.55 GiB |
| Q6_K | 19.96 GiB | 16 GiB | 1.78 GiB | 37.74 GiB |
| Q5_K_M | 17.13 GiB | 16 GiB | 1.78 GiB | 34.91 GiB |
| Q4_K_M | 14.46 GiB | 16 GiB | 1.78 GiB | 32.24 GiB |
| Q3_K_M / Q3 | 11 GiB | 16 GiB | 1.78 GiB | 28.78 GiB |
| Q2_K / Q2 | 7.86 GiB | 16 GiB | 1.78 GiB | 25.64 GiB |
| ハードウェア | メモリ | 判定 | 推定 tok/s |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | 実行不可 | n/a (実行不可) |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | 実行不可 | n/a (実行不可) |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | 実行不可 | n/a (実行不可) |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | 実行不可 | n/a (実行不可) |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | 実行不可 | n/a (実行不可) |
| NVIDIA A100 80GB PCIe | 80 GiB | 実行可能 | 84.75 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | 実行可能 | 14.94 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | 実行可能 | 29.89 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | 実行可能 | 79.45 |
計算式と前提
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
- Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
メモリ階層ごとのローカルモデル適合表(LLMRAM推定)
以下は Q4_K_M / batch=1 の推定であり、公式最小要件ではありません。
32K コンテキスト
GPU階層
| モデルプロファイル | 推定総メモリ | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✕ 非適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 |
| Qwen 3.8 27B | 24 GiB | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 |
Mac統合メモリ階層
| モデルプロファイル | 推定総メモリ | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 9.17 GiB | ✓ 適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 |
| Qwen 3.8 27B | 24 GiB | ✕ 非適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 |
| GLM 5.3 (Flash) | 195.84 GiB | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 |
64K コンテキスト
GPU階層
| モデルプロファイル | 推定総メモリ | 8 GB | 12 GB | 16 GB | 24 GB | 32 GB | 48 GB |
|---|---|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ 非適合 | ✕ 非適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 |
| Qwen 3.8 27B | 32.24 GiB | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✓ 適合 |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 |
Mac統合メモリ階層
| モデルプロファイル | 推定総メモリ | 16 GB | 36 GB | 64 GB | 128 GB |
|---|---|---|---|---|---|
| Mistral 7B Instruct v0.3 | 13.29 GiB | ✕ 非適合 | ✓ 適合 | ✓ 適合 | ✓ 適合 |
| Qwen 3.8 27B | 32.24 GiB | ✕ 非適合 | ✕ 非適合 | ✓ 適合 | ✓ 適合 |
| GLM 5.3 (Flash) | 219.01 GiB | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 | ✕ 非適合 |
FAQ
Hermes は API キーなしで完全ローカル運用できますか?
可能です。Hermes の Ollama ガイドにはローカル専用の手順があり、この経路では API キー不要と記載されています。
なぜ長コンテキストとツール呼び出しが重要ですか?
Hermes 文書では、エージェントのツールワークフローに大きなコンテキストが必要で、ツール呼び出し非対応モデルはチャット専用になると説明されています。
Hermes は特定のプロバイダーに固定されますか?
いいえ。Hermes の provider 文書にはクラウド経路とセルフホスト経路があり、設定で切り替え可能です。
検証メモ
- ランタイム要件セクションには、このページで示した公式ドキュメントに明記された内容のみを記載しています。
- 適合テーブルは、現在のモデルページと計算機前提に基づく LLMRAM の計画用推定です。
- 公式リンクに特定ランタイムの明示スニペットがない場合(例: Hermes llama.cpp)、推測せず不足として明記します。