LLMRAM

Hermes Agent: ハードウェア要件・ローカル接続・コンテキスト計画

公式ソースに基づく Hermes Agent. Hermes Agent はセルフホスト可能な AI エージェント基盤で、端末ツール、プロバイダー切替、Ollama を含むローカル実行経路を備えています。

概要

Hermes Agent は Nous Research が開発する自己改善型エージェントとして説明され、長時間セッション、ツール実行、メッセージ連携を提供します。

provider システムはホステッド API とセルフホスト endpoint の両方に対応し、エージェントロジックを書き換えずにモデルバックエンドを切り替えられます。

公式ランタイム要件

  • インストーラー管理ランタイム: 現行の公式インストールは Python 3.14 で動作し、インストーラー管理ツールチェーンには Python、Node.js、npm、ripgrep、FFmpeg が含まれます。 (Hermes インストールドキュメント)
  • ソースインストール前提: POSIX でのソースインストールには Git、curl、tar、SHA-256 ユーティリティが必要です。 (Hermes インストールドキュメント)
  • ローカル Ollama ガイドの基準: ガイド表では 8 GB RAM 最低(3B モデル)、32+ GB 推奨(27B+)、5 GB 以上の空き容量、さらに高速化のため任意で NVIDIA GPU(8+ GB VRAM)を記載しています。 (Hermes ローカル Ollama セットアップガイド)

ローカルモデル接続スニペット(公式)

Ollama

cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile

Hermes Ollama ガイドのコンテキストウィンドウ節に基づく内容です。

出典: Hermes ローカル Ollama セットアップガイド

vLLM

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:8000/v1
  api_key: your-key-or-leave-empty-for-local

Hermes docs は Custom Endpoint フローで vLLM を含むセルフホスト endpoint を説明しています。

出典: Hermes プロバイダー連携ドキュメント

LM Studio

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:1234/v1
  api_key: your-key-or-leave-empty-for-local

Hermes providers ページに LM Studio と custom endpoint の設定パターンが示されています。

出典: Hermes プロバイダー連携ドキュメント

llama.cpp

No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.

提示された Hermes 公式リンク内には llama.cpp provider の明示スニペットがないため、コマンドを推測せず不足として明記しています。

出典: Hermes プロバイダー連携ドキュメント

長文脈とツール呼び出し対応が重要な理由

  • Hermes のローカル Ollama ガイドは、ツールを使うエージェント作業には少なくとも 64,000 トークンのコンテキストが必要と明記しています。
  • 同ガイドでは、ツール呼び出し非対応モデルはチャットは可能でも、Hermes のエージェント操作(ファイル編集・コマンド実行)はできないと説明しています。

プリセット計算機

以下は Q4_K_M / batch=1 の推定であり、公式最小要件ではありません。

VRAM / RAM 計算ツール

GPU VRAM、Apple統合メモリ、CPU/RAMオフロードを想定して、モデル適合性を比較できます。

カスタム Hugging Face モデルID / パラメータ(任意)

未知のrepo idの場合は手入力値で推定計算します。

量子化ごとのメモリ
量子化重みKVOverhead合計
FP16 / BF1650.29 GiB16 GiB1.78 GiB68.07 GiB
INT8 / Q8_025.77 GiB16 GiB1.78 GiB43.55 GiB
Q6_K19.96 GiB16 GiB1.78 GiB37.74 GiB
Q5_K_M17.13 GiB16 GiB1.78 GiB34.91 GiB
Q4_K_M14.46 GiB16 GiB1.78 GiB32.24 GiB
Q3_K_M / Q311 GiB16 GiB1.78 GiB28.78 GiB
Q2_K / Q27.86 GiB16 GiB1.78 GiB25.64 GiB
ハードウェアごとの適合
ハードウェアメモリ判定推定 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB実行不可n/a (実行不可)
NVIDIA GeForce RTX 5090 32GB32 GiB実行不可n/a (実行不可)
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB実行不可n/a (実行不可)
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB実行不可n/a (実行不可)
AMD Radeon RX 7900 XTX 24GB24 GiB実行不可n/a (実行不可)
NVIDIA A100 80GB PCIe80 GiB実行可能84.75
Apple Silicon M3 Max (128GB unified memory)128 GiB実行可能14.94
Apple Silicon M2 Ultra (192GB unified memory)192 GiB実行可能29.89
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB実行可能79.45

計算式と前提

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

メモリ階層ごとのローカルモデル適合表(LLMRAM推定)

以下は Q4_K_M / batch=1 の推定であり、公式最小要件ではありません。

32K コンテキスト

GPU階層

モデルプロファイル推定総メモリ8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ 非適合✓ 適合✓ 適合✓ 適合✓ 適合✓ 適合
Qwen 3.8 27B24 GiB✕ 非適合✕ 非適合✕ 非適合✓ 適合✓ 適合✓ 適合
GLM 5.3 (Flash)195.84 GiB✕ 非適合✕ 非適合✕ 非適合✕ 非適合✕ 非適合✕ 非適合

Mac統合メモリ階層

モデルプロファイル推定総メモリ16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ 適合✓ 適合✓ 適合✓ 適合
Qwen 3.8 27B24 GiB✕ 非適合✓ 適合✓ 適合✓ 適合
GLM 5.3 (Flash)195.84 GiB✕ 非適合✕ 非適合✕ 非適合✕ 非適合

64K コンテキスト

GPU階層

モデルプロファイル推定総メモリ8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ 非適合✕ 非適合✓ 適合✓ 適合✓ 適合✓ 適合
Qwen 3.8 27B32.24 GiB✕ 非適合✕ 非適合✕ 非適合✕ 非適合✕ 非適合✓ 適合
GLM 5.3 (Flash)219.01 GiB✕ 非適合✕ 非適合✕ 非適合✕ 非適合✕ 非適合✕ 非適合

Mac統合メモリ階層

モデルプロファイル推定総メモリ16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ 非適合✓ 適合✓ 適合✓ 適合
Qwen 3.8 27B32.24 GiB✕ 非適合✕ 非適合✓ 適合✓ 適合
GLM 5.3 (Flash)219.01 GiB✕ 非適合✕ 非適合✕ 非適合✕ 非適合

FAQ

Hermes は API キーなしで完全ローカル運用できますか?

可能です。Hermes の Ollama ガイドにはローカル専用の手順があり、この経路では API キー不要と記載されています。

なぜ長コンテキストとツール呼び出しが重要ですか?

Hermes 文書では、エージェントのツールワークフローに大きなコンテキストが必要で、ツール呼び出し非対応モデルはチャット専用になると説明されています。

Hermes は特定のプロバイダーに固定されますか?

いいえ。Hermes の provider 文書にはクラウド経路とセルフホスト経路があり、設定で切り替え可能です。

検証メモ

  • ランタイム要件セクションには、このページで示した公式ドキュメントに明記された内容のみを記載しています。
  • 適合テーブルは、現在のモデルページと計算機前提に基づく LLMRAM の計画用推定です。
  • 公式リンクに特定ランタイムの明示スニペットがない場合(例: Hermes llama.cpp)、推測せず不足として明記します。

使用した公式ソース

内部リンク