LLMRAM

Hermes Agent: 하드웨어 요구사항·로컬 연결·컨텍스트 계획

공식 소스 기반 Hermes Agent. Hermes Agent는 셀프 호스팅 가능한 AI 에이전트 프레임워크로, 터미널 도구와 프로바이더 라우팅, Ollama 기반 로컬 모델 경로를 제공합니다.

무엇인가

Hermes Agent는 Nous Research의 자기개선형 에이전트로 소개되며, 장기 세션, 도구 실행, 메시징 인터페이스를 포함합니다.

provider 시스템은 호스팅 API와 셀프호스트 endpoint를 모두 지원하므로 에이전트 로직을 바꾸지 않고 모델 백엔드를 교체할 수 있습니다.

공식 런타임 요구사항

  • 설치기 관리 런타임: 현재 공식 설치 경로는 Python 3.14에서 동작하며, 설치기가 Python, Node.js, npm, ripgrep, FFmpeg 도구 체인을 관리합니다. (Hermes 설치 문서)
  • 소스 설치 전제 조건: POSIX 소스 설치에는 Git, curl, tar, SHA-256 유틸리티가 필요합니다. (Hermes 설치 문서)
  • 로컬 Ollama 가이드 기준: 가이드 표에는 8 GB RAM 최소(3B 모델), 32+ GB 권장(27B+), 5 GB 이상의 여유 저장공간, 그리고 선택적 NVIDIA GPU(8+ GB VRAM) 권장이 명시됩니다. (Hermes 로컬 Ollama 설정 가이드)

로컬 모델 연결 스니펫 (공식 문서)

Ollama

curl -fsSL https://ollama.com/install.sh | sh
ollama pull gemma4:31b
hermes setup
# provider: Custom Endpoint
# base URL: http://localhost:11434/v1

출처: Hermes 로컬 Ollama 설정 가이드

Ollama

cat > ~/.hermes/cache/scratch/Modelfile << 'EOF'
FROM gemma4:31b
PARAMETER num_ctx 64000
EOF
ollama create gemma4-64k -f ~/.hermes/cache/scratch/Modelfile

Hermes Ollama 가이드의 context-window 섹션 기반입니다.

출처: Hermes 로컬 Ollama 설정 가이드

vLLM

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:8000/v1
  api_key: your-key-or-leave-empty-for-local

Hermes 문서는 Custom Endpoint 흐름으로 vLLM 포함 셀프호스트 endpoint를 설명합니다.

출처: Hermes 프로바이더 연동 문서

LM Studio

model:
  default: your-model-name
  provider: custom
  base_url: http://localhost:1234/v1
  api_key: your-key-or-leave-empty-for-local

Hermes providers 페이지는 LM Studio와 custom endpoint 구성 패턴을 제시합니다.

출처: Hermes 프로바이더 연동 문서

llama.cpp

No explicit llama.cpp provider setup snippet appears in the provided Hermes source links.

제공된 Hermes 공식 링크에는 llama.cpp provider 명시 스니펫이 없어, 임의 작성 대신 문서 공백으로 표시했습니다.

출처: Hermes 프로바이더 연동 문서

긴 컨텍스트 + 툴 호출 모델이 중요한 이유

  • Hermes 로컬 Ollama 가이드는 도구를 사용하는 에이전트 작업에 최소 64,000 토큰 컨텍스트가 필요하다고 명시합니다.
  • 같은 가이드는 tool-call 미지원 모델이 채팅은 가능하지만 파일 편집/명령 실행 같은 Hermes 에이전트 동작은 수행하지 못한다고 설명합니다.

프리필 계산기

아래 표는 Q4_K_M / batch=1 기준 추정치이며 공식 최소 요구사항이 아닙니다.

VRAM / RAM 계산기

GPU VRAM, Apple 통합 메모리, CPU/RAM 오프로드 시나리오를 함께 고려해 적합성을 비교합니다.

사용자 지정 Hugging Face 모델 id / 파라미터 (선택)

repo id를 모르면 입력한 값으로 추정 계산됩니다.

양자화별 메모리
양자화가중치KVOverhead합계
FP16 / BF1650.29 GiB16 GiB1.78 GiB68.07 GiB
INT8 / Q8_025.77 GiB16 GiB1.78 GiB43.55 GiB
Q6_K19.96 GiB16 GiB1.78 GiB37.74 GiB
Q5_K_M17.13 GiB16 GiB1.78 GiB34.91 GiB
Q4_K_M14.46 GiB16 GiB1.78 GiB32.24 GiB
Q3_K_M / Q311 GiB16 GiB1.78 GiB28.78 GiB
Q2_K / Q27.86 GiB16 GiB1.78 GiB25.64 GiB
하드웨어별 적합성
하드웨어메모리판정추정 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB부적합n/a (부적합)
NVIDIA GeForce RTX 5090 32GB32 GiB부적합n/a (부적합)
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB부적합n/a (부적합)
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB부적합n/a (부적합)
AMD Radeon RX 7900 XTX 24GB24 GiB부적합n/a (부적합)
NVIDIA A100 80GB PCIe80 GiB적합84.75
Apple Silicon M3 Max (128GB unified memory)128 GiB적합14.94
Apple Silicon M2 Ultra (192GB unified memory)192 GiB적합29.89
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB적합79.45

공식 및 가정

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

메모리 티어별 로컬 모델 적합 표 (LLMRAM 추정)

아래 표는 Q4_K_M / batch=1 기준 추정치이며 공식 최소 요구사항이 아닙니다.

32K 컨텍스트

GPU 티어

모델 프로필추정 총 메모리8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ 부적합✓ 적합✓ 적합✓ 적합✓ 적합✓ 적합
Qwen 3.8 27B24 GiB✕ 부적합✕ 부적합✕ 부적합✓ 적합✓ 적합✓ 적합
GLM 5.3 (Flash)195.84 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합

Mac 통합 메모리 티어

모델 프로필추정 총 메모리16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ 적합✓ 적합✓ 적합✓ 적합
Qwen 3.8 27B24 GiB✕ 부적합✓ 적합✓ 적합✓ 적합
GLM 5.3 (Flash)195.84 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합

64K 컨텍스트

GPU 티어

모델 프로필추정 총 메모리8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ 부적합✕ 부적합✓ 적합✓ 적합✓ 적합✓ 적합
Qwen 3.8 27B32.24 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합✓ 적합
GLM 5.3 (Flash)219.01 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합✕ 부적합

Mac 통합 메모리 티어

모델 프로필추정 총 메모리16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ 부적합✓ 적합✓ 적합✓ 적합
Qwen 3.8 27B32.24 GiB✕ 부적합✕ 부적합✓ 적합✓ 적합
GLM 5.3 (Flash)219.01 GiB✕ 부적합✕ 부적합✕ 부적합✕ 부적합

FAQ

Hermes는 API 키 없이 완전 로컬로 실행할 수 있나요?

네. Hermes Ollama 가이드는 Ollama 백엔드 기반 로컬 전용 경로를 문서화하고, 해당 경로에 API 키가 필요 없다고 설명합니다.

왜 긴 컨텍스트와 툴 호출 지원이 중요한가요?

Hermes 문서에 따르면 에이전트 도구 워크플로에는 큰 컨텍스트가 필요하며, 툴 호출 미지원 모델은 채팅 전용으로 제한됩니다.

Hermes는 특정 provider에 고정되나요?

아니요. Hermes provider 문서는 클라우드/셀프호스트 경로를 모두 설명하며 설정으로 전환할 수 있습니다.

검증 메모

  • 런타임 요구사항 섹션에는 이 페이지에 명시한 공식 문서에 실제로 존재하는 내용만 포함했습니다.
  • 적합 표는 현재 모델 페이지와 계산기 가정을 기반으로 한 LLMRAM 계획 추정치입니다.
  • 공식 링크에 특정 런타임 스니펫이 없는 경우(예: Hermes llama.cpp) 추정 명령을 작성하지 않고 공백으로 명시합니다.

사용한 공식 소스

내부 링크