LLMRAM

OpenClaw: Hardware-Anforderungen, lokale Modell-Anbindung und Kontextplanung

Offizieller Leitfaden für OpenClaw. OpenClaw ist ein Open-Source-Agent-Gateway mit Local-First-Ansatz und unterstützt sowohl Cloud- als auch lokale Modell-Provider.

Was ist das?

OpenClaw positioniert sich als Assistenten-Stack, bei dem Zustand und Zugangsdaten auf Ihren Geräten verbleiben, während Modell- und Runtime-Backends austauschbar sind.

Das Gateway fungiert als lokale Control-Plane für Sessions, Tools, Channels und Modellrouting.

Offizielle Laufzeit-Anforderungen

  • Node-Laufzeitanforderung: Die OpenClaw-Installationsdokumentation verlangt Node 24.16+ oder 26.1+ und empfiehlt Node 26. Falls Node fehlt, wird es vom Installer bereitgestellt. (OpenClaw Installationsdokumentation)
  • Plattformunterstützung: Die OpenClaw-Installationsdokumentation nennt macOS, Linux und Windows als unterstützte Ziele. (OpenClaw Installationsdokumentation)
  • Hinweis zu Local-Model-Speicher: Die OpenClaw-Local-Model-Dokumentation erklärt, dass Speicherbedarf von Modellgewichten, Kontext, Runtime und Hostlast abhängt; verwaltete llama.cpp-Rezepte nutzen 64K-Kontext und das kleinste Rezept hat eine 8-GiB-Hostspeicher-Untergrenze. (OpenClaw Dokumentation für lokale Modelle)

Snippets zur lokalen Modell-Anbindung (offizielle Doku)

Ollama

models: {
  providers: {
    ollama: {
      api: 'ollama',
      baseUrl: 'http://host:11434',
    },
  },
}

Die OpenClaw-Ollama-Dokumentation warnt ausdrücklich davor, im nativen Ollama-Provider-Modus /v1 zu verwenden.

Quelle: OpenClaw Ollama-Provider-Dokumentation

LM Studio

models: {
  providers: {
    lmstudio: {
      api: 'openai-responses',
      baseUrl: 'http://127.0.0.1:1234/v1',
      models: [{ id: 'my-local-model', contextWindow: 196608 }],
    },
  },
}

Quelle: OpenClaw Dokumentation für lokale Modelle

vLLM

models: {
  providers: {
    local: {
      api: 'openai-completions',
      baseUrl: 'http://127.0.0.1:8000/v1',
      apiKey: 'sk-local',
    },
  },
}

Die OpenClaw-Local-Model-Dokumentation führt vLLM unter OpenAI-kompatiblen lokalen Proxys auf.

Quelle: OpenClaw Dokumentation für lokale Modelle

Warum lange Kontexte und Tool-Calling wichtig sind

  • OpenClaw betont in den Local-Model-Dokumenten, dass ein Modell trotz kurzer Prompt-Tests bei vollständigen Agent-Turns scheitern kann, weil Tool-Schemas, Verlauf und Prompts zusätzlichen Kontext verbrauchen.
  • Das OpenClaw-Setup prüft einen echten Tool-Call, bevor das Standard-Local-Model in der verwalteten Einrichtung umgestellt wird.

Vorausgefüllter Rechner

Die Matrix ist eine LLMRAM-Planungsschätzung (Q4_K_M, batch=1), keine offizielle Mindestanforderung.

VRAM / RAM Rechner

Vergleichen Sie Eignung für GPU-VRAM, Apple Unified Memory und CPU/RAM-Offload.

Eigenes Hugging Face Modell / Parameter (optional)

Wenn die Repo-ID unbekannt ist, nutzt der Rechner Ihre Werte als Schätzung.

Speicher nach Quantisierung
QuantGewichteKVOverheadGesamt
FP16 / BF1613.04 GiB8 GiB1.54 GiB22.58 GiB
INT8 / Q8_06.68 GiB8 GiB1.54 GiB16.22 GiB
Q6_K5.17 GiB8 GiB1.54 GiB14.71 GiB
Q5_K_M4.44 GiB8 GiB1.54 GiB13.98 GiB
Q4_K_M3.75 GiB8 GiB1.54 GiB13.29 GiB
Q3_K_M / Q32.85 GiB8 GiB1.54 GiB12.39 GiB
Q2_K / Q22.04 GiB8 GiB1.54 GiB11.58 GiB
Fit/Nicht-Fit je Hardware
HardwareSpeicherUrteilTok/s (geschätzt)
NVIDIA GeForce RTX 4090 24GB24 GiBPasst170.3
NVIDIA GeForce RTX 5090 32GB32 GiBPasst302.75
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBPasst124.34
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBPasst113.53
AMD Radeon RX 7900 XTX 24GB24 GiBPasst162.19
NVIDIA A100 80GB PCIe80 GiBPasst326.91
Apple Silicon M3 Max (128GB unified memory)128 GiBPasst57.64
Apple Silicon M2 Ultra (192GB unified memory)192 GiBPasst115.28
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBPasst306.46

Formeln und Annahmen

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Fit-Tabelle nach Speicherklasse (LLMRAM-Schätzung)

Die Matrix ist eine LLMRAM-Planungsschätzung (Q4_K_M, batch=1), keine offizielle Mindestanforderung.

32K Kontext

GPU-Klassen

ModellprofilGeschätzter Gesamtspeicher8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ Passt nicht✓ Passt✓ Passt✓ Passt✓ Passt✓ Passt
Qwen 3.8 27B24 GiB✕ Passt nicht✕ Passt nicht✕ Passt nicht✓ Passt✓ Passt✓ Passt
GLM 5.3 (Flash)195.84 GiB✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht

Mac Unified-Memory-Klassen

ModellprofilGeschätzter Gesamtspeicher16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ Passt✓ Passt✓ Passt✓ Passt
Qwen 3.8 27B24 GiB✕ Passt nicht✓ Passt✓ Passt✓ Passt
GLM 5.3 (Flash)195.84 GiB✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht

64K Kontext

GPU-Klassen

ModellprofilGeschätzter Gesamtspeicher8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ Passt nicht✕ Passt nicht✓ Passt✓ Passt✓ Passt✓ Passt
Qwen 3.8 27B32.24 GiB✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht✓ Passt
GLM 5.3 (Flash)219.01 GiB✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht

Mac Unified-Memory-Klassen

ModellprofilGeschätzter Gesamtspeicher16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ Passt nicht✓ Passt✓ Passt✓ Passt
Qwen 3.8 27B32.24 GiB✕ Passt nicht✕ Passt nicht✓ Passt✓ Passt
GLM 5.3 (Flash)219.01 GiB✕ Passt nicht✕ Passt nicht✕ Passt nicht✕ Passt nicht

FAQ

Benötigt OpenClaw zwingend Cloud-APIs?

Nein. Die OpenClaw-Dokumentation beschreibt Local-First-Setups und lokale Modellpfade inklusive Ollama und verwalteter lokaler Server.

Warum dokumentiert OpenClaw sowohl natives Ollama als auch OpenAI-kompatible /v1-Backends?

Für den Ollama-Provider-Modus wird die native Ollama-API genutzt, während vLLM/LM Studio/Proxys über OpenAI-kompatible Provider-Modi konfiguriert werden.

Kann ich aus OpenClaw-Dokumenten ein fixes Speicher-Minimum ableiten?

Nein. OpenClaw sagt explizit, dass der Speicherbedarf von Modell, Kontext, Runtime und Hostbedingungen abhängt; Rezept-Untergrenzen sind keine Fit-Garantie.

Verifizierungsnotizen

  • Im Abschnitt zu Laufzeitanforderungen stehen nur Aussagen, die in den auf dieser Seite verlinkten offiziellen Framework-Dokumenten enthalten sind.
  • Die Fit-Tabellen sind LLMRAM-Planungsschätzungen auf Basis der aktuellen Modellseiten und Rechnerannahmen.
  • Wenn in offiziellen Links ein runtime-spezifisches Snippet fehlt (z. B. Hermes llama.cpp), markieren wir die Lücke ausdrücklich statt Befehle zu erfinden.

Verwendete offizielle Quellen

Interne Links