LLMRAM

OpenClaw: требования к железу, локальное подключение и планирование контекста

Официальный гайд для OpenClaw. OpenClaw — open-source local-first gateway для агентов, поддерживающий облачных и локальных providers моделей.

Что это

OpenClaw позиционируется как assistant stack, где состояние и учётные данные остаются на ваших устройствах, а model/runtime backends можно менять.

Gateway выступает локальной control plane для сессий, инструментов, каналов и маршрутизации моделей.

Официальные требования к рантайму

  • Требование к Node runtime: Документация по установке OpenClaw требует Node 24.16+ или 26.1+ и рекомендует Node 26. Если Node отсутствует, установщик подготавливает его автоматически. (Документация по установке OpenClaw)
  • Поддерживаемые платформы: В документации установки OpenClaw указаны macOS, Linux и Windows как поддерживаемые платформы. (Документация по установке OpenClaw)
  • Примечание по памяти для локальных моделей: Документация OpenClaw local-models говорит, что память зависит от весов модели, контекста, runtime и нагрузки хоста; управляемые рецепты llama.cpp используют 64K контекст, а минимальный рецепт указывает нижний порог 8 GiB памяти хоста. (Документация OpenClaw по локальным моделям)

Сниппеты локального подключения (официальные docs)

Почему важны длинный контекст и tool-calling

  • В документации OpenClaw local-models подчёркивается: модель может проходить короткие промпты, но срываться на полном agent-turn из-за расхода контекста под tool schema, историю и системные подсказки.
  • OpenClaw setup выполняет реальную проверку tool call перед переключением default локальной модели в managed-потоке.

Предзаполненный калькулятор

Матрица ниже — оценка планирования (Q4_K_M, batch=1), а не официальный минимум вендора.

Калькулятор VRAM / RAM

Сравнивайте сценарии для дискретной VRAM, unified memory Apple и CPU/RAM offload.

Пользовательский Hugging Face id / параметры (опционально)

Если repo id неизвестен, расчёт будет выполнен по вашим значениям как по оценке.

Память по квантизациям
КвантВесыKVOverheadИтого
FP16 / BF1613.04 GiB8 GiB1.54 GiB22.58 GiB
INT8 / Q8_06.68 GiB8 GiB1.54 GiB16.22 GiB
Q6_K5.17 GiB8 GiB1.54 GiB14.71 GiB
Q5_K_M4.44 GiB8 GiB1.54 GiB13.98 GiB
Q4_K_M3.75 GiB8 GiB1.54 GiB13.29 GiB
Q3_K_M / Q32.85 GiB8 GiB1.54 GiB12.39 GiB
Q2_K / Q22.04 GiB8 GiB1.54 GiB11.58 GiB
Подходит / не подходит по железу
ЖелезоПамятьВердиктtok/s (оценка)
NVIDIA GeForce RTX 4090 24GB24 GiBПодходит170.3
NVIDIA GeForce RTX 5090 32GB32 GiBПодходит302.75
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBПодходит124.34
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBПодходит113.53
AMD Radeon RX 7900 XTX 24GB24 GiBПодходит162.19
NVIDIA A100 80GB PCIe80 GiBПодходит326.91
Apple Silicon M3 Max (128GB unified memory)128 GiBПодходит57.64
Apple Silicon M2 Ultra (192GB unified memory)192 GiBПодходит115.28
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBПодходит306.46

Формулы и допущения

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Таблица fit по классам памяти (оценка LLMRAM)

Матрица ниже — оценка планирования (Q4_K_M, batch=1), а не официальный минимум вендора.

Контекст 32K

Классы GPU

Профиль моделиОценка total memory8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.39.17 GiB✕ Не подходит✓ Подходит✓ Подходит✓ Подходит✓ Подходит✓ Подходит
Qwen 3.8 27B24 GiB✕ Не подходит✕ Не подходит✕ Не подходит✓ Подходит✓ Подходит✓ Подходит
GLM 5.3 (Flash)195.84 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит

Классы unified memory Mac

Профиль моделиОценка total memory16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.39.17 GiB✓ Подходит✓ Подходит✓ Подходит✓ Подходит
Qwen 3.8 27B24 GiB✕ Не подходит✓ Подходит✓ Подходит✓ Подходит
GLM 5.3 (Flash)195.84 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит

Контекст 64K

Классы GPU

Профиль моделиОценка total memory8 GB12 GB16 GB24 GB32 GB48 GB
Mistral 7B Instruct v0.313.29 GiB✕ Не подходит✕ Не подходит✓ Подходит✓ Подходит✓ Подходит✓ Подходит
Qwen 3.8 27B32.24 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✓ Подходит
GLM 5.3 (Flash)219.01 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит

Классы unified memory Mac

Профиль моделиОценка total memory16 GB36 GB64 GB128 GB
Mistral 7B Instruct v0.313.29 GiB✕ Не подходит✓ Подходит✓ Подходит✓ Подходит
Qwen 3.8 27B32.24 GiB✕ Не подходит✕ Не подходит✓ Подходит✓ Подходит
GLM 5.3 (Flash)219.01 GiB✕ Не подходит✕ Не подходит✕ Не подходит✕ Не подходит

FAQ

OpenClaw обязательно требует cloud API?

Нет. Документация OpenClaw покрывает local-first конфигурации и локальные маршруты моделей, включая Ollama и managed local server.

Почему OpenClaw документирует и native Ollama, и OpenAI-совместимые /v1 backend'ы?

Для Ollama provider mode используется native Ollama API, а для vLLM/LM Studio/proxy применяется конфигурация OpenAI-совместимых provider mode.

Можно ли считать из документации OpenClaw одно фиксированное минимальное значение памяти?

Нет. OpenClaw явно указывает зависимость от модели, контекста, runtime и состояния хоста; нижние пороги рецептов не являются гарантией fit.

Заметки по верификации

  • Раздел runtime-требований содержит только утверждения, которые присутствуют в официальной документации фреймворков, перечисленной на этой странице.
  • Таблицы fit — это планировочные оценки LLMRAM на основе текущих страниц моделей и предположений калькулятора.
  • Если в официальных ссылках нет runtime-специфичного snippet (например, Hermes llama.cpp), страница явно отмечает этот пробел.

Использованные официальные источники

Внутренние ссылки