LLMRAM

LLMRAM: калькулятор VRAM и RAM для AI-моделей

Этот инструмент помогает заранее понять, запустится ли модель локально. Выберите модель, квантизацию, длину контекста и batch, затем сравните пригодность для NVIDIA, AMD, Apple Silicon и CPU/RAM offload.

Калькулятор VRAM / RAM

Сравнивайте сценарии для дискретной VRAM, unified memory Apple и CPU/RAM offload.

Пользовательский Hugging Face id / параметры (опционально)

Если repo id неизвестен, расчёт будет выполнен по вашим значениям как по оценке.

Память по квантизациям
КвантВесыKVOverheadИтого
FP16 / BF1650.29 GiB4 GiB3.74 GiB58.03 GiB
INT8 / Q8_025.77 GiB4 GiB2.78 GiB32.56 GiB
Q6_K19.96 GiB4 GiB2.52 GiB26.48 GiB
Q5_K_M17.13 GiB4 GiB2.43 GiB23.56 GiB
Q4_K_M14.46 GiB4 GiB2.46 GiB20.91 GiB
Q3_K_M / Q311 GiB4 GiB2.26 GiB17.26 GiB
Q2_K / Q27.86 GiB4 GiB1.98 GiB13.84 GiB
Подходит / не подходит по железу
ЖелезоПамятьВердиктtok/s (оценка)
NVIDIA GeForce RTX 4090 24GB24 GiBПодходит37.26
NVIDIA GeForce RTX 5090 32GB32 GiBПодходит66.25
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBНе подходит27.21
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBНе подходит24.84
AMD Radeon RX 7900 XTX 24GB24 GiBПодходит35.49
NVIDIA A100 80GB PCIe80 GiBПодходит71.54
Apple Silicon M3 Max (128GB unified memory)128 GiBПодходит12.61
Apple Silicon M2 Ultra (192GB unified memory)192 GiBПодходит25.23
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBПодходит67.06

Формулы и допущения

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Страницы по железу

Методика для VRAM, unified memory и RAM offload

  1. Память весов = резидентные параметры × эффективные биты / 8 (GiB).
  2. Для MoE резидентность весов считается по total params; active params в основном для оценки скорости.
  3. KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  4. Overhead включает фрагментацию, буферы рантайма и резервы фреймворка.
  5. tokens/sec — ориентировочная оценка по пропускной способности памяти.
  6. CPU/RAM offload снижает VRAM, но обычно ухудшает задержку и throughput.
  7. Unified memory Mac учитывается как полноценная целевая конфигурация.

FAQ

Насколько точны оценки?

Это оценки для планирования. Формулы и допущения по весам, KV cache и overhead показаны явно.

Поддерживаются MoE-модели?

Да. Для memory fit важнее total params, для оценки tok/s — active params.

Можно быстро добавить новую модель?

Да. Есть скрипт, который читает config.json из Hugging Face и добавляет типизированную запись.