LLMRAM

LLMRAM: calculadora de VRAM e RAM para modelos de IA

Use esta ferramenta para responder rapidamente se um modelo roda localmente. Defina modelo, quantização, contexto e batch, e compare NVIDIA, AMD, Apple Silicon e offload CPU/RAM.

Calculadora de VRAM / RAM

Compare cenários com VRAM dedicada, memória unificada da Apple e offload CPU/RAM.

ID do Hugging Face / parâmetros customizados (opcional)

Se o repo for desconhecido, a calculadora usa seus valores como estimativa.

Memória por quantização
QuantPesosKVOverheadTotal
FP16 / BF1650.29 GiB4 GiB3.74 GiB58.03 GiB
INT8 / Q8_025.77 GiB4 GiB2.78 GiB32.56 GiB
Q6_K19.96 GiB4 GiB2.52 GiB26.48 GiB
Q5_K_M17.13 GiB4 GiB2.43 GiB23.56 GiB
Q4_K_M14.46 GiB4 GiB2.46 GiB20.91 GiB
Q3_K_M / Q311 GiB4 GiB2.26 GiB17.26 GiB
Q2_K / Q27.86 GiB4 GiB1.98 GiB13.84 GiB
Cabe / não cabe por hardware
HardwareMemóriaResultadotok/s est.
NVIDIA GeForce RTX 4090 24GB24 GiBCabe37.26
NVIDIA GeForce RTX 5090 32GB32 GiBCabe66.25
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBNão cabe27.21
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBNão cabe24.84
AMD Radeon RX 7900 XTX 24GB24 GiBCabe35.49
NVIDIA A100 80GB PCIe80 GiBCabe71.54
Apple Silicon M3 Max (128GB unified memory)128 GiBCabe12.61
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCabe25.23
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCabe67.06

Fórmulas e premissas

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Metodologia para VRAM, memória unificada e offload RAM

  1. Memória de pesos = parâmetros residentes × bits efetivos / 8 (GiB).
  2. Em MoE, residência de pesos segue total params; active params ajuda na estimativa de throughput.
  3. KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  4. Overhead inclui fragmentação, buffers de runtime e reservas do framework.
  5. tokens/sec é uma estimativa direcional baseada em largura de banda.
  6. Offload CPU/RAM reduz VRAM, mas geralmente reduz desempenho.
  7. Memória unificada de Mac é tratada como alvo de primeira classe.

FAQ

Quão precisas são as estimativas?

São estimativas para planejamento. Separamos pesos, KV cache e overhead para deixar as premissas explícitas.

Suporta modelos MoE?

Sim. Fit de memória usa total params; estimativa de tokens/sec usa principalmente active params.

Dá para adicionar modelos novos rápido?

Sim. Há um script que lê config.json do Hugging Face e gera entradas tipadas.