LLMRAM

LLMRAM: calculadora de VRAM y RAM para modelos de IA

Esta herramienta responde rápido si un modelo puede correr en local. Elige modelo, cuantización, contexto y batch, y compara ajuste en NVIDIA, AMD, Apple Silicon y offload CPU/RAM.

Calculadora VRAM / RAM

Compara escenarios de VRAM dedicada, memoria unificada de Apple y offload CPU/RAM.

ID de Hugging Face / parámetros personalizados (opcional)

Si el repo no es conocido, se usarán tus valores como estimación.

Memoria por cuantización
QuantPesosKVOverheadTotal
FP16 / BF1650.29 GiB4 GiB3.74 GiB58.03 GiB
INT8 / Q8_025.77 GiB4 GiB2.78 GiB32.56 GiB
Q6_K19.96 GiB4 GiB2.52 GiB26.48 GiB
Q5_K_M17.13 GiB4 GiB2.43 GiB23.56 GiB
Q4_K_M14.46 GiB4 GiB2.46 GiB20.91 GiB
Q3_K_M / Q311 GiB4 GiB2.26 GiB17.26 GiB
Q2_K / Q27.86 GiB4 GiB1.98 GiB13.84 GiB
Compatible / no compatible por hardware
HardwareMemoriaVeredictotok/s est.
NVIDIA GeForce RTX 4090 24GB24 GiBCompatible37.26
NVIDIA GeForce RTX 5090 32GB32 GiBCompatible66.25
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBNo compatible27.21
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBNo compatible24.84
AMD Radeon RX 7900 XTX 24GB24 GiBCompatible35.49
NVIDIA A100 80GB PCIe80 GiBCompatible71.54
Apple Silicon M3 Max (128GB unified memory)128 GiBCompatible12.61
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCompatible25.23
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCompatible67.06

Fórmulas y supuestos

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Metodología para VRAM, memoria unificada y offload RAM

  1. Memoria de pesos = parámetros residentes × bits efectivos / 8 (GiB).
  2. En MoE, la residencia de pesos usa total params; active params se usa sobre todo para rendimiento.
  3. KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  4. El overhead incluye fragmentación, buffers de runtime y reservas del framework.
  5. tokens/sec es una estimación orientativa basada en ancho de banda.
  6. El offload CPU/RAM reduce VRAM pero suele penalizar latencia y throughput.
  7. La memoria unificada de Mac se trata como objetivo de primera clase.

Preguntas frecuentes

¿Qué tan precisas son las estimaciones?

Son estimaciones para planificación. Separamos pesos, KV cache y overhead para que puedas validar supuestos.

¿Soporta modelos MoE?

Sí. Para memoria residente manda total params; para tokens/sec usamos principalmente active params.

¿Puedo añadir modelos nuevos rápidamente?

Sí, con un script que toma config.json de Hugging Face y genera entradas tipadas.