¿Qué tan precisas son las estimaciones?
Son estimaciones para planificación. Separamos pesos, KV cache y overhead para que puedas validar supuestos.
Esta herramienta responde rápido si un modelo puede correr en local. Elige modelo, cuantización, contexto y batch, y compara ajuste en NVIDIA, AMD, Apple Silicon y offload CPU/RAM.
Compara escenarios de VRAM dedicada, memoria unificada de Apple y offload CPU/RAM.
Si el repo no es conocido, se usarán tus valores como estimación.
| Quant | Pesos | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 4 GiB | 3.74 GiB | 58.03 GiB |
| INT8 / Q8_0 | 25.77 GiB | 4 GiB | 2.78 GiB | 32.56 GiB |
| Q6_K | 19.96 GiB | 4 GiB | 2.52 GiB | 26.48 GiB |
| Q5_K_M | 17.13 GiB | 4 GiB | 2.43 GiB | 23.56 GiB |
| Q4_K_M | 14.46 GiB | 4 GiB | 2.46 GiB | 20.91 GiB |
| Q3_K_M / Q3 | 11 GiB | 4 GiB | 2.26 GiB | 17.26 GiB |
| Q2_K / Q2 | 7.86 GiB | 4 GiB | 1.98 GiB | 13.84 GiB |
| Hardware | Memoria | Veredicto | tok/s est. |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Compatible | 37.26 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Compatible | 66.25 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | No compatible | 27.21 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | No compatible | 24.84 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Compatible | 35.49 |
| NVIDIA A100 80GB PCIe | 80 GiB | Compatible | 71.54 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Compatible | 12.61 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Compatible | 25.23 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Compatible | 67.06 |
Son estimaciones para planificación. Separamos pesos, KV cache y overhead para que puedas validar supuestos.
Sí. Para memoria residente manda total params; para tokens/sec usamos principalmente active params.
Sí, con un script que toma config.json de Hugging Face y genera entradas tipadas.