Quão precisas são as estimativas?
São estimativas para planejamento. Separamos pesos, KV cache e overhead para deixar as premissas explícitas.
Use esta ferramenta para responder rapidamente se um modelo roda localmente. Defina modelo, quantização, contexto e batch, e compare NVIDIA, AMD, Apple Silicon e offload CPU/RAM.
Compare cenários com VRAM dedicada, memória unificada da Apple e offload CPU/RAM.
Se o repo for desconhecido, a calculadora usa seus valores como estimativa.
| Quant | Pesos | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 4 GiB | 3.74 GiB | 58.03 GiB |
| INT8 / Q8_0 | 25.77 GiB | 4 GiB | 2.78 GiB | 32.56 GiB |
| Q6_K | 19.96 GiB | 4 GiB | 2.52 GiB | 26.48 GiB |
| Q5_K_M | 17.13 GiB | 4 GiB | 2.43 GiB | 23.56 GiB |
| Q4_K_M | 14.46 GiB | 4 GiB | 2.46 GiB | 20.91 GiB |
| Q3_K_M / Q3 | 11 GiB | 4 GiB | 2.26 GiB | 17.26 GiB |
| Q2_K / Q2 | 7.86 GiB | 4 GiB | 1.98 GiB | 13.84 GiB |
| Hardware | Memória | Resultado | tok/s est. |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Cabe | 37.26 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Cabe | 66.25 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | Não cabe | 27.21 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | Não cabe | 24.84 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Cabe | 35.49 |
| NVIDIA A100 80GB PCIe | 80 GiB | Cabe | 71.54 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Cabe | 12.61 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Cabe | 25.23 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Cabe | 67.06 |
São estimativas para planejamento. Separamos pesos, KV cache e overhead para deixar as premissas explícitas.
Sim. Fit de memória usa total params; estimativa de tokens/sec usa principalmente active params.
Sim. Há um script que lê config.json do Hugging Face e gera entradas tipadas.