这个内存估算有多准确?
这是用于规划的估算,不是运行时保证。我们拆分了权重、KV Cache 与 Overhead,方便你核对假设。
用这个 AI 模型显存与内存计算器,先判断“这模型我本地能不能跑”,再决定硬件与部署方案。选择模型、量化、上下文长度和 batch 后,你可以直接比较 NVIDIA、AMD、Apple Silicon 统一内存以及 CPU/RAM offload 方案的可运行性。
选择模型、量化、上下文长度、batch 和目标硬件。结果同时适用于 GPU 显存、Apple 统一内存与 CPU/RAM offload 规划。
若仓库 id 未匹配,计算器会使用你填写的参数并标记为估算值。
| 量化 | 权重 | KV | Overhead | 总计 |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 4 GiB | 3.74 GiB | 58.03 GiB |
| INT8 / Q8_0 | 25.77 GiB | 4 GiB | 2.78 GiB | 32.56 GiB |
| Q6_K | 19.96 GiB | 4 GiB | 2.52 GiB | 26.48 GiB |
| Q5_K_M | 17.13 GiB | 4 GiB | 2.43 GiB | 23.56 GiB |
| Q4_K_M | 14.46 GiB | 4 GiB | 2.46 GiB | 20.91 GiB |
| Q3_K_M / Q3 | 11 GiB | 4 GiB | 2.26 GiB | 17.26 GiB |
| Q2_K / Q2 | 7.86 GiB | 4 GiB | 1.98 GiB | 13.84 GiB |
| 硬件 | 内存 | 结论 | 估算 tok/s |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | 可运行 | 37.26 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | 可运行 | 66.25 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | 不可运行 | 27.21 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | 不可运行 | 24.84 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | 可运行 | 35.49 |
| NVIDIA A100 80GB PCIe | 80 GiB | 可运行 | 71.54 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | 可运行 | 12.61 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | 可运行 | 25.23 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | 可运行 | 67.06 |
这是用于规划的估算,不是运行时保证。我们拆分了权重、KV Cache 与 Overhead,方便你核对假设。
支持。我们分别跟踪 total 与 active 参数:权重驻留看 total,吞吐估算主要参考 active。
可以。仓库内置脚本可抓取 Hugging Face config.json 并生成模型条目,通常几小时内可上线。