LLMRAM

LLMRAM:AI 模型显存与内存计算器

用这个 AI 模型显存与内存计算器,先判断“这模型我本地能不能跑”,再决定硬件与部署方案。选择模型、量化、上下文长度和 batch 后,你可以直接比较 NVIDIA、AMD、Apple Silicon 统一内存以及 CPU/RAM offload 方案的可运行性。

显存 / 内存计算器

选择模型、量化、上下文长度、batch 和目标硬件。结果同时适用于 GPU 显存、Apple 统一内存与 CPU/RAM offload 规划。

自定义 Hugging Face 模型 id / 参数(可选)

若仓库 id 未匹配,计算器会使用你填写的参数并标记为估算值。

按量化查看内存
量化权重KVOverhead总计
FP16 / BF1650.29 GiB4 GiB3.74 GiB58.03 GiB
INT8 / Q8_025.77 GiB4 GiB2.78 GiB32.56 GiB
Q6_K19.96 GiB4 GiB2.52 GiB26.48 GiB
Q5_K_M17.13 GiB4 GiB2.43 GiB23.56 GiB
Q4_K_M14.46 GiB4 GiB2.46 GiB20.91 GiB
Q3_K_M / Q311 GiB4 GiB2.26 GiB17.26 GiB
Q2_K / Q27.86 GiB4 GiB1.98 GiB13.84 GiB
按硬件查看可运行性
硬件内存结论估算 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB可运行37.26
NVIDIA GeForce RTX 5090 32GB32 GiB可运行66.25
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB不可运行27.21
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB不可运行24.84
AMD Radeon RX 7900 XTX 24GB24 GiB可运行35.49
NVIDIA A100 80GB PCIe80 GiB可运行71.54
Apple Silicon M3 Max (128GB unified memory)128 GiB可运行12.61
Apple Silicon M2 Ultra (192GB unified memory)192 GiB可运行25.23
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB可运行67.06

公式与假设

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

显存、统一内存与 RAM offload 估算方法

  1. 权重内存 = 驻留参数 × 有效位宽 / 8(换算为 GiB)。
  2. MoE 模型的权重驻留按总参数估算;active 参数主要用于粗略吞吐估算。
  3. KV Cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch。
  4. Overhead 包含内存碎片、运行时缓冲和框架保留。
  5. tokens/sec 基于带宽推导,仅作方向性参考。
  6. CPU/RAM 部分 offload 可降低显存占用,但通常会增加延迟并降低吞吐。
  7. Mac 统一内存作为一等目标,不是仅在 GPU 不够时才考虑的备选项。

常见问题

这个内存估算有多准确?

这是用于规划的估算,不是运行时保证。我们拆分了权重、KV Cache 与 Overhead,方便你核对假设。

支持 MoE 模型吗?

支持。我们分别跟踪 total 与 active 参数:权重驻留看 total,吞吐估算主要参考 active。

新模型能快速加入吗?

可以。仓库内置脚本可抓取 Hugging Face config.json 并生成模型条目,通常几小时内可上线。