2× NVIDIA GeForce RTX 4090 (aggregate): 本地 AI 能跑什么?
如果你搜索“2× NVIDIA GeForce RTX 4090 (aggregate) 能跑什么”,这里给你一个可执行的答案。我们以默认 Q4_K_M 基线评估一组主流开源模型,快速判断哪些能跑,哪些需要更低量化或更大内存。
- 内存类型: 独立显存
- 总内存: 48 GiB
- 带宽: 1,814 GB/s
- 规划提示: 对于 MoE 与多模态模型,请将此结果作为第一轮规划,并预留额外运行时余量。
在 2× NVIDIA GeForce RTX 4090 (aggregate)
基线假设:每个模型使用自身默认 context 与 batch,并采用 Q4_K_M。更细粒度场景请进入对应模型页。
| 模型 | 估算总内存 | 结论 | 粗略 tok/s | 推荐量化 |
|---|---|---|---|---|
| Qwen 3.8 27B | 20.91 GiB | 可运行 | 79.45 | int8 |
| Qwen 3.8 Flash Next 125B | 78.66 GiB | 不可运行 | 357.54 | q2_k |
| MiniMax H3 33B | 22.45 GiB | 可运行 | 65.01 | int8 |
| Qwen Image 2.1 | 5.38 GiB | 可运行 | 306.46 | fp16 |
| Kimi K3 | 1,823.65 GiB | 不可运行 | 20.63 | 无可运行量化 |
| GLM 5.3 (Flash) | 215.7 GiB | 不可运行 | 119.18 | 无可运行量化 |
| DeepSeek V4.1 Flash | 334.25 GiB | 不可运行 | 134.08 | 无可运行量化 |
| MiMo V2.6 Pro RL | 625.89 GiB | 不可运行 | 51.08 | 无可运行量化 |
| Bonsai 2 27B | 21.13 GiB | 可运行 | 78.41 | int8 |
| Mistral 7B Instruct v0.3 | 5.83 GiB | 可运行 | 306.46 | fp16 |
快速结论: 2× NVIDIA GeForce RTX 4090 (aggregate)?
2× NVIDIA GeForce RTX 4090 (aggregate) 在默认 Q4_K_M 基线下可运行 5/10 个追踪模型。若不满足,表格会给出可选的更低量化建议。
对于 MoE 与多模态模型,请将此结果作为第一轮规划,并预留额外运行时余量。
常见问题
2× NVIDIA GeForce RTX 4090 (aggregate) 本地能跑哪些模型?
先用 Q4_K_M 基线表做第一轮筛选;如果你需要更长 context 或多模态流程,建议额外预留内存余量。
这些结果包含 CPU/RAM offload 吗?
表格默认按内存驻留基线估算。通过部分 offload 往往能加载更大模型,但吞吐通常会下降。
这里如何理解 Mac 统一内存?
统一内存是本页的一等目标。容量能提升可运行性,但交互速度仍受带宽与运行时内核影响。
来源与核验
硬件参数来源: Derived from two RTX 4090 cards (aggregate estimate) (抓取日期 2026-10-06).