LLMRAM

2× NVIDIA GeForce RTX 4090 (aggregate): 本地 AI 能跑什么?

如果你搜索“2× NVIDIA GeForce RTX 4090 (aggregate) 能跑什么”,这里给你一个可执行的答案。我们以默认 Q4_K_M 基线评估一组主流开源模型,快速判断哪些能跑,哪些需要更低量化或更大内存。

  • 内存类型: 独立显存
  • 总内存: 48 GiB
  • 带宽: 1,814 GB/s
  • 规划提示: 对于 MoE 与多模态模型,请将此结果作为第一轮规划,并预留额外运行时余量。

在 2× NVIDIA GeForce RTX 4090 (aggregate)

基线假设:每个模型使用自身默认 context 与 batch,并采用 Q4_K_M。更细粒度场景请进入对应模型页。

模型估算总内存结论粗略 tok/s推荐量化
Qwen 3.8 27B20.91 GiB可运行79.45int8
Qwen 3.8 Flash Next 125B78.66 GiB不可运行357.54q2_k
MiniMax H3 33B22.45 GiB可运行65.01int8
Qwen Image 2.15.38 GiB可运行306.46fp16
Kimi K31,823.65 GiB不可运行20.63无可运行量化
GLM 5.3 (Flash)215.7 GiB不可运行119.18无可运行量化
DeepSeek V4.1 Flash334.25 GiB不可运行134.08无可运行量化
MiMo V2.6 Pro RL625.89 GiB不可运行51.08无可运行量化
Bonsai 2 27B21.13 GiB可运行78.41int8
Mistral 7B Instruct v0.35.83 GiB可运行306.46fp16

快速结论: 2× NVIDIA GeForce RTX 4090 (aggregate)?

2× NVIDIA GeForce RTX 4090 (aggregate) 在默认 Q4_K_M 基线下可运行 5/10 个追踪模型。若不满足,表格会给出可选的更低量化建议。

对于 MoE 与多模态模型,请将此结果作为第一轮规划,并预留额外运行时余量。

常见问题

2× NVIDIA GeForce RTX 4090 (aggregate) 本地能跑哪些模型?

先用 Q4_K_M 基线表做第一轮筛选;如果你需要更长 context 或多模态流程,建议额外预留内存余量。

这些结果包含 CPU/RAM offload 吗?

表格默认按内存驻留基线估算。通过部分 offload 往往能加载更大模型,但吞吐通常会下降。

这里如何理解 Mac 统一内存?

统一内存是本页的一等目标。容量能提升可运行性,但交互速度仍受带宽与运行时内核影响。

来源与核验

硬件参数来源: Derived from two RTX 4090 cards (aggregate estimate) (抓取日期 2026-10-06).