LLMRAM

2× NVIDIA GeForce RTX 4090 (aggregate): o que roda localmente?

Se você buscou “2× NVIDIA GeForce RTX 4090 (aggregate) o que roda localmente”, aqui vai uma resposta prática com premissas transparentes.

  • Tipo de memória: VRAM dedicada
  • Memória total: 48 GiB
  • Largura de banda: 1,814 GB/s
  • Dica de planejamento: Para MoE e multimodal, reserve folga extra de memória.

Tabela de compatibilidade em 2× NVIDIA GeForce RTX 4090 (aggregate)

Premissa base: contexto/batch padrão + Q4_K_M para cada modelo.

ModeloTotal estimadoResultadotok/s estimadosQuantização recomendada
Qwen 3.8 27B20.91 GiBCabe79.45int8
Qwen 3.8 Flash Next 125B78.66 GiBNão cabe357.54q2_k
MiniMax H3 33B22.45 GiBCabe65.01int8
Qwen Image 2.15.38 GiBCabe306.46fp16
Kimi K31,823.65 GiBNão cabe20.63Sem ajuste
GLM 5.3 (Flash)215.7 GiBNão cabe119.18Sem ajuste
DeepSeek V4.1 Flash334.25 GiBNão cabe134.08Sem ajuste
MiMo V2.6 Pro RL625.89 GiBNão cabe51.08Sem ajuste
Bonsai 2 27B21.13 GiBCabe78.41int8
Mistral 7B Instruct v0.35.83 GiBCabe306.46fp16

Resposta rápida: o que 2× NVIDIA GeForce RTX 4090 (aggregate)?

2× NVIDIA GeForce RTX 4090 (aggregate) roda 5 de 10 modelos no baseline Q4_K_M.

Para MoE e multimodal, reserve folga extra de memória.

FAQ

O que o 2× NVIDIA GeForce RTX 4090 (aggregate) consegue rodar localmente?

Use a baseline Q4_K_M como primeira triagem. Para contexto longo e multimodal, reserve margem adicional de memória.

Inclui cenários de offload CPU/RAM?

A tabela mostra o comportamento base em memória. Offload parcial pode permitir modelos maiores, normalmente com menor throughput.

Como interpretar memória unificada no Mac?

Ela é tratada como alvo principal. O fit melhora com mais memória, mas a responsividade ainda depende da largura de banda e do runtime.

Fonte e verificação

Fonte das especificações: Derived from two RTX 4090 cards (aggregate estimate) (coletado 2026-10-06).