LLMRAM

2× NVIDIA GeForce RTX 4090 (aggregate): ¿qué puede ejecutar en local?

Si buscas “2× NVIDIA GeForce RTX 4090 (aggregate) qué puede ejecutar en local”, aquí tienes una respuesta práctica con supuestos transparentes.

  • Tipo de memoria: VRAM dedicada
  • Memoria total: 48 GiB
  • Ancho de banda: 1,814 GB/s
  • Consejo de planificación: Para MoE y multimodal, reserva margen adicional.

Tabla de ajuste en 2× NVIDIA GeForce RTX 4090 (aggregate)

Supuesto base: contexto/batch por defecto y Q4_K_M en cada modelo.

ModeloTotal estimadoVeredictotok/s estimadosCuantización recomendada
Qwen 3.8 27B20.91 GiBCompatible79.45int8
Qwen 3.8 Flash Next 125B78.66 GiBNo compatible357.54q2_k
MiniMax H3 33B22.45 GiBCompatible65.01int8
Qwen Image 2.15.38 GiBCompatible306.46fp16
Kimi K31,823.65 GiBNo compatible20.63Sin ajuste
GLM 5.3 (Flash)215.7 GiBNo compatible119.18Sin ajuste
DeepSeek V4.1 Flash334.25 GiBNo compatible134.08Sin ajuste
MiMo V2.6 Pro RL625.89 GiBNo compatible51.08Sin ajuste
Bonsai 2 27B21.13 GiBCompatible78.41int8
Mistral 7B Instruct v0.35.83 GiBCompatible306.46fp16

Respuesta rápida: qué puede ejecutar 2× NVIDIA GeForce RTX 4090 (aggregate)?

2× NVIDIA GeForce RTX 4090 (aggregate) puede ejecutar 5 de 10 modelos en la baseline Q4_K_M.

Para MoE y multimodal, reserva margen adicional.

Preguntas frecuentes

¿Qué puede ejecutar 2× NVIDIA GeForce RTX 4090 (aggregate) en local?

Usa la baseline Q4_K_M como primera referencia. Para contexto largo o multimodal, deja margen extra de memoria.

¿Incluye opciones de offload CPU/RAM?

La tabla refleja el comportamiento base en memoria. El offload parcial puede cargar modelos más grandes, normalmente con menor rendimiento.

¿Cómo interpretar la memoria unificada de Mac?

Se trata como objetivo principal. El ajuste mejora con más memoria, pero la respuesta sigue dependiendo del ancho de banda y del runtime.

Fuente y verificación

Fuente de especificaciones: Derived from two RTX 4090 cards (aggregate estimate) (obtenido 2026-10-06).