LLMRAM

Guía del modelo

MiniMax H3 33B requisitos de VRAM, compatibilidad GGUF y despliegue local

Si buscas "minimax h3 requirements", probablemente quieres saber si MiniMax H3 33B es viable en tu hardware local. Aquí separamos pesos, caché KV y overhead de runtime para decidir con criterio.

MiniMax H3 33B puede configurarse hasta alrededor de 262,144 tokens en ajustes publicados, por lo que la estrategia de contexto importa tanto como la de cuantización.

Estado de verificación: Verificación parcial. Fuentes obtenidas el 2026-10-06.

Calculadora VRAM / RAM

Compara escenarios de VRAM dedicada, memoria unificada de Apple y offload CPU/RAM.

ID de Hugging Face / parámetros personalizados (opcional)

Si el repo no es conocido, se usarán tus valores como estimación.

Memoria por cuantización
QuantPesosKVOverheadTotal
FP16 / BF1661.47 GiB2 GiB4.35 GiB67.82 GiB
INT8 / Q8_031.5 GiB2 GiB3.18 GiB36.68 GiB
Q6_K24.39 GiB2 GiB2.86 GiB29.25 GiB
Q5_K_M20.94 GiB2 GiB2.75 GiB25.69 GiB
Q4_K_M17.67 GiB2 GiB2.78 GiB22.45 GiB
Q3_K_M / Q313.45 GiB2 GiB2.54 GiB17.99 GiB
Q2_K / Q29.6 GiB2 GiB2.2 GiB13.8 GiB
Compatible / no compatible por hardware
HardwareMemoriaVeredictotok/s est.
NVIDIA GeForce RTX 4090 24GB24 GiBCompatible36.12
NVIDIA GeForce RTX 5090 32GB32 GiBCompatible64.22
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBNo compatible26.38
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBNo compatible24.08
AMD Radeon RX 7900 XTX 24GB24 GiBCompatible34.4
NVIDIA A100 80GB PCIe80 GiBCompatible69.34
Apple Silicon M3 Max (128GB unified memory)128 GiBCompatible12.23
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCompatible24.45
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCompatible65.01

Fórmulas y supuestos

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

MiniMax H3 33B VRAM / RAM por cuantización

Vista base con contexto y batch por defecto del modelo.

QuantPesosKVOverheadTotal
FP16 / BF1661.47 GiB2 GiB4.35 GiB67.82 GiB
INT8 / Q8_031.5 GiB2 GiB3.18 GiB36.68 GiB
Q6_K24.39 GiB2 GiB2.86 GiB29.25 GiB
Q5_K_M20.94 GiB2 GiB2.75 GiB25.69 GiB
Q4_K_M17.67 GiB2 GiB2.78 GiB22.45 GiB
Q3_K_M / Q313.45 GiB2 GiB2.54 GiB17.99 GiB
Q2_K / Q29.6 GiB2 GiB2.2 GiB13.8 GiB

Qué GPUs y Macs pueden ejecutar MiniMax H3 33B?

Baseline con Q4_K_M y valores por defecto. tok/s es una estimación por ancho de banda.

NVIDIA GeForce RTX 4090 24GB

Compatible (1.55 GiB)

Estimado 36.12 tokens/s

Cuantización recomendada: q4_k_m

NVIDIA GeForce RTX 5090 32GB

Compatible (9.55 GiB)

Estimado 64.22 tokens/s

Cuantización recomendada: q6_k

NVIDIA GeForce RTX 4080 SUPER 16GB

No compatible (-6.45 GiB)

Estimado 26.38 tokens/s

Cuantización recomendada: q2_k

NVIDIA GeForce RTX 4070 Ti SUPER 16GB

No compatible (-6.45 GiB)

Estimado 24.08 tokens/s

Cuantización recomendada: q2_k

AMD Radeon RX 7900 XTX 24GB

Compatible (1.55 GiB)

Estimado 34.4 tokens/s

Cuantización recomendada: q4_k_m

NVIDIA A100 80GB PCIe

Compatible (57.55 GiB)

Estimado 69.34 tokens/s

Cuantización recomendada: fp16

Apple Silicon M3 Max (128GB unified memory)

Compatible (105.55 GiB)

Estimado 12.23 tokens/s

Cuantización recomendada: fp16

Apple Silicon M2 Ultra (192GB unified memory)

Compatible (169.55 GiB)

Estimado 24.45 tokens/s

Cuantización recomendada: fp16

2× NVIDIA GeForce RTX 4090 (aggregate)

Compatible (25.55 GiB)

Estimado 65.01 tokens/s

Cuantización recomendada: int8

Dispositivos que cumplen la baseline: NVIDIA GeForce RTX 4090 24GB, NVIDIA GeForce RTX 5090 32GB, AMD Radeon RX 7900 XTX 24GB, NVIDIA A100 80GB PCIe, Apple Silicon M3 Max (128GB unified memory), Apple Silicon M2 Ultra (192GB unified memory), 2× NVIDIA GeForce RTX 4090 (aggregate).

Snippets de despliegue para MiniMax H3 33B

vLLM

vllm serve MiniMaxAI/MiniMax-H3 --max-model-len 8192 --limit-mm-per-prompt image=2,video=1 --gpu-memory-utilization 0.9

ComfyUI

Use ComfyUI with the MiniMax H3 pipeline nodes for video/image workflows; reserve extra VRAM for VAE and frame processing.

Nota de offload CPU/RAM: mover capas a RAM del sistema puede habilitar carga con menos VRAM, pero normalmente reduce rendimiento.

MiniMax H3 33B guía en profundidad

Panorama de VRAM y RAM para MiniMax H3 33B

Quien busca « minimax h3 requirements » suele necesitar una decisión rápida y fiable para correr el modelo en local. Por eso separamos pesos residentes, KV cache y overhead.

En MiniMax H3 33B, los campos de arquitectura mandan: capas, KV heads y head_dim. En MoE, la residencia suele seguir total params y el rendimiento por token active params.

Cómo cambia la memoria de MiniMax H3 33B según la cuantización

La cuantización es el ajuste más influyente. Q4_K_M suele ser el punto de partida; Q5/Q6 para más calidad; Q3/Q2 para presupuestos de memoria muy ajustados.

Longitud de contexto, caché KV y crecimiento real de memoria

Al crecer el contexto, el KV cache domina el consumo. En producción, un contexto moderado y estable suele ser mejor que forzar el máximo desde el inicio.

Estrategia de ajuste en VRAM de GPU y memoria unificada de Mac

Para hardware, combina capacidad y ancho de banda: capacidad para “cabe/no cabe”, ancho de banda para experiencia interactiva.

Flujo de despliegue local (Ollama, llama.cpp, vLLM, ComfyUI)

Ollama acelera pruebas, llama.cpp da control fino de offload, vLLM encaja mejor en APIs concurrentes. En imagen/vídeo añade memoria de VAE y resolución.

Solución de OOM y rendimiento inestable

Si aparece OOM, empieza con un perfil mínimo y escala carga gradualmente. El offload CPU/RAM puede ayudar a cargar, con coste de latencia y throughput.

Cómo elegir la configuración de MiniMax H3 33B para uso real

Para el ajuste final, usa tus prompts y objetivos de calidad reales. Un perfil con margen operativo suele ser más fiable que exprimir una configuración al límite.

FAQ: MiniMax H3 33B

¿Cuánta memoria necesita MiniMax H3 33B en la práctica?

Depende de la cuantización, el contexto y el overhead de runtime. Añade un margen de 10–20%.

¿Qué priorizar para MiniMax H3 33B: VRAM, memoria unificada u offload CPU/RAM?

Primero asegura residencia estable; luego optimiza rendimiento. El offload ayuda a encajar, pero suele bajar velocidad.

¿Con qué cuantización empezar para MiniMax H3 33B?

Q4_K_M suele ser un punto de partida práctico.

Fuentes de datos y notas de verificación

Model card describes a 33B dense omni transformer. Public config file primarily exposes text encoder and multimodal components.

Enlaces internos