Guia do modelo
MiniMax H3 33B requisitos de VRAM, compatibilidade GGUF e deploy local
Se você pesquisou "minimax h3 requirements", provavelmente quer saber se MiniMax H3 33B é viável no seu hardware local. Aqui dividimos o cálculo em pesos, cache KV e overhead de runtime para orientar a decisão.
MiniMax H3 33B pode ser configurado para cerca de 262,144 tokens nas configurações públicas, então estratégia de contexto importa tanto quanto a de quantização.
Status de verificação: Parcialmente verificado. Fontes coletadas em 2026-10-06.
Calculadora de VRAM / RAM
Compare cenários com VRAM dedicada, memória unificada da Apple e offload CPU/RAM.
ID do Hugging Face / parâmetros customizados (opcional)
Se o repo for desconhecido, a calculadora usa seus valores como estimativa.
| Quant | Pesos | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 61.47 GiB | 2 GiB | 4.35 GiB | 67.82 GiB |
| INT8 / Q8_0 | 31.5 GiB | 2 GiB | 3.18 GiB | 36.68 GiB |
| Q6_K | 24.39 GiB | 2 GiB | 2.86 GiB | 29.25 GiB |
| Q5_K_M | 20.94 GiB | 2 GiB | 2.75 GiB | 25.69 GiB |
| Q4_K_M | 17.67 GiB | 2 GiB | 2.78 GiB | 22.45 GiB |
| Q3_K_M / Q3 | 13.45 GiB | 2 GiB | 2.54 GiB | 17.99 GiB |
| Q2_K / Q2 | 9.6 GiB | 2 GiB | 2.2 GiB | 13.8 GiB |
| Hardware | Memória | Resultado | tok/s est. |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Cabe | 36.12 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Cabe | 64.22 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | Não cabe | 26.38 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | Não cabe | 24.08 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Cabe | 34.4 |
| NVIDIA A100 80GB PCIe | 80 GiB | Cabe | 69.34 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Cabe | 12.23 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Cabe | 24.45 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Cabe | 65.01 |
Fórmulas e premissas
- Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
- KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
- Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
- Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
- CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
- When config values are unavailable, fallback defaults are used and flagged as estimated on the page.
MiniMax H3 33B VRAM / RAM por quantização
Visão padrão com contexto e batch de referência.
| Quant | Pesos | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 61.47 GiB | 2 GiB | 4.35 GiB | 67.82 GiB |
| INT8 / Q8_0 | 31.5 GiB | 2 GiB | 3.18 GiB | 36.68 GiB |
| Q6_K | 24.39 GiB | 2 GiB | 2.86 GiB | 29.25 GiB |
| Q5_K_M | 20.94 GiB | 2 GiB | 2.75 GiB | 25.69 GiB |
| Q4_K_M | 17.67 GiB | 2 GiB | 2.78 GiB | 22.45 GiB |
| Q3_K_M / Q3 | 13.45 GiB | 2 GiB | 2.54 GiB | 17.99 GiB |
| Q2_K / Q2 | 9.6 GiB | 2 GiB | 2.2 GiB | 13.8 GiB |
Quais GPUs e Macs rodam MiniMax H3 33B?
Baseline com Q4_K_M e valores padrão. tok/s é estimativa por largura de banda.
NVIDIA GeForce RTX 4090 24GB
Cabe (1.55 GiB)
Estimado 36.12 tokens/s
Quantização recomendada: q4_k_m
NVIDIA GeForce RTX 5090 32GB
Cabe (9.55 GiB)
Estimado 64.22 tokens/s
Quantização recomendada: q6_k
NVIDIA GeForce RTX 4080 SUPER 16GB
Não cabe (-6.45 GiB)
Estimado 26.38 tokens/s
Quantização recomendada: q2_k
NVIDIA GeForce RTX 4070 Ti SUPER 16GB
Não cabe (-6.45 GiB)
Estimado 24.08 tokens/s
Quantização recomendada: q2_k
AMD Radeon RX 7900 XTX 24GB
Cabe (1.55 GiB)
Estimado 34.4 tokens/s
Quantização recomendada: q4_k_m
NVIDIA A100 80GB PCIe
Cabe (57.55 GiB)
Estimado 69.34 tokens/s
Quantização recomendada: fp16
Apple Silicon M3 Max (128GB unified memory)
Cabe (105.55 GiB)
Estimado 12.23 tokens/s
Quantização recomendada: fp16
Apple Silicon M2 Ultra (192GB unified memory)
Cabe (169.55 GiB)
Estimado 24.45 tokens/s
Quantização recomendada: fp16
2× NVIDIA GeForce RTX 4090 (aggregate)
Cabe (25.55 GiB)
Estimado 65.01 tokens/s
Quantização recomendada: int8
Dispositivos que passam no baseline: NVIDIA GeForce RTX 4090 24GB, NVIDIA GeForce RTX 5090 32GB, AMD Radeon RX 7900 XTX 24GB, NVIDIA A100 80GB PCIe, Apple Silicon M3 Max (128GB unified memory), Apple Silicon M2 Ultra (192GB unified memory), 2× NVIDIA GeForce RTX 4090 (aggregate).
Snippets de deploy para MiniMax H3 33B
vLLM
vllm serve MiniMaxAI/MiniMax-H3 --max-model-len 8192 --limit-mm-per-prompt image=2,video=1 --gpu-memory-utilization 0.9
ComfyUI
Use ComfyUI with the MiniMax H3 pipeline nodes for video/image workflows; reserve extra VRAM for VAE and frame processing.
Offload CPU/RAM: mover camadas para RAM do sistema pode viabilizar o carregamento com menos VRAM, mas tende a reduzir o throughput.
MiniMax H3 33B guia aprofundado
Visão geral de VRAM e RAM para MiniMax H3 33B
Quem pesquisa “minimax h3 requirements” geralmente quer decidir rápido se o modelo é viável localmente. Esta página separa pesos residentes, cache KV e overhead de runtime.
No MiniMax H3 33B, campos de arquitetura como número de camadas, cabeças KV e head_dim mudam bastante o comportamento de memória. Em MoE, fit de memória segue total params; throughput por token segue active params.
Como a quantização muda a memória necessária em MiniMax H3 33B
Quantização é o principal ajuste prático. Q4_K_M costuma ser o início mais seguro; Q5/Q6 para qualidade melhor; Q3/Q2 para limites rígidos de memória.
Comprimento de contexto, cache KV e crescimento real de memória
Ao aumentar contexto, o cache KV cresce rápido e pode dominar o consumo. Em produção, um contexto moderado e estável costuma ser mais confiável.
Estratégia de fit em VRAM de GPU e memória unificada de Mac
Na escolha de hardware, capacidade e largura de banda são complementares: capacidade para caber, banda para responsividade.
Fluxo de deploy local (Ollama, llama.cpp, vLLM, ComfyUI)
Ollama facilita testes rápidos, llama.cpp oferece controle fino de offload, e vLLM tende a escalar melhor em APIs concorrentes. Para imagem/vídeo, considere memória extra de VAE e resolução.
Diagnóstico de OOM e throughput instável
Se ocorrer OOM, comece no perfil mínimo e aumente carga gradualmente. Offload CPU/RAM pode viabilizar o carregamento, com custo de latência e throughput.
Como escolher a configuração ideal de MiniMax H3 33B
Para definir a configuração final, valide com prompts e metas reais de qualidade. Um perfil com folga operacional costuma ser mais estável do que operar no limite de memória.
FAQ: MiniMax H3 33B
Quanta memória MiniMax H3 33B precisa na prática?
Depende de quantização, contexto e overhead de runtime. Reserve mais 10–20% de margem.
Para MiniMax H3 33B, devo priorizar VRAM, memória unificada ou offload CPU/RAM?
Garanta primeiro residência estável; depois otimize throughput. Offload ajuda a caber, mas tende a reduzir velocidade.
Com qual quantização começar em MiniMax H3 33B?
Q4_K_M costuma ser um começo prático.
Fontes de dados e notas de verificação
- Hugging Face repository (coletado 2026-10-06)
- Text encoder config used for architecture fields (coletado 2026-10-06)
Model card describes a 33B dense omni transformer. Public config file primarily exposes text encoder and multimodal components.