LLMRAM

モデルガイド

MiniMax H3 33B VRAM要件・GGUF互換性・ローカル運用ガイド

「minimax h3 requirements」を調べているなら、MiniMax H3 33B を自分の環境で現実的に運用できるかを判断したいはずです。このページでは重み、KVキャッシュ、ランタイムオーバーヘッドを分けて示します。

MiniMax H3 33B は公開設定でおよそ 262,144 tokens まで扱えるため、量子化だけでなくコンテキスト設計も重要です。

検証ステータス: 一部検証済み. 参照スナップショット取得日: 2026-10-06。

VRAM / RAM 計算ツール

GPU VRAM、Apple統合メモリ、CPU/RAMオフロードを想定して、モデル適合性を比較できます。

カスタム Hugging Face モデルID / パラメータ(任意)

未知のrepo idの場合は手入力値で推定計算します。

量子化ごとのメモリ
量子化重みKVOverhead合計
FP16 / BF1661.47 GiB2 GiB4.35 GiB67.82 GiB
INT8 / Q8_031.5 GiB2 GiB3.18 GiB36.68 GiB
Q6_K24.39 GiB2 GiB2.86 GiB29.25 GiB
Q5_K_M20.94 GiB2 GiB2.75 GiB25.69 GiB
Q4_K_M17.67 GiB2 GiB2.78 GiB22.45 GiB
Q3_K_M / Q313.45 GiB2 GiB2.54 GiB17.99 GiB
Q2_K / Q29.6 GiB2 GiB2.2 GiB13.8 GiB
ハードウェアごとの適合
ハードウェアメモリ判定推定 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB実行可能36.12
NVIDIA GeForce RTX 5090 32GB32 GiB実行可能64.22
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB実行不可26.38
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB実行不可24.08
AMD Radeon RX 7900 XTX 24GB24 GiB実行可能34.4
NVIDIA A100 80GB PCIe80 GiB実行可能69.34
Apple Silicon M3 Max (128GB unified memory)128 GiB実行可能12.23
Apple Silicon M2 Ultra (192GB unified memory)192 GiB実行可能24.45
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB実行可能65.01

計算式と前提

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

MiniMax H3 33B 量子化ごとのVRAM / RAM要件

既定はモデルの標準 context/batch。より重い条件は計算ツールで調整してください。

量子化重みKVOverhead合計
FP16 / BF1661.47 GiB2 GiB4.35 GiB67.82 GiB
INT8 / Q8_031.5 GiB2 GiB3.18 GiB36.68 GiB
Q6_K24.39 GiB2 GiB2.86 GiB29.25 GiB
Q5_K_M20.94 GiB2 GiB2.75 GiB25.69 GiB
Q4_K_M17.67 GiB2 GiB2.78 GiB22.45 GiB
Q3_K_M / Q313.45 GiB2 GiB2.54 GiB17.99 GiB
Q2_K / Q29.6 GiB2 GiB2.2 GiB13.8 GiB

どのGPU/Macで MiniMax H3 33B?

基準判定は Q4_K_M + 既定 context/batch。tok/s は帯域幅ベースの概算です。

NVIDIA GeForce RTX 4090 24GB

実行可能 (1.55 GiB)

推定 36.12 tokens/s

推奨量子化: q4_k_m

NVIDIA GeForce RTX 5090 32GB

実行可能 (9.55 GiB)

推定 64.22 tokens/s

推奨量子化: q6_k

NVIDIA GeForce RTX 4080 SUPER 16GB

実行不可 (-6.45 GiB)

推定 26.38 tokens/s

推奨量子化: q2_k

NVIDIA GeForce RTX 4070 Ti SUPER 16GB

実行不可 (-6.45 GiB)

推定 24.08 tokens/s

推奨量子化: q2_k

AMD Radeon RX 7900 XTX 24GB

実行可能 (1.55 GiB)

推定 34.4 tokens/s

推奨量子化: q4_k_m

NVIDIA A100 80GB PCIe

実行可能 (57.55 GiB)

推定 69.34 tokens/s

推奨量子化: fp16

Apple Silicon M3 Max (128GB unified memory)

実行可能 (105.55 GiB)

推定 12.23 tokens/s

推奨量子化: fp16

Apple Silicon M2 Ultra (192GB unified memory)

実行可能 (169.55 GiB)

推定 24.45 tokens/s

推奨量子化: fp16

2× NVIDIA GeForce RTX 4090 (aggregate)

実行可能 (25.55 GiB)

推定 65.01 tokens/s

推奨量子化: int8

基準条件で実行可能なデバイス: NVIDIA GeForce RTX 4090 24GB, NVIDIA GeForce RTX 5090 32GB, AMD Radeon RX 7900 XTX 24GB, NVIDIA A100 80GB PCIe, Apple Silicon M3 Max (128GB unified memory), Apple Silicon M2 Ultra (192GB unified memory), 2× NVIDIA GeForce RTX 4090 (aggregate).

デプロイスニペット: MiniMax H3 33B

vLLM

vllm serve MiniMaxAI/MiniMax-H3 --max-model-len 8192 --limit-mm-per-prompt image=2,video=1 --gpu-memory-utilization 0.9

ComfyUI

Use ComfyUI with the MiniMax H3 pipeline nodes for video/image workflows; reserve extra VRAM for VAE and frame processing.

CPU/RAMオフロード: llama.cpp などで一部レイヤーをシステムRAMに逃がせますが、速度低下が発生しやすいです。

MiniMax H3 33B 詳細解説

MiniMax H3 33B のVRAM/RAM計画の全体像

「minimax h3 requirements」を調べる人の多くは、ローカル運用が現実的かどうかを短時間で判断したいはずです。本ページでは重み常駐、KVキャッシュ、ランタイムオーバーヘッドを分けて提示します。

MiniMax H3 33B はアーキテクチャ特性(層数、KVヘッド、head_dim)で必要メモリが大きく変わります。MoEの場合、常駐メモリは total params 側、デコード効率は active params 側で見るのが実務的です。

量子化で MiniMax H3 33B の必要メモリはどう変わるか

量子化は最も効く調整項目です。Q4_K_Mを起点に、品質要件が高ければQ5/Q6へ、まず動作確認を優先するならQ3以下へ段階的に下げるのが安全です。

コンテキスト長・KVキャッシュ・実運用でのメモリ増加

コンテキスト長はメモリ消費を急増させます。最初から最大値を狙うより、実プロンプトで安定する長さを基準にし、必要な場面だけ拡張する方が失敗が少ないです。

GPU VRAM と Mac統合メモリの適合戦略

ハードウェアは容量と帯域の両方で評価してください。容量は「載るか」、帯域は「使って気持ちよい速度か」を決めます。

ローカル運用フロー(Ollama / llama.cpp / vLLM / ComfyUI)

Ollamaは導入が速く、llama.cppはオフロード制御が柔軟、vLLMはAPI運用向けです。画像/動画系はVAEや解像度による追加メモリも見積もる必要があります。

OOM とスループット不安定時の切り分け

OOM時は最小条件で再現→段階的に負荷増加が基本です。VRAM不足時はCPU/RAMオフロードで回避可能ですが、遅延とスループット低下は前提として見込んでください。

MiniMax H3 33B の設定を実運用に合わせて選ぶ方法

最終的な設定は実ワークロードで決めるのが安全です。許容品質を先に定義し、安定して余裕が残る量子化を選ぶ方が、限界ギリギリ構成より再現性が高くなります。

FAQ: MiniMax H3 33B

MiniMax H3 33B は実際にどれくらいのメモリが必要ですか?

量子化・コンテキスト長・ランタイムオーバーヘッドで変わります。表の値に加えて10〜20%の余裕を推奨します。

MiniMax H3 33B では VRAM と統合メモリ、CPU/RAMオフロードのどれを優先すべきですか?

まず安定して常駐できる構成を確保し、その後に速度を最適化するのが安全です。

MiniMax H3 33B の初期量子化は何がよいですか?

多くのケースで Q4_K_M が出発点として実用的です。

データソースと検証メモ

Model card describes a 33B dense omni transformer. Public config file primarily exposes text encoder and multimodal components.

内部リンク