LLMRAM

LLMRAM: AIモデル VRAM / RAM 計算ツール

この計算ツールは「このモデルをローカルで動かせるか?」を事前に判断するためのものです。モデル、量子化、コンテキスト長、バッチを設定し、NVIDIA / AMD / Apple Silicon / CPU-RAMオフロードを横断して適合性を比較できます。

VRAM / RAM 計算ツール

GPU VRAM、Apple統合メモリ、CPU/RAMオフロードを想定して、モデル適合性を比較できます。

カスタム Hugging Face モデルID / パラメータ(任意)

未知のrepo idの場合は手入力値で推定計算します。

量子化ごとのメモリ
量子化重みKVOverhead合計
FP16 / BF1650.29 GiB4 GiB3.74 GiB58.03 GiB
INT8 / Q8_025.77 GiB4 GiB2.78 GiB32.56 GiB
Q6_K19.96 GiB4 GiB2.52 GiB26.48 GiB
Q5_K_M17.13 GiB4 GiB2.43 GiB23.56 GiB
Q4_K_M14.46 GiB4 GiB2.46 GiB20.91 GiB
Q3_K_M / Q311 GiB4 GiB2.26 GiB17.26 GiB
Q2_K / Q27.86 GiB4 GiB1.98 GiB13.84 GiB
ハードウェアごとの適合
ハードウェアメモリ判定推定 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB実行可能37.26
NVIDIA GeForce RTX 5090 32GB32 GiB実行可能66.25
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB実行不可27.21
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB実行不可24.84
AMD Radeon RX 7900 XTX 24GB24 GiB実行可能35.49
NVIDIA A100 80GB PCIe80 GiB実行可能71.54
Apple Silicon M3 Max (128GB unified memory)128 GiB実行可能12.61
Apple Silicon M2 Ultra (192GB unified memory)192 GiB実行可能25.23
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB実行可能67.06

計算式と前提

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

VRAM・統合メモリ・RAMオフロードの計算前提

  1. 重みメモリ = 常駐パラメータ × 実効ビット幅 / 8(GiB)。
  2. MoEでは重み常駐は total params、active params は主にスループット見積りに使用。
  3. KV Cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch。
  4. Overhead には断片化・ランタイムバッファ・フレームワーク予約を含む。
  5. tokens/sec は帯域幅ベースの概算値。
  6. CPU/RAM オフロードはVRAMを節約できるが、遅延とスループットに影響する。
  7. Mac統合メモリも一次ターゲットとして扱う。

よくある質問

見積り精度はどの程度ですか?

計画用途の推定値です。重み・KV・Overhead を分離し、前提を確認しやすくしています。

MoEモデルに対応していますか?

はい。常駐メモリは total params、デコード速度見積りは active params を主に使用します。

新モデルはすぐ追加できますか?

可能です。Hugging Face の config.json から型付きエントリを生成するスクリプトがあります。