見積り精度はどの程度ですか?
計画用途の推定値です。重み・KV・Overhead を分離し、前提を確認しやすくしています。
この計算ツールは「このモデルをローカルで動かせるか?」を事前に判断するためのものです。モデル、量子化、コンテキスト長、バッチを設定し、NVIDIA / AMD / Apple Silicon / CPU-RAMオフロードを横断して適合性を比較できます。
GPU VRAM、Apple統合メモリ、CPU/RAMオフロードを想定して、モデル適合性を比較できます。
未知のrepo idの場合は手入力値で推定計算します。
| 量子化 | 重み | KV | Overhead | 合計 |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 4 GiB | 3.74 GiB | 58.03 GiB |
| INT8 / Q8_0 | 25.77 GiB | 4 GiB | 2.78 GiB | 32.56 GiB |
| Q6_K | 19.96 GiB | 4 GiB | 2.52 GiB | 26.48 GiB |
| Q5_K_M | 17.13 GiB | 4 GiB | 2.43 GiB | 23.56 GiB |
| Q4_K_M | 14.46 GiB | 4 GiB | 2.46 GiB | 20.91 GiB |
| Q3_K_M / Q3 | 11 GiB | 4 GiB | 2.26 GiB | 17.26 GiB |
| Q2_K / Q2 | 7.86 GiB | 4 GiB | 1.98 GiB | 13.84 GiB |
| ハードウェア | メモリ | 判定 | 推定 tok/s |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | 実行可能 | 37.26 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | 実行可能 | 66.25 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | 実行不可 | 27.21 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | 実行不可 | 24.84 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | 実行可能 | 35.49 |
| NVIDIA A100 80GB PCIe | 80 GiB | 実行可能 | 71.54 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | 実行可能 | 12.61 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | 実行可能 | 25.23 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | 実行可能 | 67.06 |
計画用途の推定値です。重み・KV・Overhead を分離し、前提を確認しやすくしています。
はい。常駐メモリは total params、デコード速度見積りは active params を主に使用します。
可能です。Hugging Face の config.json から型付きエントリを生成するスクリプトがあります。