2× NVIDIA GeForce RTX 4090 (aggregate): ローカルAIで何が動く?
“2× NVIDIA GeForce RTX 4090 (aggregate) で何が動くか” を調べている方向けに、現実的な判断材料を示します。既定Q4_K_Mで主要モデルを比較し、適合可否を素早く把握できます。
- メモリ種別: 専用VRAM
- 総メモリ: 48 GiB
- 帯域幅: 1,814 GB/s
- 計画のヒント: MoE/マルチモーダルはランタイム差が大きいため、余裕を持った見積りを推奨します。
2× NVIDIA GeForce RTX 4090 (aggregate) ローカルAIで何が動く?
前提: 各モデルは既定 context/batch + Q4_K_M。詳細チューニングはモデルページで確認してください。
| モデル | 推定合計 | 判定 | tok/s概算 | 推奨量子化 |
|---|---|---|---|---|
| Qwen 3.8 27B | 20.91 GiB | 実行可能 | 79.45 | int8 |
| Qwen 3.8 Flash Next 125B | 78.66 GiB | 実行不可 | 357.54 | q2_k |
| MiniMax H3 33B | 22.45 GiB | 実行可能 | 65.01 | int8 |
| Qwen Image 2.1 | 5.38 GiB | 実行可能 | 306.46 | fp16 |
| Kimi K3 | 1,823.65 GiB | 実行不可 | 20.63 | 適合なし |
| GLM 5.3 (Flash) | 215.7 GiB | 実行不可 | 119.18 | 適合なし |
| DeepSeek V4.1 Flash | 334.25 GiB | 実行不可 | 134.08 | 適合なし |
| MiMo V2.6 Pro RL | 625.89 GiB | 実行不可 | 51.08 | 適合なし |
| Bonsai 2 27B | 21.13 GiB | 実行可能 | 78.41 | int8 |
| Mistral 7B Instruct v0.3 | 5.83 GiB | 実行可能 | 306.46 | fp16 |
結論: 2× NVIDIA GeForce RTX 4090 (aggregate)?
2× NVIDIA GeForce RTX 4090 (aggregate) は既定Q4_K_Mで 10件中 5件を実行可能です。非適合モデルには低ビット候補を提示します。
MoE/マルチモーダルはランタイム差が大きいため、余裕を持った見積りを推奨します。
よくある質問
2× NVIDIA GeForce RTX 4090 (aggregate) でローカル実行できるモデルは?
まずQ4_K_Mの基準表で適合可否を確認し、長文脈やマルチモーダル用途では追加余裕を見込んでください。
CPU/RAMオフロードは反映されていますか?
表は基本的に常駐前提です。CPU/RAMオフロードで読み込める範囲は広がりますが、速度低下が起きやすいです。
Mac統合メモリはどう評価すべきですか?
統合メモリは一次対象として扱っていますが、体感速度は帯域幅と実装品質にも左右されます。
ソースと検証
ハードウェア仕様ソース: Derived from two RTX 4090 cards (aggregate estimate) (取得日 2026-10-06).