LLMRAM

2× NVIDIA GeForce RTX 4090 (aggregate): ローカルAIで何が動く?

“2× NVIDIA GeForce RTX 4090 (aggregate) で何が動くか” を調べている方向けに、現実的な判断材料を示します。既定Q4_K_Mで主要モデルを比較し、適合可否を素早く把握できます。

  • メモリ種別: 専用VRAM
  • 総メモリ: 48 GiB
  • 帯域幅: 1,814 GB/s
  • 計画のヒント: MoE/マルチモーダルはランタイム差が大きいため、余裕を持った見積りを推奨します。

2× NVIDIA GeForce RTX 4090 (aggregate) ローカルAIで何が動く?

前提: 各モデルは既定 context/batch + Q4_K_M。詳細チューニングはモデルページで確認してください。

モデル推定合計判定tok/s概算推奨量子化
Qwen 3.8 27B20.91 GiB実行可能79.45int8
Qwen 3.8 Flash Next 125B78.66 GiB実行不可357.54q2_k
MiniMax H3 33B22.45 GiB実行可能65.01int8
Qwen Image 2.15.38 GiB実行可能306.46fp16
Kimi K31,823.65 GiB実行不可20.63適合なし
GLM 5.3 (Flash)215.7 GiB実行不可119.18適合なし
DeepSeek V4.1 Flash334.25 GiB実行不可134.08適合なし
MiMo V2.6 Pro RL625.89 GiB実行不可51.08適合なし
Bonsai 2 27B21.13 GiB実行可能78.41int8
Mistral 7B Instruct v0.35.83 GiB実行可能306.46fp16

結論: 2× NVIDIA GeForce RTX 4090 (aggregate)?

2× NVIDIA GeForce RTX 4090 (aggregate) は既定Q4_K_Mで 10件中 5件を実行可能です。非適合モデルには低ビット候補を提示します。

MoE/マルチモーダルはランタイム差が大きいため、余裕を持った見積りを推奨します。

よくある質問

2× NVIDIA GeForce RTX 4090 (aggregate) でローカル実行できるモデルは?

まずQ4_K_Mの基準表で適合可否を確認し、長文脈やマルチモーダル用途では追加余裕を見込んでください。

CPU/RAMオフロードは反映されていますか?

表は基本的に常駐前提です。CPU/RAMオフロードで読み込める範囲は広がりますが、速度低下が起きやすいです。

Mac統合メモリはどう評価すべきですか?

統合メモリは一次対象として扱っていますが、体感速度は帯域幅と実装品質にも左右されます。

ソースと検証

ハードウェア仕様ソース: Derived from two RTX 4090 cards (aggregate estimate) (取得日 2026-10-06).