LLMRAM

NVIDIA GeForce RTX 5090 32GB: ローカルAIで何が動く?

“NVIDIA GeForce RTX 5090 32GB で何が動くか” を調べている方向けに、現実的な判断材料を示します。既定Q4_K_Mで主要モデルを比較し、適合可否を素早く把握できます。

  • メモリ種別: 専用VRAM
  • 総メモリ: 32 GiB
  • 帯域幅: 1,792 GB/s
  • 計画のヒント: MoE/マルチモーダルはランタイム差が大きいため、余裕を持った見積りを推奨します。

NVIDIA GeForce RTX 5090 32GB ローカルAIで何が動く?

前提: 各モデルは既定 context/batch + Q4_K_M。詳細チューニングはモデルページで確認してください。

モデル推定合計判定tok/s概算推奨量子化
Qwen 3.8 27B20.91 GiB実行可能78.49q6_k
Qwen 3.8 Flash Next 125B78.66 GiB実行不可353.21適合なし
MiniMax H3 33B22.45 GiB実行可能64.22q6_k
Qwen Image 2.15.38 GiB実行可能302.75fp16
Kimi K31,823.65 GiB実行不可20.38適合なし
GLM 5.3 (Flash)215.7 GiB実行不可117.74適合なし
DeepSeek V4.1 Flash334.25 GiB実行不可132.45適合なし
MiMo V2.6 Pro RL625.89 GiB実行不可50.46適合なし
Bonsai 2 27B21.13 GiB実行可能77.46q6_k
Mistral 7B Instruct v0.35.83 GiB実行可能302.75fp16

結論: NVIDIA GeForce RTX 5090 32GB?

NVIDIA GeForce RTX 5090 32GB は既定Q4_K_Mで 10件中 5件を実行可能です。非適合モデルには低ビット候補を提示します。

MoE/マルチモーダルはランタイム差が大きいため、余裕を持った見積りを推奨します。

よくある質問

NVIDIA GeForce RTX 5090 32GB でローカル実行できるモデルは?

まずQ4_K_Mの基準表で適合可否を確認し、長文脈やマルチモーダル用途では追加余裕を見込んでください。

CPU/RAMオフロードは反映されていますか?

表は基本的に常駐前提です。CPU/RAMオフロードで読み込める範囲は広がりますが、速度低下が起きやすいです。

Mac統合メモリはどう評価すべきですか?

統合メモリは一次対象として扱っていますが、体感速度は帯域幅と実装品質にも左右されます。

ソースと検証

ハードウェア仕様ソース: NVIDIA product page (取得日 2026-10-06).