LLMRAM

2× NVIDIA GeForce RTX 4090 (aggregate): was läuft lokal?

Wenn Sie nach „2× NVIDIA GeForce RTX 4090 (aggregate) was kann es lokal ausführen“ suchen, finden Sie hier eine praktische Einschätzung auf Basis transparenter Annahmen.

  • Speichertyp: Dedizierter VRAM
  • Gesamtspeicher: 48 GiB
  • Bandbreite: 1,814 GB/s
  • Planungshinweis: Bei MoE/Multimodal bitte zusätzliche Sicherheitsreserve einplanen.

Modell-Fit-Tabelle auf 2× NVIDIA GeForce RTX 4090 (aggregate)

Annahme: Standard-Kontext/Batch und Q4_K_M für jedes Modell.

ModellGeschätzte GesamtsummeUrteiltok/s (grob)Empf. Quantisierung
Qwen 3.8 27B20.91 GiBPasst79.45int8
Qwen 3.8 Flash Next 125B78.66 GiBPasst nicht357.54q2_k
MiniMax H3 33B22.45 GiBPasst65.01int8
Qwen Image 2.15.38 GiBPasst306.46fp16
Kimi K31,823.65 GiBPasst nicht20.63Kein Fit
GLM 5.3 (Flash)215.7 GiBPasst nicht119.18Kein Fit
DeepSeek V4.1 Flash334.25 GiBPasst nicht134.08Kein Fit
MiMo V2.6 Pro RL625.89 GiBPasst nicht51.08Kein Fit
Bonsai 2 27B21.13 GiBPasst78.41int8
Mistral 7B Instruct v0.35.83 GiBPasst306.46fp16

Kurzantwort: Was kann 2× NVIDIA GeForce RTX 4090 (aggregate)?

2× NVIDIA GeForce RTX 4090 (aggregate) kann im Basisprofil 5 von 10 Modellen ausführen.

Bei MoE/Multimodal bitte zusätzliche Sicherheitsreserve einplanen.

FAQ

Was kann 2× NVIDIA GeForce RTX 4090 (aggregate) lokal ausführen?

Nutzen Sie die Q4_K_M-Baseline als erste Einschätzung. Für lange Kontexte oder multimodale Pipelines sollte zusätzlicher Puffer eingeplant werden.

Sind CPU/RAM-Offload-Szenarien enthalten?

Die Tabelle zeigt den Baseline-Fit. Mit partiellem Offload lassen sich größere Modelle laden, meist mit weniger Durchsatz.

Wie ist Unified Memory auf Macs zu bewerten?

Unified Memory wird als gleichwertiges Ziel modelliert. Die Reaktionsgeschwindigkeit hängt trotzdem stark von Bandbreite und Runtime ab.

Quelle und Verifikation

Hardware-Spezifikation: Derived from two RTX 4090 cards (aggregate estimate) (abgerufen 2026-10-06).