NVIDIA GeForce RTX 5090 32GB: was läuft lokal?
Wenn Sie nach „NVIDIA GeForce RTX 5090 32GB was kann es lokal ausführen“ suchen, finden Sie hier eine praktische Einschätzung auf Basis transparenter Annahmen.
- Speichertyp: Dedizierter VRAM
- Gesamtspeicher: 32 GiB
- Bandbreite: 1,792 GB/s
- Planungshinweis: Bei MoE/Multimodal bitte zusätzliche Sicherheitsreserve einplanen.
Modell-Fit-Tabelle auf NVIDIA GeForce RTX 5090 32GB
Annahme: Standard-Kontext/Batch und Q4_K_M für jedes Modell.
| Modell | Geschätzte Gesamtsumme | Urteil | tok/s (grob) | Empf. Quantisierung |
|---|---|---|---|---|
| Qwen 3.8 27B | 20.91 GiB | Passt | 78.49 | q6_k |
| Qwen 3.8 Flash Next 125B | 78.66 GiB | Passt nicht | 353.21 | Kein Fit |
| MiniMax H3 33B | 22.45 GiB | Passt | 64.22 | q6_k |
| Qwen Image 2.1 | 5.38 GiB | Passt | 302.75 | fp16 |
| Kimi K3 | 1,823.65 GiB | Passt nicht | 20.38 | Kein Fit |
| GLM 5.3 (Flash) | 215.7 GiB | Passt nicht | 117.74 | Kein Fit |
| DeepSeek V4.1 Flash | 334.25 GiB | Passt nicht | 132.45 | Kein Fit |
| MiMo V2.6 Pro RL | 625.89 GiB | Passt nicht | 50.46 | Kein Fit |
| Bonsai 2 27B | 21.13 GiB | Passt | 77.46 | q6_k |
| Mistral 7B Instruct v0.3 | 5.83 GiB | Passt | 302.75 | fp16 |
Kurzantwort: Was kann NVIDIA GeForce RTX 5090 32GB?
NVIDIA GeForce RTX 5090 32GB kann im Basisprofil 5 von 10 Modellen ausführen.
Bei MoE/Multimodal bitte zusätzliche Sicherheitsreserve einplanen.
FAQ
Was kann NVIDIA GeForce RTX 5090 32GB lokal ausführen?
Nutzen Sie die Q4_K_M-Baseline als erste Einschätzung. Für lange Kontexte oder multimodale Pipelines sollte zusätzlicher Puffer eingeplant werden.
Sind CPU/RAM-Offload-Szenarien enthalten?
Die Tabelle zeigt den Baseline-Fit. Mit partiellem Offload lassen sich größere Modelle laden, meist mit weniger Durchsatz.
Wie ist Unified Memory auf Macs zu bewerten?
Unified Memory wird als gleichwertiges Ziel modelliert. Die Reaktionsgeschwindigkeit hängt trotzdem stark von Bandbreite und Runtime ab.
Quelle und Verifikation
Hardware-Spezifikation: NVIDIA product page (abgerufen 2026-10-06).