LLMRAM

NVIDIA GeForce RTX 4090 24GB: was läuft lokal?

Wenn Sie nach „NVIDIA GeForce RTX 4090 24GB was kann es lokal ausführen“ suchen, finden Sie hier eine praktische Einschätzung auf Basis transparenter Annahmen.

  • Speichertyp: Dedizierter VRAM
  • Gesamtspeicher: 24 GiB
  • Bandbreite: 1,008 GB/s
  • Planungshinweis: Bei MoE/Multimodal bitte zusätzliche Sicherheitsreserve einplanen.

Modell-Fit-Tabelle auf NVIDIA GeForce RTX 4090 24GB

Annahme: Standard-Kontext/Batch und Q4_K_M für jedes Modell.

ModellGeschätzte GesamtsummeUrteiltok/s (grob)Empf. Quantisierung
Qwen 3.8 27B20.91 GiBPasst44.15q5_k_m
Qwen 3.8 Flash Next 125B78.66 GiBPasst nicht198.68Kein Fit
MiniMax H3 33B22.45 GiBPasst36.12q4_k_m
Qwen Image 2.15.38 GiBPasst170.3fp16
Kimi K31,823.65 GiBPasst nicht11.46Kein Fit
GLM 5.3 (Flash)215.7 GiBPasst nicht66.23Kein Fit
DeepSeek V4.1 Flash334.25 GiBPasst nicht74.5Kein Fit
MiMo V2.6 Pro RL625.89 GiBPasst nicht28.38Kein Fit
Bonsai 2 27B21.13 GiBPasst43.57q5_k_m
Mistral 7B Instruct v0.35.83 GiBPasst170.3fp16

Kurzantwort: Was kann NVIDIA GeForce RTX 4090 24GB?

NVIDIA GeForce RTX 4090 24GB kann im Basisprofil 5 von 10 Modellen ausführen.

Bei MoE/Multimodal bitte zusätzliche Sicherheitsreserve einplanen.

FAQ

Was kann NVIDIA GeForce RTX 4090 24GB lokal ausführen?

Nutzen Sie die Q4_K_M-Baseline als erste Einschätzung. Für lange Kontexte oder multimodale Pipelines sollte zusätzlicher Puffer eingeplant werden.

Sind CPU/RAM-Offload-Szenarien enthalten?

Die Tabelle zeigt den Baseline-Fit. Mit partiellem Offload lassen sich größere Modelle laden, meist mit weniger Durchsatz.

Wie ist Unified Memory auf Macs zu bewerten?

Unified Memory wird als gleichwertiges Ziel modelliert. Die Reaktionsgeschwindigkeit hängt trotzdem stark von Bandbreite und Runtime ab.

Quelle und Verifikation

Hardware-Spezifikation: NVIDIA product page (abgerufen 2026-10-06).