LLMRAM

LLMRAM: AI-Modell VRAM- & RAM-Rechner

Mit diesem Rechner klären Sie früh, ob ein Modell lokal läuft. Wählen Sie Modell, Quantisierung, Kontextlänge und Batchgröße und vergleichen Sie die Eignung über NVIDIA, AMD, Apple Silicon Unified Memory und CPU/RAM-Offload.

VRAM / RAM Rechner

Vergleichen Sie Eignung für GPU-VRAM, Apple Unified Memory und CPU/RAM-Offload.

Eigenes Hugging Face Modell / Parameter (optional)

Wenn die Repo-ID unbekannt ist, nutzt der Rechner Ihre Werte als Schätzung.

Speicher nach Quantisierung
QuantGewichteKVOverheadGesamt
FP16 / BF1650.29 GiB4 GiB3.74 GiB58.03 GiB
INT8 / Q8_025.77 GiB4 GiB2.78 GiB32.56 GiB
Q6_K19.96 GiB4 GiB2.52 GiB26.48 GiB
Q5_K_M17.13 GiB4 GiB2.43 GiB23.56 GiB
Q4_K_M14.46 GiB4 GiB2.46 GiB20.91 GiB
Q3_K_M / Q311 GiB4 GiB2.26 GiB17.26 GiB
Q2_K / Q27.86 GiB4 GiB1.98 GiB13.84 GiB
Fit/Nicht-Fit je Hardware
HardwareSpeicherUrteilTok/s (geschätzt)
NVIDIA GeForce RTX 4090 24GB24 GiBPasst37.26
NVIDIA GeForce RTX 5090 32GB32 GiBPasst66.25
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBPasst nicht27.21
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBPasst nicht24.84
AMD Radeon RX 7900 XTX 24GB24 GiBPasst35.49
NVIDIA A100 80GB PCIe80 GiBPasst71.54
Apple Silicon M3 Max (128GB unified memory)128 GiBPasst12.61
Apple Silicon M2 Ultra (192GB unified memory)192 GiBPasst25.23
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBPasst67.06

Formeln und Annahmen

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Methodik für VRAM, Unified Memory und RAM-Offload

  1. Gewichtsspeicher = residente Parameter × effektive Bits / 8 (GiB).
  2. Bei MoE: Gewichtsresidenz nach total params, active params primär für Durchsatzschätzung.
  3. KV-Cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  4. Overhead umfasst Fragmentierung, Runtime-Puffer und Framework-Reservierungen.
  5. tokens/sec ist eine bandbreitenbasierte Näherung.
  6. CPU/RAM-Offload kann VRAM sparen, kostet aber meist Latenz/Tempo.
  7. Mac Unified Memory wird als gleichwertiges Ziel betrachtet.

FAQ

Wie genau sind die Schätzungen?

Planungsnahe Schätzwerte, keine Laufzeitgarantie. Annahmen sind transparent in Gewichte, KV und Overhead getrennt.

Werden MoE-Modelle unterstützt?

Ja. Speicher-Fit orientiert sich an total params, Durchsatz eher an active params.

Kann ich neue Modelle schnell ergänzen?

Ja. Ein Script liest Hugging Face config.json und erzeugt einen typisierten Modelleintrag.