Wie genau sind die Schätzungen?
Planungsnahe Schätzwerte, keine Laufzeitgarantie. Annahmen sind transparent in Gewichte, KV und Overhead getrennt.
Mit diesem Rechner klären Sie früh, ob ein Modell lokal läuft. Wählen Sie Modell, Quantisierung, Kontextlänge und Batchgröße und vergleichen Sie die Eignung über NVIDIA, AMD, Apple Silicon Unified Memory und CPU/RAM-Offload.
Vergleichen Sie Eignung für GPU-VRAM, Apple Unified Memory und CPU/RAM-Offload.
Wenn die Repo-ID unbekannt ist, nutzt der Rechner Ihre Werte als Schätzung.
| Quant | Gewichte | KV | Overhead | Gesamt |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 4 GiB | 3.74 GiB | 58.03 GiB |
| INT8 / Q8_0 | 25.77 GiB | 4 GiB | 2.78 GiB | 32.56 GiB |
| Q6_K | 19.96 GiB | 4 GiB | 2.52 GiB | 26.48 GiB |
| Q5_K_M | 17.13 GiB | 4 GiB | 2.43 GiB | 23.56 GiB |
| Q4_K_M | 14.46 GiB | 4 GiB | 2.46 GiB | 20.91 GiB |
| Q3_K_M / Q3 | 11 GiB | 4 GiB | 2.26 GiB | 17.26 GiB |
| Q2_K / Q2 | 7.86 GiB | 4 GiB | 1.98 GiB | 13.84 GiB |
| Hardware | Speicher | Urteil | Tok/s (geschätzt) |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Passt | 37.26 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Passt | 66.25 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | Passt nicht | 27.21 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | Passt nicht | 24.84 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Passt | 35.49 |
| NVIDIA A100 80GB PCIe | 80 GiB | Passt | 71.54 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Passt | 12.61 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Passt | 25.23 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Passt | 67.06 |
Planungsnahe Schätzwerte, keine Laufzeitgarantie. Annahmen sind transparent in Gewichte, KV und Overhead getrennt.
Ja. Speicher-Fit orientiert sich an total params, Durchsatz eher an active params.
Ja. Ein Script liest Hugging Face config.json und erzeugt einen typisierten Modelleintrag.