Quelle est la précision des estimations ?
Ce sont des estimations de planification. Les hypothèses sont explicites (poids, KV cache, overhead).
Ce calculateur répond rapidement à « puis-je exécuter ce modèle en local ? ». Choisissez le modèle, la quantification, la longueur de contexte et le batch, puis comparez NVIDIA, AMD, Apple Silicon et offload CPU/RAM.
Comparez l’adéquation sur VRAM GPU, mémoire unifiée Apple et scénarios d’offload CPU/RAM.
Si l’ID repo est inconnu, vos valeurs sont utilisées en mode estimation.
| Quant | Poids | KV | Overhead | Total |
|---|---|---|---|---|
| FP16 / BF16 | 50.29 GiB | 4 GiB | 3.74 GiB | 58.03 GiB |
| INT8 / Q8_0 | 25.77 GiB | 4 GiB | 2.78 GiB | 32.56 GiB |
| Q6_K | 19.96 GiB | 4 GiB | 2.52 GiB | 26.48 GiB |
| Q5_K_M | 17.13 GiB | 4 GiB | 2.43 GiB | 23.56 GiB |
| Q4_K_M | 14.46 GiB | 4 GiB | 2.46 GiB | 20.91 GiB |
| Q3_K_M / Q3 | 11 GiB | 4 GiB | 2.26 GiB | 17.26 GiB |
| Q2_K / Q2 | 7.86 GiB | 4 GiB | 1.98 GiB | 13.84 GiB |
| Matériel | Mémoire | Verdict | tok/s estimés |
|---|---|---|---|
| NVIDIA GeForce RTX 4090 24GB | 24 GiB | Compatible | 37.26 |
| NVIDIA GeForce RTX 5090 32GB | 32 GiB | Compatible | 66.25 |
| NVIDIA GeForce RTX 4080 SUPER 16GB | 16 GiB | Incompatible | 27.21 |
| NVIDIA GeForce RTX 4070 Ti SUPER 16GB | 16 GiB | Incompatible | 24.84 |
| AMD Radeon RX 7900 XTX 24GB | 24 GiB | Compatible | 35.49 |
| NVIDIA A100 80GB PCIe | 80 GiB | Compatible | 71.54 |
| Apple Silicon M3 Max (128GB unified memory) | 128 GiB | Compatible | 12.61 |
| Apple Silicon M2 Ultra (192GB unified memory) | 192 GiB | Compatible | 25.23 |
| 2× NVIDIA GeForce RTX 4090 (aggregate) | 48 GiB | Compatible | 67.06 |
Ce sont des estimations de planification. Les hypothèses sont explicites (poids, KV cache, overhead).
Oui. Le fit mémoire suit surtout total params, le débit suit plutôt active params.
Oui, via un script qui lit config.json sur Hugging Face et génère un nouvel entry typé.