LLMRAM

LLMRAM : calculateur VRAM / RAM pour modèles IA

Ce calculateur répond rapidement à « puis-je exécuter ce modèle en local ? ». Choisissez le modèle, la quantification, la longueur de contexte et le batch, puis comparez NVIDIA, AMD, Apple Silicon et offload CPU/RAM.

Calculateur VRAM / RAM

Comparez l’adéquation sur VRAM GPU, mémoire unifiée Apple et scénarios d’offload CPU/RAM.

ID Hugging Face / paramètres personnalisés (optionnel)

Si l’ID repo est inconnu, vos valeurs sont utilisées en mode estimation.

Mémoire par quantification
QuantPoidsKVOverheadTotal
FP16 / BF1650.29 GiB4 GiB3.74 GiB58.03 GiB
INT8 / Q8_025.77 GiB4 GiB2.78 GiB32.56 GiB
Q6_K19.96 GiB4 GiB2.52 GiB26.48 GiB
Q5_K_M17.13 GiB4 GiB2.43 GiB23.56 GiB
Q4_K_M14.46 GiB4 GiB2.46 GiB20.91 GiB
Q3_K_M / Q311 GiB4 GiB2.26 GiB17.26 GiB
Q2_K / Q27.86 GiB4 GiB1.98 GiB13.84 GiB
Compatible / incompatible par matériel
MatérielMémoireVerdicttok/s estimés
NVIDIA GeForce RTX 4090 24GB24 GiBCompatible37.26
NVIDIA GeForce RTX 5090 32GB32 GiBCompatible66.25
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBIncompatible27.21
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBIncompatible24.84
AMD Radeon RX 7900 XTX 24GB24 GiBCompatible35.49
NVIDIA A100 80GB PCIe80 GiBCompatible71.54
Apple Silicon M3 Max (128GB unified memory)128 GiBCompatible12.61
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCompatible25.23
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCompatible67.06

Formules et hypothèses

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Méthodologie VRAM, mémoire unifiée et offload RAM

  1. Mémoire des poids = paramètres résidents × bits effectifs / 8 (GiB).
  2. Pour MoE : résidence des poids selon total params ; active params surtout pour le débit.
  3. KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  4. L’overhead inclut fragmentation, buffers runtime et réserves framework.
  5. tokens/sec est une estimation directionnelle basée sur la bande passante.
  6. L’offload CPU/RAM réduit la VRAM mais dégrade souvent la latence et le débit.
  7. La mémoire unifiée Mac est traitée comme une cible de premier plan.

FAQ

Quelle est la précision des estimations ?

Ce sont des estimations de planification. Les hypothèses sont explicites (poids, KV cache, overhead).

Les modèles MoE sont-ils pris en charge ?

Oui. Le fit mémoire suit surtout total params, le débit suit plutôt active params.

Peut-on ajouter vite un nouveau modèle ?

Oui, via un script qui lit config.json sur Hugging Face et génère un nouvel entry typé.