LLMRAM

Guide modèle

Qwen 3.6 35B-A3B exigences VRAM, compatibilité GGUF et déploiement local

Si vous cherchez "qwen 3.6 35b a3b vram requirements", vous voulez surtout savoir si Qwen 3.6 35B-A3B est réaliste en local. Cette page sépare mémoire des poids, cache KV et overhead runtime pour une décision fiable.

Qwen 3.6 35B-A3B peut monter à environ 262,144 tokens selon les réglages publiés : la stratégie de contexte est donc aussi importante que la quantification.

Statut de vérification : Partiellement vérifié. Sources récupérées le 2026-10-06.

Calculateur VRAM / RAM

Comparez l’adéquation sur VRAM GPU, mémoire unifiée Apple et scénarios d’offload CPU/RAM.

ID Hugging Face / paramètres personnalisés (optionnel)

Si l’ID repo est inconnu, vos valeurs sont utilisées en mode estimation.

Mémoire par quantification
QuantPoidsKVOverheadTotal
FP16 / BF1665.19 GiB0.63 GiB1.32 GiB67.14 GiB
INT8 / Q8_033.41 GiB0.63 GiB1.32 GiB35.35 GiB
Q6_K25.87 GiB0.63 GiB1.32 GiB27.82 GiB
Q5_K_M22.21 GiB0.63 GiB1.32 GiB24.15 GiB
Q4_K_M18.74 GiB0.63 GiB1.32 GiB20.69 GiB
Q3_K_M / Q314.26 GiB0.63 GiB1.32 GiB16.2 GiB
Q2_K / Q210.19 GiB0.63 GiB1.32 GiB12.13 GiB
Compatible / incompatible par matériel
MatérielMémoireVerdicttok/s estimés
NVIDIA GeForce RTX 4090 24GB24 GiBCompatible34.06
NVIDIA GeForce RTX 5090 32GB32 GiBCompatible60.55
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiBIncompatiblen/a (Incompatible)
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiBIncompatiblen/a (Incompatible)
AMD Radeon RX 7900 XTX 24GB24 GiBCompatible32.44
NVIDIA A100 80GB PCIe80 GiBCompatible65.38
Apple Silicon M3 Max (128GB unified memory)128 GiBCompatible11.53
Apple Silicon M2 Ultra (192GB unified memory)192 GiBCompatible23.06
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiBCompatible61.29

Formules et hypothèses

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead = 1.3 GiB base + 3% of KV-cache memory.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • Apple Silicon fit checks use an estimated usable unified-memory budget (about 75% by default, about 68% on 16GB systems) aligned with macOS recommendedMaxWorkingSetSize behavior.
  • Recommended quantization keeps at least 10% memory headroom relative to usable memory budget.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

Qwen 3.6 35B-A3B VRAM / RAM par quantification

Vue par défaut avec contexte/batch de référence du modèle.

QuantPoidsKVOverheadTotal
FP16 / BF1665.19 GiB0.63 GiB1.32 GiB67.14 GiB
INT8 / Q8_033.41 GiB0.63 GiB1.32 GiB35.35 GiB
Q6_K25.87 GiB0.63 GiB1.32 GiB27.82 GiB
Q5_K_M22.21 GiB0.63 GiB1.32 GiB24.15 GiB
Q4_K_M18.74 GiB0.63 GiB1.32 GiB20.69 GiB
Q3_K_M / Q314.26 GiB0.63 GiB1.32 GiB16.2 GiB
Q2_K / Q210.19 GiB0.63 GiB1.32 GiB12.13 GiB

Quelles GPUs et Macs peuvent exécuter Qwen 3.6 35B-A3B?

Baseline : Q4_K_M avec contexte/batch par défaut. tok/s = estimation basée bande passante.

NVIDIA GeForce RTX 4090 24GB

Compatible (3.31 GiB)

Estimé 34.06 tokens/s

Quantification recommandée: q4_k_m

NVIDIA GeForce RTX 5090 32GB

Compatible (11.31 GiB)

Estimé 60.55 tokens/s

Quantification recommandée: q6_k

NVIDIA GeForce RTX 4080 SUPER 16GB

Incompatible (-4.69 GiB)

Estimé n/a (Incompatible)

Quantification recommandée: q2_k

NVIDIA GeForce RTX 4070 Ti SUPER 16GB

Incompatible (-4.69 GiB)

Estimé n/a (Incompatible)

Quantification recommandée: q2_k

AMD Radeon RX 7900 XTX 24GB

Compatible (3.31 GiB)

Estimé 32.44 tokens/s

Quantification recommandée: q4_k_m

NVIDIA A100 80GB PCIe

Compatible (59.31 GiB)

Estimé 65.38 tokens/s

Quantification recommandée: fp16

Apple Silicon M3 Max (128GB unified memory)

Compatible (75.31 GiB)

Estimé 11.53 tokens/s

Quantification recommandée: fp16

Apple Silicon M2 Ultra (192GB unified memory)

Compatible (123.31 GiB)

Estimé 23.06 tokens/s

Quantification recommandée: fp16

2× NVIDIA GeForce RTX 4090 (aggregate)

Compatible (27.31 GiB)

Estimé 61.29 tokens/s

Quantification recommandée: int8

Appareils compatibles en baseline : NVIDIA GeForce RTX 4090 24GB, NVIDIA GeForce RTX 5090 32GB, AMD Radeon RX 7900 XTX 24GB, NVIDIA A100 80GB PCIe, Apple Silicon M3 Max (128GB unified memory), Apple Silicon M2 Ultra (192GB unified memory), 2× NVIDIA GeForce RTX 4090 (aggregate).

Snippets de déploiement pour Qwen 3.6 35B-A3B

llama.cpp

./llama-cli -m ./Qwen-3.6-35B-A3B-Q4_K_M.gguf -c 8192 -ngl 99

vLLM

vllm serve Qwen/Qwen3.6-35B-A3B --max-model-len 8192

Offload CPU/RAM : déplacer des couches vers la RAM système peut réduire la VRAM requise mais ralentit généralement.

Qwen 3.6 35B-A3B guide détaillé

Vue d’ensemble VRAM/RAM pour Qwen 3.6 35B-A3B

Les personnes qui cherchent « qwen 3.6 35b a3b vram requirements » veulent surtout une réponse exploitable pour le local. Cette page sépare clairement poids résidents, cache KV et overhead runtime.

Pour Qwen 3.6 35B-A3B, les champs d’architecture (couches, têtes KV, head_dim) sont déterminants. En MoE, la résidence mémoire suit plutôt total params, alors que le débit suit active params.

Comment la quantification change la mémoire requise pour Qwen 3.6 35B-A3B

La quantification est le levier principal. Q4_K_M est souvent le meilleur point de départ; Q5/Q6 si la qualité prime; Q3/Q2 pour des contraintes mémoire fortes.

Longueur de contexte, cache KV et croissance mémoire réelle

Plus le contexte augmente, plus le cache KV domine. En pratique, un contexte modéré et stable donne souvent de meilleurs résultats qu’un contexte maximal fragile.

Stratégie de fit: VRAM GPU et mémoire unifiée Mac

Côté matériel, il faut équilibrer capacité et bande passante: la capacité détermine le fit, la bande passante la réactivité.

Workflow de déploiement local (Ollama, llama.cpp, vLLM, ComfyUI)

Ollama facilite les essais rapides, llama.cpp offre un contrôle fin de l’offload, vLLM est souvent meilleur pour le service API concurrent. Pour image/vidéo, ajoutez les coûts VAE/résolution.

Diagnostic OOM et débit instable

En cas d’OOM, commencez par un profil minimal puis augmentez progressivement. L’offload CPU/RAM peut débloquer le chargement mais réduit généralement le débit.

Choisir les bons réglages de Qwen 3.6 35B-A3B selon vos usages

Validez enfin vos réglages sur des prompts réels. Un niveau de quantification légèrement plus prudent avec de la marge donne souvent une exploitation plus stable qu’un profil à la limite.

FAQ : Qwen 3.6 35B-A3B

De combien de mémoire Qwen 3.6 35B-A3B a-t-il besoin en pratique ?

Cela dépend de la quantification, du contexte et de l’overhead runtime. Ajoutez 10–20% de marge.

Dois-je prioriser VRAM, mémoire unifiée ou offload CPU/RAM pour Qwen 3.6 35B-A3B ?

Assurez d’abord une résidence stable, puis optimisez le débit. L’offload aide au fit mais réduit souvent la vitesse.

Quelle quantification choisir pour commencer avec Qwen 3.6 35B-A3B ?

Q4_K_M est généralement un bon point de départ.

Sources de données et notes de vérification

- Number of Parameters: 35B in total and 3B activated | - Number of Activated Experts: 8 Routed + 1 Shared | > We recommend using the following set of sampling parameters for generation

Liens internes