LLMRAM

LLMRAM: AI 모델 VRAM / RAM 계산기

이 계산기는 “이 모델을 로컬에서 돌릴 수 있는가?”를 빠르게 판단하도록 설계되었습니다. 모델, 양자화, 컨텍스트 길이, 배치를 설정하고 NVIDIA/AMD/Apple Silicon/CPU-RAM 오프로드 조건을 비교하세요.

VRAM / RAM 계산기

GPU VRAM, Apple 통합 메모리, CPU/RAM 오프로드 시나리오를 함께 고려해 적합성을 비교합니다.

사용자 지정 Hugging Face 모델 id / 파라미터 (선택)

repo id를 모르면 입력한 값으로 추정 계산됩니다.

양자화별 메모리
양자화가중치KVOverhead합계
FP16 / BF1650.29 GiB4 GiB3.74 GiB58.03 GiB
INT8 / Q8_025.77 GiB4 GiB2.78 GiB32.56 GiB
Q6_K19.96 GiB4 GiB2.52 GiB26.48 GiB
Q5_K_M17.13 GiB4 GiB2.43 GiB23.56 GiB
Q4_K_M14.46 GiB4 GiB2.46 GiB20.91 GiB
Q3_K_M / Q311 GiB4 GiB2.26 GiB17.26 GiB
Q2_K / Q27.86 GiB4 GiB1.98 GiB13.84 GiB
하드웨어별 적합성
하드웨어메모리판정추정 tok/s
NVIDIA GeForce RTX 4090 24GB24 GiB적합37.26
NVIDIA GeForce RTX 5090 32GB32 GiB적합66.25
NVIDIA GeForce RTX 4080 SUPER 16GB16 GiB부적합27.21
NVIDIA GeForce RTX 4070 Ti SUPER 16GB16 GiB부적합24.84
AMD Radeon RX 7900 XTX 24GB24 GiB적합35.49
NVIDIA A100 80GB PCIe80 GiB적합71.54
Apple Silicon M3 Max (128GB unified memory)128 GiB적합12.61
Apple Silicon M2 Ultra (192GB unified memory)192 GiB적합25.23
2× NVIDIA GeForce RTX 4090 (aggregate)48 GiB적합67.06

공식 및 가정

  • Weight memory uses resident params × effective_bits / 8 (total params when available, otherwise active/fallback estimate).
  • KV cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  • Runtime overhead includes allocator fragmentation, kernels, and framework buffers.
  • Tokens/sec estimate uses active_params for decode bandwidth and should be treated as a rough directional number.
  • CPU/RAM offload (for example llama.cpp partial offload with lower GPU layer count) can reduce VRAM needs at the cost of speed.
  • When config values are unavailable, fallback defaults are used and flagged as estimated on the page.

VRAM·통합 메모리·RAM 오프로드 계산 기준

  1. 가중치 메모리 = 상주 파라미터 × 유효 비트폭 / 8 (GiB).
  2. MoE는 가중치 상주 메모리를 total params로 계산하고, active params는 주로 처리량 추정에 사용합니다.
  3. KV Cache = 2 × layers × kv_heads × head_dim × kv_bytes × context × batch.
  4. Overhead에는 단편화, 런타임 버퍼, 프레임워크 예약 메모리가 포함됩니다.
  5. tokens/sec는 대역폭 기반의 대략치입니다.
  6. CPU/RAM 오프로드는 VRAM을 줄일 수 있지만 속도 저하가 발생할 수 있습니다.
  7. Mac 통합 메모리도 핵심 대상입니다.

FAQ

추정치는 얼마나 정확한가요?

계획 수립용 추정치입니다. 가중치·KV·Overhead를 분리해 가정을 직접 확인할 수 있습니다.

MoE 모델도 지원하나요?

지원합니다. 메모리 적합성은 total params, 처리량 추정은 active params 중심으로 계산합니다.

새 모델을 빠르게 추가할 수 있나요?

가능합니다. Hugging Face config.json을 읽어 타입 안전한 모델 항목을 생성하는 스크립트가 있습니다.