LLMRAM

NVIDIA GeForce RTX 5090 32GB: что можно запустить локально?

Если вы искали «NVIDIA GeForce RTX 5090 32GB что можно запустить локально», эта страница даёт практичный ответ на прозрачных допущениях.

  • Тип памяти: Дискретная VRAM
  • Общая память: 32 GiB
  • Пропускная способность: 1,792 GB/s
  • Подсказка по планированию: Для MoE и мультимодальных моделей закладывайте дополнительный запас памяти.

Таблица совместимости на NVIDIA GeForce RTX 5090 32GB

База: дефолтные context/batch и Q4_K_M для каждой модели.

МодельОценка totalВердиктtok/s (оценка)Рекоменд. квантизация
Qwen 3.8 27B20.91 GiBПодходит78.49q6_k
Qwen 3.8 Flash Next 125B78.66 GiBНе подходит353.21Нет fit
MiniMax H3 33B22.45 GiBПодходит64.22q6_k
Qwen Image 2.15.38 GiBПодходит302.75fp16
Kimi K31,823.65 GiBНе подходит20.38Нет fit
GLM 5.3 (Flash)215.7 GiBНе подходит117.74Нет fit
DeepSeek V4.1 Flash334.25 GiBНе подходит132.45Нет fit
MiMo V2.6 Pro RL625.89 GiBНе подходит50.46Нет fit
Bonsai 2 27B21.13 GiBПодходит77.46q6_k
Mistral 7B Instruct v0.35.83 GiBПодходит302.75fp16

Быстрый ответ: что может NVIDIA GeForce RTX 5090 32GB?

NVIDIA GeForce RTX 5090 32GB запускает 5 из 10 моделей в базовом профиле Q4_K_M.

Для MoE и мультимодальных моделей закладывайте дополнительный запас памяти.

FAQ

Что можно запустить локально на NVIDIA GeForce RTX 5090 32GB?

Используйте таблицу Q4_K_M как первую оценку. Для длинного контекста и мультимодальности закладывайте дополнительный запас.

Учитываются ли сценарии CPU/RAM offload?

Таблица отражает базовую резидентность. Частичный offload позволяет загрузить более крупные модели, но обычно снижает скорость.

Как интерпретировать unified memory на Mac?

Unified memory учитывается как основной вариант. Fit может улучшаться, но отзывчивость всё равно ограничивается bandwidth и runtime.

Источник и проверка

Источник спецификаций железа: NVIDIA product page (получено 2026-10-06).