LLMRAM

2× NVIDIA GeForce RTX 4090 (aggregate): что можно запустить локально?

Если вы искали «2× NVIDIA GeForce RTX 4090 (aggregate) что можно запустить локально», эта страница даёт практичный ответ на прозрачных допущениях.

  • Тип памяти: Дискретная VRAM
  • Общая память: 48 GiB
  • Пропускная способность: 1,814 GB/s
  • Подсказка по планированию: Для MoE и мультимодальных моделей закладывайте дополнительный запас памяти.

Таблица совместимости на 2× NVIDIA GeForce RTX 4090 (aggregate)

База: дефолтные context/batch и Q4_K_M для каждой модели.

МодельОценка totalВердиктtok/s (оценка)Рекоменд. квантизация
Qwen 3.8 27B20.91 GiBПодходит79.45int8
Qwen 3.8 Flash Next 125B78.66 GiBНе подходит357.54q2_k
MiniMax H3 33B22.45 GiBПодходит65.01int8
Qwen Image 2.15.38 GiBПодходит306.46fp16
Kimi K31,823.65 GiBНе подходит20.63Нет fit
GLM 5.3 (Flash)215.7 GiBНе подходит119.18Нет fit
DeepSeek V4.1 Flash334.25 GiBНе подходит134.08Нет fit
MiMo V2.6 Pro RL625.89 GiBНе подходит51.08Нет fit
Bonsai 2 27B21.13 GiBПодходит78.41int8
Mistral 7B Instruct v0.35.83 GiBПодходит306.46fp16

Быстрый ответ: что может 2× NVIDIA GeForce RTX 4090 (aggregate)?

2× NVIDIA GeForce RTX 4090 (aggregate) запускает 5 из 10 моделей в базовом профиле Q4_K_M.

Для MoE и мультимодальных моделей закладывайте дополнительный запас памяти.

FAQ

Что можно запустить локально на 2× NVIDIA GeForce RTX 4090 (aggregate)?

Используйте таблицу Q4_K_M как первую оценку. Для длинного контекста и мультимодальности закладывайте дополнительный запас.

Учитываются ли сценарии CPU/RAM offload?

Таблица отражает базовую резидентность. Частичный offload позволяет загрузить более крупные модели, но обычно снижает скорость.

Как интерпретировать unified memory на Mac?

Unified memory учитывается как основной вариант. Fit может улучшаться, но отзывчивость всё равно ограничивается bandwidth и runtime.

Источник и проверка

Источник спецификаций железа: Derived from two RTX 4090 cards (aggregate estimate) (получено 2026-10-06).