Все статьи
LLM Deployment & Inference/

Запуск моделей 70B: подгонка GPU и скорость

Данные бенчмарков Llama 3.3 70B и Qwen 2.5-72B на потребительских и корпоративных GPU-требования VRAM, компромиссы квантизации и пропускная способность токенов.

9 мин чтения

A high-end GPU card with visible memory modules positioned next to a large language model architecture diagram printed on paper, both framed within a server rack's mounting space to show spatial constraints — GPUniq
Данные на 1 источник

Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.

TL;DR

Llama 3.3 70B помещается на одном RTX 4090 (24 ГБ) с использованием квантизации fp8, требуя 95,5 ГБ эффективной памяти на GPU и системной RAM, и обеспечивает 24,5 токена/сек. На H100 (80 ГБ) с int4 достигает 54,5 токена/сек при использовании 62,9% VRAM. RTX 5090 за $1,999 имеет лучший коэффициент цены к пропускной способности среди всех протестированных одиночных GPU.

Будет ли мой GPU запускать модели 70B?

Да, на большинстве современных GPU, но только с квантизацией. Вы не загружаете веса fp16 ни на что с менее чем 140 ГБ VRAM.

Цифры ниже получены из набора бенчмарков GPUniq (сентябрь 2026). «Требуемый ГБ» охватывает веса, KV кэш при размере пакета 32 / длине последовательности 2048 и память активаций.

GPUVRAM, ГБМодельТочностьТребуется, ГБТокенов/сек
RTX 409024Llama 3.3 70Bfp895.524.5
RTX 509032Llama 3.3 70Bint456.347.7
H10080Llama 3.3 70Bint450.354.5
A10080Llama 3.3 70Bint450.335.4
L40S48Llama 3.3 70Bfp890.315.1
RTX 6000 Ada48Llama 3.3 70Bfp890.316.7

Строка RTX 4090 удивляет людей. 24 ГБ физической VRAM, но требуется 95,5 ГБ. fp8 по-прежнему требует полного количества параметров, и цифра «96 ГБ доступно» отражает унифицированную или выгруженную емкость памяти (GPU плюс системная RAM через llama.cpp или ExLlamaV2), а не только VRAM на карте. Вы работаете при использовании 99,5%. Это работает, но нет никакого запаса прочности.

L40S - разочаровывающий вариант. 48 ГБ VRAM, корпоративный ценник, 15,1 токена/сек. Медленнее, чем RTX 4090. Архитектура вычислений просто не соответствует пропускной способности тензорных ядер H100.

Быстрая проверка подгонки

# Приблизительная VRAM, необходимая для модели 70B
# weights_gb = param_count * bytes_per_param
# fp8 = 1 byte, int4 = 0.5 bytes, fp16 = 2 bytes
python3 -c "
params = 70e9
for prec, bpp in [('fp16', 2), ('fp8', 1), ('int4', 0.5)]:
    weights = params * bpp / 1e9
    kv_cache = 10  # GB, rough estimate at bs=32, seq=2048
    activations = 3  # GB
    print(f'{prec}: ~{weights + kv_cache + activations:.1f} GB')
"
fp16: ~153.0 GB
fp8:  ~83.0 GB
int4: ~48.5 GB

Это приблизительные оценки. Цифры бенчмарков включают накладные расходы фреймворка, которые добавляют еще 10-15 ГБ.

Какую квантизацию мне использовать?

Это зависит от того, какой GPU у вас есть, а не только от предпочтения качества.

fp8 дает примерно половину VRAM от fp16 с минимальным увеличением перплексии. Согласно официальным спецификациям Llama 3.3 70B, вывод fp8 изначально поддерживается на архитектурах Hopper и Ada Lovelace, поэтому RTX 4090 и L40S оба работают fp8 в этих бенчмарках. Большинство производственных команд не замечают потерю качества на стандартных бенчмарках.

int4 снова вдвое сокращает VRAM относительно fp8. Потеря перплексии реальна, но приемлема для большинства рабочих нагрузок чата и суммирования. На H100 и RTX 5090 int4 также быстрее, потому что тензорные ядра более эффективно обрабатывают 4-битные операции, чем 8-битные на этих архитектурах.

ТочностьРазмер веса Llama 3.3 70B, ГБЛучший класс GPUВлияние на пропускную способность
fp16~140Multi-GPU H100 onlyБазовая
fp8~70RTX 4090, L40S, RTX 6000 Ada-5 to -10% vs fp16
int4~35H100, A100, RTX 5090+10 to +20% on Hopper

Используйте fp8 на RTX 4090 и любой карте Ada Lovelace. Используйте int4 на H100, A100 и RTX 5090. Не пытайтесь использовать fp16 ни на чем с менее чем 160 ГБ общей памяти для модели 70B.

Насколько быстрым является вывод на моем GPU?

Пропускная способность генерации одного пользователя. Размер пакета 32 выглядел бы иначе.

GPUМодельТочностьТокенов/сек
RTX 4090Llama 3.3 70Bfp824.5
RTX 4090Qwen 2.5-72Bint438.9
RTX 5090Llama 3.3 70Bint447.7
RTX 5090Qwen 2.5-72Bint447.1
H100Llama 3.3 70Bint454.5
H100Qwen 2.5-72Bint453.8
A100Llama 3.3 70Bint435.4
L40SLlama 3.3 70Bfp815.1

Строка RTX 4090 / Qwen 2.5-72B (38,9 токена/сек) выглядит аномально высокой по сравнению с Llama 3.3 70B на той же карте (24,5 токена/сек). Разница в точности: Qwen работает int4 там против fp8 для Llama. int4 на Ada Lovelace быстрее для этой рабочей нагрузки, и архитектура Qwen более чисто сжимается до 4-бит.

Декодирование одного токена жадным методом работает примерно в 3-5 раз медленнее, чем эти цифры пакетной генерации. Создаете интерактивное приложение чата? Рассчитывайте на 5-8 токенов/сек на RTX 4090 при реальной нагрузке.

Llama 3.3 vs Qwen 2.5-72B: какой подходит?

Оба подходят на каждый протестированный GPU. Разница в том, насколько удобно.

GPULlama 3.3 70B требуется, ГБQwen 2.5-72B требуется, ГБПобедитель по подгонке
RTX 4090 (96 ГБ эфф.)95.5 fp862.9 int4Llama (плотнее, та же точность)
RTX 5090 (64 ГБ эфф.)56.3 int457.4 int4Llama (едва)
H100 (80 ГБ)50.3 int451.1 int4Llama
L40S (96 ГБ эфф.)90.3 fp891.6 fp8Llama

Llama 3.3 70B постоянно требует немного меньше памяти. На RTX 4090 Qwen 2.5-72B работает int4 вместо fp8, поэтому он быстрее (38,9 против 24,5 токена/сек) несмотря на похожее количество параметров. Это не победа качества для Qwen; это артефакт того, какую точность каждая модель использует для этого GPU.

На H100 и RTX 5090 пропускная способность почти идентична. Qwen достигает 53,8 токена/сек на H100 против 54,5 для Llama. Этот разрыв в 1,3% - это шум.

На потребительском GPU выбирайте Llama 3.3 70B для самой легкой подгонки. На корпоративной карте, где пропускная способность - это метрика, любая модель работает и выбор должен исходить из бенчмарков качества на вашей конкретной задаче.

Эффективность потребительского vs корпоративного GPU

Здесь математика становится неудобной для корпоративных закупок.

GPUЦена, $Токенов/секТокен/сек за доллар
RTX 40901,60024.50.0153
RTX 50901,99947.70.0239
H10040,00054.50.0014
A10015,00035.40.0024
L40S10,00015.10.0015

RTX 5090 побеждает по экономической эффективности. 0,024 токена/сек за доллар против 0,0014 для H100. Это разрыв в 17 раз.

H100 побеждает по сырой пропускной способности и запасу прочности. При использовании 62,9% VRAM с int4 есть место для больших пакетов и более длинных контекстов без выгрузки. Он также имеет NVLink (900 ГБ/сек против примерно 64 ГБ/сек для PCIe 4.0), что имеет значение для многогеографических установок. В облачном контексте вы не платите $40,000 авансом; вы платите за час, и более высокая пропускная способность означает меньше GPU-часов на работу.

L40S я бы избегал для чистого вывода. $10,000, 48 ГБ VRAM, 15,1 токена/сек. Медленнее, чем $1,600 RTX 4090. Его ценность в смешанных рабочих нагрузках вычислений/рендеринга.

Сколько VRAM вам действительно нужно?

Три компонента складываются: веса модели, KV кэш и активации.

Для Llama 3.3 70B (70 миллиардов параметров согласно официальной карточке модели):

  • fp16 веса: ~140 ГБ
  • fp8 веса: ~70 ГБ
  • int4 веса: ~35 ГБ

KV кэш масштабируется с размером пакета и длиной последовательности. При размере пакета 32 и длине последовательности 2048 добавьте 8-12 ГБ поверх весов. При размере пакета 1 и длине последовательности 512 это менее 1 ГБ. Это переменная, которая кусает людей, когда они масштабируют обслуживание.

Активации добавляют 2-4 ГБ для вывода (нет градиентов для хранения).

Реалистичная установка обслуживания на RTX 4090 с fp8:

70 ГБ (fp8 веса)
+ 10 ГБ (KV кэш, bs=32, seq=2048)
+  3 ГБ (активации)
+ 12 ГБ (накладные расходы фреймворка, контекст CUDA и т.д.)
= ~95 ГБ эффективное требование

Это соответствует цифре бенчмарка 95,5 ГБ. «96 ГБ доступно» на RTX 4090 включает выгрузку системной RAM через llama.cpp или ExLlamaV2, а не только 24 ГБ на карте.

Удвоение длины последовательности до 4096 добавляет примерно еще 8-12 ГБ к KV кэшу.

Вывод на нескольких GPU

Параллелизм тензоров разделяет матрицы весов на GPU. Каждый GPU обрабатывает срез каждого слоя и синхронизирует активации между слоями. Согласно спецификациям NVLink NVIDIA, пропускная способность H100 NVLink составляет 900 ГБ/сек против примерно 64 ГБ/сек для PCIe 4.0, разница в 14 раз. Этот разрыв имеет значение для вывода 70B, потому что синхронизация происходит на каждом слое трансформера (80 слоев в Llama 3.3 70B). На PCIe задержка между GPU становится узким местом. На NVLink это почти прозрачно.

УстановкаВсего VRAM, ГБТокенов/секЭффективность масштабирования
RTX 4090 x12424.5базовая
RTX 4090 x24848.599.0%
H100 x18054.5базовая
H100 x2160108.299.3%

Цифра RTX 4090 x2 предполагает NVLink или PCIe 5.0 с быстрым взаимосвязью. На потребительской материнской плате с слотами PCIe 4.0 x8 ожидайте на 10-20% более низкую эффективность масштабирования. Два H100 при 108,2 токена/сек действительно быстры для модели 70B.

Какой GPU мне купить для 70B?

RTX 5090 за $1,999 - явный победитель для локального вывода. 47,7 токена/сек, int4, 32 ГБ VRAM, использование 87,9%. Это первый потребительский GPU, который обрабатывает модели 70B без героических трюков с памятью. Создаете локальный сервер вывода или внутренний инструмент небольшой команды? Это ответ.

RTX 4090 за $1,600 все еще работает. 24,5 токена/сек в fp8 пригодны и карта широко доступна. Использование 99,5% неудобно; почти нет места для более длинных контекстов или больших пакетов. Рекомендуйте только если вы уже владеете одним или экономия $400 над RTX 5090 действительно имеет значение.

H100 за $40,000 - корпоративный стандарт. 54,5 токена/сек, NVLink для многогеографических установок, использование 62,9% с местом для производственных рабочих нагрузок пакетов. Математика стоимости за токен работает только в масштабе; вам нужна эта карта, работающая интенсивно, много часов в день.

L40S за $10,000 сложно оправдать для вывода LLM. 15,1 токена/сек при премии в цене в 6 раз над RTX 4090. Его сильные стороны в смешанных вычислениях/рендеринге, а не в генерации текста.

A100 примерно за $15,000 находится между L40S и H100 при 35,4 токена/сек. Разумно, если вы можете получить скидочное облачное время. Для новых закупок оборудования H100 - очевидный выбор.

Связанное на блоге GPUniq

Методология

Fit is computed by the GPUniq VRAM calculator at default inference settings — fp16 KV cache, 8k context, four concurrent users — counting weights, KV cache, activations and runtime overhead. 'Fits' means the model runs on one card without offloading at the precision shown.

Источники

  1. 1.GPUniq VRAM calculator — GPUniq (просмотрено )

Нужны недорогие GPU под ваш проект?

Живые цены на аренду GPU и нужная карта за пару кликов — H100, A100, RTX 4090 и ещё 50+ моделей. Оплата картой РФ или по счёту.

Ещё в блоге GPUniq