Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.
TL;DR
Llama 3.3 70B помещается на одном RTX 4090 (24 ГБ) с использованием квантизации fp8, требуя 95,5 ГБ эффективной памяти на GPU и системной RAM, и обеспечивает 24,5 токена/сек. На H100 (80 ГБ) с int4 достигает 54,5 токена/сек при использовании 62,9% VRAM. RTX 5090 за $1,999 имеет лучший коэффициент цены к пропускной способности среди всех протестированных одиночных GPU.
Будет ли мой GPU запускать модели 70B?
Да, на большинстве современных GPU, но только с квантизацией. Вы не загружаете веса fp16 ни на что с менее чем 140 ГБ VRAM.
Цифры ниже получены из набора бенчмарков GPUniq (сентябрь 2026). «Требуемый ГБ» охватывает веса, KV кэш при размере пакета 32 / длине последовательности 2048 и память активаций.
| GPU | VRAM, ГБ | Модель | Точность | Требуется, ГБ | Токенов/сек |
|---|---|---|---|---|---|
| RTX 4090 | 24 | Llama 3.3 70B | fp8 | 95.5 | 24.5 |
| RTX 5090 | 32 | Llama 3.3 70B | int4 | 56.3 | 47.7 |
| H100 | 80 | Llama 3.3 70B | int4 | 50.3 | 54.5 |
| A100 | 80 | Llama 3.3 70B | int4 | 50.3 | 35.4 |
| L40S | 48 | Llama 3.3 70B | fp8 | 90.3 | 15.1 |
| RTX 6000 Ada | 48 | Llama 3.3 70B | fp8 | 90.3 | 16.7 |
Строка RTX 4090 удивляет людей. 24 ГБ физической VRAM, но требуется 95,5 ГБ. fp8 по-прежнему требует полного количества параметров, и цифра «96 ГБ доступно» отражает унифицированную или выгруженную емкость памяти (GPU плюс системная RAM через llama.cpp или ExLlamaV2), а не только VRAM на карте. Вы работаете при использовании 99,5%. Это работает, но нет никакого запаса прочности.
L40S - разочаровывающий вариант. 48 ГБ VRAM, корпоративный ценник, 15,1 токена/сек. Медленнее, чем RTX 4090. Архитектура вычислений просто не соответствует пропускной способности тензорных ядер H100.
Быстрая проверка подгонки
# Приблизительная VRAM, необходимая для модели 70B
# weights_gb = param_count * bytes_per_param
# fp8 = 1 byte, int4 = 0.5 bytes, fp16 = 2 bytes
python3 -c "
params = 70e9
for prec, bpp in [('fp16', 2), ('fp8', 1), ('int4', 0.5)]:
weights = params * bpp / 1e9
kv_cache = 10 # GB, rough estimate at bs=32, seq=2048
activations = 3 # GB
print(f'{prec}: ~{weights + kv_cache + activations:.1f} GB')
"
fp16: ~153.0 GB
fp8: ~83.0 GB
int4: ~48.5 GB
Это приблизительные оценки. Цифры бенчмарков включают накладные расходы фреймворка, которые добавляют еще 10-15 ГБ.
Какую квантизацию мне использовать?
Это зависит от того, какой GPU у вас есть, а не только от предпочтения качества.
fp8 дает примерно половину VRAM от fp16 с минимальным увеличением перплексии. Согласно официальным спецификациям Llama 3.3 70B, вывод fp8 изначально поддерживается на архитектурах Hopper и Ada Lovelace, поэтому RTX 4090 и L40S оба работают fp8 в этих бенчмарках. Большинство производственных команд не замечают потерю качества на стандартных бенчмарках.
int4 снова вдвое сокращает VRAM относительно fp8. Потеря перплексии реальна, но приемлема для большинства рабочих нагрузок чата и суммирования. На H100 и RTX 5090 int4 также быстрее, потому что тензорные ядра более эффективно обрабатывают 4-битные операции, чем 8-битные на этих архитектурах.
| Точность | Размер веса Llama 3.3 70B, ГБ | Лучший класс GPU | Влияние на пропускную способность |
|---|---|---|---|
| fp16 | ~140 | Multi-GPU H100 only | Базовая |
| fp8 | ~70 | RTX 4090, L40S, RTX 6000 Ada | -5 to -10% vs fp16 |
| int4 | ~35 | H100, A100, RTX 5090 | +10 to +20% on Hopper |
Используйте fp8 на RTX 4090 и любой карте Ada Lovelace. Используйте int4 на H100, A100 и RTX 5090. Не пытайтесь использовать fp16 ни на чем с менее чем 160 ГБ общей памяти для модели 70B.
Насколько быстрым является вывод на моем GPU?
Пропускная способность генерации одного пользователя. Размер пакета 32 выглядел бы иначе.
| GPU | Модель | Точность | Токенов/сек |
|---|---|---|---|
| RTX 4090 | Llama 3.3 70B | fp8 | 24.5 |
| RTX 4090 | Qwen 2.5-72B | int4 | 38.9 |
| RTX 5090 | Llama 3.3 70B | int4 | 47.7 |
| RTX 5090 | Qwen 2.5-72B | int4 | 47.1 |
| H100 | Llama 3.3 70B | int4 | 54.5 |
| H100 | Qwen 2.5-72B | int4 | 53.8 |
| A100 | Llama 3.3 70B | int4 | 35.4 |
| L40S | Llama 3.3 70B | fp8 | 15.1 |
Строка RTX 4090 / Qwen 2.5-72B (38,9 токена/сек) выглядит аномально высокой по сравнению с Llama 3.3 70B на той же карте (24,5 токена/сек). Разница в точности: Qwen работает int4 там против fp8 для Llama. int4 на Ada Lovelace быстрее для этой рабочей нагрузки, и архитектура Qwen более чисто сжимается до 4-бит.
Декодирование одного токена жадным методом работает примерно в 3-5 раз медленнее, чем эти цифры пакетной генерации. Создаете интерактивное приложение чата? Рассчитывайте на 5-8 токенов/сек на RTX 4090 при реальной нагрузке.
Llama 3.3 vs Qwen 2.5-72B: какой подходит?
Оба подходят на каждый протестированный GPU. Разница в том, насколько удобно.
| GPU | Llama 3.3 70B требуется, ГБ | Qwen 2.5-72B требуется, ГБ | Победитель по подгонке |
|---|---|---|---|
| RTX 4090 (96 ГБ эфф.) | 95.5 fp8 | 62.9 int4 | Llama (плотнее, та же точность) |
| RTX 5090 (64 ГБ эфф.) | 56.3 int4 | 57.4 int4 | Llama (едва) |
| H100 (80 ГБ) | 50.3 int4 | 51.1 int4 | Llama |
| L40S (96 ГБ эфф.) | 90.3 fp8 | 91.6 fp8 | Llama |
Llama 3.3 70B постоянно требует немного меньше памяти. На RTX 4090 Qwen 2.5-72B работает int4 вместо fp8, поэтому он быстрее (38,9 против 24,5 токена/сек) несмотря на похожее количество параметров. Это не победа качества для Qwen; это артефакт того, какую точность каждая модель использует для этого GPU.
На H100 и RTX 5090 пропускная способность почти идентична. Qwen достигает 53,8 токена/сек на H100 против 54,5 для Llama. Этот разрыв в 1,3% - это шум.
На потребительском GPU выбирайте Llama 3.3 70B для самой легкой подгонки. На корпоративной карте, где пропускная способность - это метрика, любая модель работает и выбор должен исходить из бенчмарков качества на вашей конкретной задаче.
Эффективность потребительского vs корпоративного GPU
Здесь математика становится неудобной для корпоративных закупок.
| GPU | Цена, $ | Токенов/сек | Токен/сек за доллар |
|---|---|---|---|
| RTX 4090 | 1,600 | 24.5 | 0.0153 |
| RTX 5090 | 1,999 | 47.7 | 0.0239 |
| H100 | 40,000 | 54.5 | 0.0014 |
| A100 | 15,000 | 35.4 | 0.0024 |
| L40S | 10,000 | 15.1 | 0.0015 |
RTX 5090 побеждает по экономической эффективности. 0,024 токена/сек за доллар против 0,0014 для H100. Это разрыв в 17 раз.
H100 побеждает по сырой пропускной способности и запасу прочности. При использовании 62,9% VRAM с int4 есть место для больших пакетов и более длинных контекстов без выгрузки. Он также имеет NVLink (900 ГБ/сек против примерно 64 ГБ/сек для PCIe 4.0), что имеет значение для многогеографических установок. В облачном контексте вы не платите $40,000 авансом; вы платите за час, и более высокая пропускная способность означает меньше GPU-часов на работу.
L40S я бы избегал для чистого вывода. $10,000, 48 ГБ VRAM, 15,1 токена/сек. Медленнее, чем $1,600 RTX 4090. Его ценность в смешанных рабочих нагрузках вычислений/рендеринга.
Сколько VRAM вам действительно нужно?
Три компонента складываются: веса модели, KV кэш и активации.
Для Llama 3.3 70B (70 миллиардов параметров согласно официальной карточке модели):
- fp16 веса: ~140 ГБ
- fp8 веса: ~70 ГБ
- int4 веса: ~35 ГБ
KV кэш масштабируется с размером пакета и длиной последовательности. При размере пакета 32 и длине последовательности 2048 добавьте 8-12 ГБ поверх весов. При размере пакета 1 и длине последовательности 512 это менее 1 ГБ. Это переменная, которая кусает людей, когда они масштабируют обслуживание.
Активации добавляют 2-4 ГБ для вывода (нет градиентов для хранения).
Реалистичная установка обслуживания на RTX 4090 с fp8:
70 ГБ (fp8 веса)
+ 10 ГБ (KV кэш, bs=32, seq=2048)
+ 3 ГБ (активации)
+ 12 ГБ (накладные расходы фреймворка, контекст CUDA и т.д.)
= ~95 ГБ эффективное требование
Это соответствует цифре бенчмарка 95,5 ГБ. «96 ГБ доступно» на RTX 4090 включает выгрузку системной RAM через llama.cpp или ExLlamaV2, а не только 24 ГБ на карте.
Удвоение длины последовательности до 4096 добавляет примерно еще 8-12 ГБ к KV кэшу.
Вывод на нескольких GPU
Параллелизм тензоров разделяет матрицы весов на GPU. Каждый GPU обрабатывает срез каждого слоя и синхронизирует активации между слоями. Согласно спецификациям NVLink NVIDIA, пропускная способность H100 NVLink составляет 900 ГБ/сек против примерно 64 ГБ/сек для PCIe 4.0, разница в 14 раз. Этот разрыв имеет значение для вывода 70B, потому что синхронизация происходит на каждом слое трансформера (80 слоев в Llama 3.3 70B). На PCIe задержка между GPU становится узким местом. На NVLink это почти прозрачно.
| Установка | Всего VRAM, ГБ | Токенов/сек | Эффективность масштабирования |
|---|---|---|---|
| RTX 4090 x1 | 24 | 24.5 | базовая |
| RTX 4090 x2 | 48 | 48.5 | 99.0% |
| H100 x1 | 80 | 54.5 | базовая |
| H100 x2 | 160 | 108.2 | 99.3% |
Цифра RTX 4090 x2 предполагает NVLink или PCIe 5.0 с быстрым взаимосвязью. На потребительской материнской плате с слотами PCIe 4.0 x8 ожидайте на 10-20% более низкую эффективность масштабирования. Два H100 при 108,2 токена/сек действительно быстры для модели 70B.
Какой GPU мне купить для 70B?
RTX 5090 за $1,999 - явный победитель для локального вывода. 47,7 токена/сек, int4, 32 ГБ VRAM, использование 87,9%. Это первый потребительский GPU, который обрабатывает модели 70B без героических трюков с памятью. Создаете локальный сервер вывода или внутренний инструмент небольшой команды? Это ответ.
RTX 4090 за $1,600 все еще работает. 24,5 токена/сек в fp8 пригодны и карта широко доступна. Использование 99,5% неудобно; почти нет места для более длинных контекстов или больших пакетов. Рекомендуйте только если вы уже владеете одним или экономия $400 над RTX 5090 действительно имеет значение.
H100 за $40,000 - корпоративный стандарт. 54,5 токена/сек, NVLink для многогеографических установок, использование 62,9% с местом для производственных рабочих нагрузок пакетов. Математика стоимости за токен работает только в масштабе; вам нужна эта карта, работающая интенсивно, много часов в день.
L40S за $10,000 сложно оправдать для вывода LLM. 15,1 токена/сек при премии в цене в 6 раз над RTX 4090. Его сильные стороны в смешанных вычислениях/рендеринге, а не в генерации текста.
A100 примерно за $15,000 находится между L40S и H100 при 35,4 токена/сек. Разумно, если вы можете получить скидочное облачное время. Для новых закупок оборудования H100 - очевидный выбор.
Связанное на блоге GPUniq
Методология
Fit is computed by the GPUniq VRAM calculator at default inference settings — fp16 KV cache, 8k context, four concurrent users — counting weights, KV cache, activations and runtime overhead. 'Fits' means the model runs on one card without offloading at the precision shown.
Источники
- 1.GPUniq VRAM calculator — GPUniq (просмотрено )
Нужны недорогие GPU под ваш проект?
Живые цены на аренду GPU и нужная карта за пару кликов — H100, A100, RTX 4090 и ещё 50+ моделей. Оплата картой РФ или по счёту.
