Черновик подготовлен AI-инструментами и отредактирован человеком. Характеристики и выводы проверены редактором GPUniq.
TL;DR
Llama 3.3 70B требует 95,5 ГБ при fp8 и 56,3 ГБ при int4. Одна RTX 4090 (24 ГБ) не может запустить её ни при каком уровне квантизации. RTX 5090 (32 ГБ) достигает минимума int4 только как пара с NVLink (64 ГБ), выдавая 47,7 токен/сек при 87,9% использовании. Источник: данные бенчмарков GPUniq, 2026-09-21.
Поместится ли Llama 3.3 70B на RTX 4090?
Нет. Даже близко нет.
RTX 4090 имеет 24 ГБ VRAM. Int4 - самый сжатый практический вариант - требует 56,3 ГБ. Это более чем в два раза больше одной карты. Fp8 требует 95,5 ГБ, разрыв в 4 раза. Данные GPUniq показывают RTX 4090, запускающую Llama 3.3 70B при fp8 с 24,5 токен/сек, но это многокарточная конфигурация, где четыре 4090 вместе обеспечивают 96 ГБ. Одна карта сама по себе просто не подходит.
Ни один уровень квантизации не снижает требования модели ниже 24 ГБ.
RTX 4090 действительно отличная для меньших моделей. Llama 3.1 8B при fp16 занимает 21,4 ГБ с использованием 89,3% и 41,3 токен/сек на одной карте. Для 70B вы в неправильном весовом классе, и покупка четырёх 4090 для достижения 96 ГБ стоит дороже, чем одна A100 80GB.
VRAM по уровням квантизации
| Точность | Требуемый VRAM, ГБ | Поместится на одной RTX 4090 | Поместится на одной RTX 5090 |
|---|---|---|---|
| fp16 | ~140 | Нет | Нет |
| int8 | ~70 | Нет | Нет |
| fp8 | 95,5 | Нет | Нет |
| int4 | 56,3 | Нет | Нет |
RTX 5090 физически имеет 32 ГБ. Запуск GPUniq int4, показывающий 64 ГБ доступной памяти, - это конфигурация с двумя 5090 и NVLink. Одна 5090 всё ещё не может вместить int4 самостоятельно.
Для fp16 (~140 ГБ) нужны двойные A100 80GB или H100 NVL. Int8 (~70 ГБ) поместится на одной A100 80GB с запасом. Int4 при 56,3 ГБ поместится на одной A100 80GB при использовании 62,9% - вот где становится возможно развёртывание на одной карте.
Пропускная способность RTX 4090 vs RTX 5090
Из данных бенчмарков GPUniq (2026-09-21):
- RTX 4090 при fp8: 24,5 токен/сек, использование 99,5%
- RTX 5090 при int4: 47,7 токен/сек, использование 87,9%
На 95% больше пропускной способности на конфигурации 5090. Разница в использовании - вот настоящая история. При 99,5% конфигурация 4090 не имеет никакого запаса для батчинга, роста KV кэша или одновременных запросов. Одно длинное окно контекста и вы начнёте своппинг. RTX 5090 при 87,9% тесновато, но работоспособно для однопользовательского инференса.
Против H100: 47,7 vs 54,5 токен/сек, разрыв 12,6%. H100 также имеет 80 ГБ доступной памяти против 64 ГБ, работая при использовании 62,9% с местом для батчинга нескольких запросов одновременно. Этот кумулятивный эффект важнее, чем скорость на токен в масштабе production.
Компромисс скорость-память
Int4 выигрывает для весового класса 70B. Fp8 при 95,5 ГБ даёт 24,5 токен/сек на насыщенной памятью конфигурации 4090. Int4 при 56,3 ГБ даёт 47,7 токен/сек на конфигурации 5090. Это на 41% меньше памяти и примерно в два раза больше пропускной способности. Стоимость качества реальна, но хорошо изучена; для большинства чат-задач и следования инструкциям int4 приемлем.
Fp16 при ~140 ГБ предназначен для исследовательских рабочих процессов, требующих точной арифметики. Вы платите в 2,5 раза больше памяти, чем int4, за маргинальные улучшения качества в большинстве бенчмарков. Если вы не делаете fine-tuning или анализ активаций, fp16 на модели 70B сложно оправдать операционно.
H100 при int4 достигает 54,5 токен/сек с запасом памяти 45%. Это означает батчинг 4-6 одновременных запросов при оставлении под потолком, что полностью меняет экономику. Одна H100, обслуживающая батчированный int4 инференс, превзойдёт две RTX 5090, обслуживающие последовательные запросы.
Qwen2.5-72B vs Llama 3.3 70B
Qwen2.5-72B немного тяжелее во всех конфигурациях.
| GPU | Модель | Точность | Требуется, ГБ | Использование, % | Токен/сек |
|---|---|---|---|---|---|
| RTX 4090 (96 ГБ всего) | Llama 3.3 70B | fp8 | 95,5 | 99,5 | 24,5 |
| RTX 4090 (96 ГБ всего) | Qwen2.5-72B | int4 | 62,9 | 65,6 | 38,9 |
| RTX 5090 (64 ГБ всего) | Llama 3.3 70B | int4 | 56,3 | 87,9 | 47,7 |
| RTX 5090 (64 ГБ всего) | Qwen2.5-72B | int4 | 57,4 | 89,7 | 47,1 |
| H100 (80 ГБ) | Llama 3.3 70B | int4 | 50,3 | 62,9 | 54,5 |
| H100 (80 ГБ) | Qwen2.5-72B | int4 | 51,1 | 63,9 | 53,8 |
Qwen2.5-72B int4 требует 62,9 ГБ против 56,3 ГБ Llama 3.3 70B, разница 6,6 ГБ. На конфигурации 5090 это поднимает использование до 89,7% vs 87,9% - достаточно близко, чтобы это не изменило ваше решение по оборудованию. На H100 разница незначительна.
Интересна строка с RTX 4090. Qwen2.5-72B работает int4 там при использовании 65,6% и 38,9 токен/сек, лучше, чем 24,5 Llama 3.3 70B на той же платформе. Меньшее использование означает больше запаса, что напрямую переводится в пропускную способность. Карточка модели Qwen2.5 от Alibaba отмечает более плотные паттерны внимания, что может объяснить немного более высокий объём памяти несмотря на преимущество в скорости.
Минимальный GPU для инференса 70B
Одна потребительская карта: ничего. Ни одна потребительская карта не вмещает 56,3 ГБ.
Минимум многокарточной потребительской конфигурации: две RTX 5090 (64 ГБ вместе) при int4, 47,7 токен/сек. Использование тесновато и запас для батчинга минимален.
Минимум одной карты enterprise: A100 40GB не может вместить 56,3 ГБ. Вам нужна A100 80GB, которая работает int4 при требуемых 50,3 ГБ, использовании 62,9%, примерно 35,4 токен/сек. Это медленнее, чем конфигурация с двумя 5090, потому что пропускная способность памяти A100 ниже, чем у H100, несмотря на равную ёмкость.
Производственный стандарт: H100 80GB при int4, 54,5 токен/сек, использование 62,9%, достаточно запаса для батчинга запросов и обработки длинных контекстов без своппинга.
RTX 4090 с CPU offloading через --n-gpu-layers partial offload llama.cpp технически возможен. Ожидайте 2-5 токен/сек с интенсивным PCIe thrashing. Это демо, не развёртывание.
Матрица сравнения GPU
Данные бенчмарков GPUniq (2026-09-21), инференс Llama 3.3 70B, однопоточная генерация:
| GPU | VRAM, ГБ | Лучшая точность | Требуется, ГБ | Использование, % | Токен/сек |
|---|---|---|---|---|---|
| RTX 4090 | 24 (x4) | fp8 | 95,5 | 99,5 | 24,5 |
| RTX 5090 | 32 (x2) | int4 | 56,3 | 87,9 | 47,7 |
| L40S | 48 | fp8 | 90,3 | 94,0 | 15,1 |
| RTX 6000 Ada | 48 | fp8 | 90,3 | 94,0 | 16,7 |
| A100 | 80 | int4 | 50,3 | 62,9 | 35,4 |
| H100 | 80 | int4 | 50,3 | 62,9 | 54,5 |
Цифры L40S и RTX 6000 Ada меня удивили. Обе имеют 48 ГБ, что звучит как полезный запас, но они застревают на fp8 через несколько карт и производят только 15,1 и 16,7 токен/сек - хуже, чем четырёхкарточная конфигурация 4090. Пропускная способность памяти - это ограничение: ни одна карта не оптимизирована для паттерна высокопропускного доступа, который требует модель 70B. HBM3 память H100 - вот почему она выдаёт 54,5 токен/сек на тех же весах int4, которые дают A100 только 35,4.
Если вы выбираете между L40S и A100 80GB для инференса 70B, возьмите A100 несмотря на то, что это более старое оборудование.
Как использовать этот калькулятор
Работайте в обратном направлении от общего доступного VRAM. Ниже 56,3 ГБ вместе int4 невозможен. Ниже 95,5 ГБ fp8 также невозможен на этой конфигурации.
Требуемый VRAM (ГБ) = model_params * bytes_per_param * overhead_factor
fp16: 70B * 2 bytes * 1.2 = ~168 ГБ (примерно; измерено ~140 ГБ)
int8: 70B * 1 byte * 1.2 = ~84 ГБ (измерено ~70 ГБ)
fp8: 70B * 1 byte * 1.1 = ~77 ГБ (измерено 95,5 ГБ с KV кэшем)
int4: 70B * 0.5 byte * 1.2 = ~42 ГБ (измерено 56,3 ГБ с KV кэшем)
Измеренные значения превышают наивную формулу, потому что KV кэш, активации и оверхед фреймворка добавляют 10-30% сверху хранилища весов. Цифры GPUniq включают реалистичный KV кэш для окна контекста 2048 токенов.
Для использования интерактивного калькулятора:
- Выберите ваш GPU из выпадающего списка: RTX 4090, RTX 5090, H100, A100, L40S или RTX 6000 Ada.
- Выберите модель: Llama 3.3 70B, Qwen2.5-72B, Llama 3.1 8B или DeepSeek-V3 671B.
- Выберите квантизацию. Калькулятор отмечает конфигурации, где требуемый ГБ превышает доступный ГБ.
- Проверьте использование. Выше 90% означает отсутствие практического запаса для батчинга. Ниже 70% комфортно для production.
Цифры токен/сек получены из однопоточной генерации с 512-токенным промптом и 256-токенным выводом. Батчированный инференс покажет более высокую пропускную способность на токен, но более высокую задержку на запрос.
Методология
Fit is computed by the GPUniq VRAM calculator at default inference settings — fp16 KV cache, 8k context, four concurrent users — counting weights, KV cache, activations and runtime overhead. 'Fits' means the model runs on one card without offloading at the precision shown.
Источники
- 1.GPUniq VRAM calculator — GPUniq (просмотрено )
Want cheap GPUs for your next project?
Browse live GPU prices and rent the right card in seconds — H100, A100, RTX 4090, and 50+ more models.
