LLM Deployment & Inference·OCTOBER 6, 2026
Запуск моделей 70B: подгонка GPU и скорость
TL;DR Llama 3.3 70B помещается на одном RTX 4090 (24 ГБ) с использованием квантизации fp8, требуя 95,5 ГБ эффективной памяти на GPU и системной RAM, и обеспечивает 24,5 токена/сек. На H100 (80 ГБ) с int4 достигает 54,5 токена/сек при использовании 62,9% VRAM. RTX 5090 за $1,999...