LLM Deployment & Inference·SEPTEMBER 22, 2026
Калькулятор VRAM для Llama 3.3 70B
TL;DR Llama 3.3 70B требует 95,5 ГБ при fp8 и 56,3 ГБ при int4. Одна RTX 4090 (24 ГБ) не может запустить её ни при каком уровне квантизации. RTX 5090 (32 ГБ) достигает минимума int4 только как пара с NVLink (64 ГБ), выдавая 47,7 токен/сек при 87,9% использовании.