Что это значит
Проблема здесь не в том, что несколько сайтов ошиблись в формуле. Проблема в самой привычке считать инфраструктуру по статичной таблице: веса модели плюс KV-кэш, а дальше - сколько-то запросов. В реальном контент-заводе модель живёт внутри конкретного движка, с его пулом памяти, квантованием, настройками параллелизма и особенностями архитектуры. Поэтому цифра «влезет» без проверки под нагрузкой ничего не гарантирует.
Для тебя это означает простую вещь: выбор модели нельзя отделять от сценария производства. Если ты строишь поток расшифровки, нарезки, генерации описаний или массовой переупаковки, важна не только стоимость одного ответа, но и стабильность при одновременных задачах. Ошибка в оценке VRAM превращается либо в падение конвейера в пиковый момент, либо в лишние расходы на более мощную машину.
Что делать уже сейчас: считай не «модель на видеокарте», а связку «модель - движок - длина контекста - число одновременных запросов». Проверяй расчёт на живом vLLM или другом выбранном сервере, закладывай резерв памяти и прогоняй тест именно с твоей нагрузкой. Отдельно проверяй архитектуры вроде MoE: стандартная формула может завысить расход настолько, что ты вычеркнешь рабочий вариант ещё до первого эксперимента.





