Наивная формула «веса + KV < VRAM» промахивается по двум причинам, и обе стоят денег. Первая: движок (vLLM, SGLang, TensorRT-LLM) резервирует почти всю память под свой пул ещё до того, как вы посчитали KV — поэтому ответ «сколько запросов влезет» всегда мимо, в сторону «влезет», а потом OOM под…
Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же
Это краткое изложение. Полный текст материала доступен на сайте источника.