Когда LLM помещается на одной GPU и получает несколько запросов в минуту, настройка движка инференса обычно заканчивается на выборе модели и типа данных. Проблемы начинаются дальше: модель перестает помещаться в память, растет очередь запросов, длинные промпты съедают KV-кэш, а GPU простаивают в…
SGLang без магии: как устроены основные настройки инференса LLM
Это краткое изложение. Полный текст материала доступен на сайте источника.