Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной…
Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями
Это краткое изложение. Полный текст материала доступен на сайте источника.