LlmOps-DevOps
Summary
Deploy and operate LLM/generative models in production at cloud.ru. Picks inference engines (vLLM, TensorRT-LLM, Triton, TGI), tunes parallelism, batching, KV cache and quantization, manages GPU/CUDA workloads on Kubernetes, and monitors latency and throughput.
Обязанности:
-
Готовить LLM и другие генеративные модели к промышленному запуску;
-
Выбирать inference-движок с учетом архитектуры модели, оборудования и требований продукта;
-
Создавать воспроизводимые контейнерные образы и конфигурации model serving;
-
Настраивать tensor parallelism, pipeline parallelism, batching, KV cache, длину контекста и управление памятью;
-
Подбирать методы квантизации и оптимизации с контролем влияния на качество модели;
-
Определять оптимальное количество и тип GPU для целевых latency, throughput и нагрузки;
-
Проводить профилирование, функциональные и нагрузочные тесты моделей;
-
Находить узкие места на уровне модели, inference-движка, CUDA, GPU, сети и хранилища;
-
Автоматизировать развертывание, обновление, откат и масштабирование моделей в Kubernetes;
-
Настраивать метрики, логи и трассировку model-serving-сервисов;
-
Формировать эталонные конфигурации и таблицы производительности поддерживаемых моделей;
-
Контролировать потребление GPU, утилизацию памяти и стоимость inference;
-
Участвовать в настройке маршрутизации, балансировки и отказоустойчивости сервисов моделей;
-
Адаптировать конфигурации моделей для облачной и on-premise-инфраструктуры;
-
Оценивать новые модели, inference-фреймворки, методы оптимизации и аппаратные платформы;
-
Консультировать продуктовые команды по возможностям, ограничениям и инфраструктурным требованиям моделей;
-
Взаимодействовать с командами разработки моделей, DevOps/SRE, Agents Space и частных инсталляций.
Требования:
-
Практический опыт запуска LLM или других крупных генеративных моделей в production либо на высоконагруженных стендах;
-
Хорошее понимание архитектуры Transformer и жизненного цикла inference-запроса;
-
Опыт работы хотя бы с одним современным inference-движком: vLLM, NVIDIA TensorRT-LLM, Triton Inference Server, Hugging Face TGI или аналогичным;
-
Понимание tensor/pipeline parallelism, continuous batching, KV cache и методов управления памятью;
-
Знание методов квантизации и их влияния на качество и производительность;
-
Практический опыт работы с GPU, CUDA и инструментами диагностики;
-
Уверенное владение Python;
-
Опыт контейнеризации с Docker и развертывания сервисов в Kubernetes;
-
Опыт проведения нагрузочных тестов и анализа latency, throughput, time to first token и inter-token latency;
-
Опыт настройки мониторинга и профилирования inference-сервисов;
-
Знание Linux, Git и основных принципов CI/CD;
-
Умение документировать эксперименты и принимать решения на основании измеримых результатов.
## Будет преимуществом
- Опыт работы с NVIDIA GPU Operator, DCGM, MIG, NCCL и multi-node inference;
- Знание PyTorch и Hugging Face Transformers;
- Опыт оптимизации моделей с помощью TensorRT, ONNX или custom kernels;
- Опыт работы с Ray Serve, KServe, Seldon или аналогичными системами;
- Понимание особенностей MoE-моделей, speculative decoding и prefix caching;
- Опыт построения автоматизированного контура оценки качества LLM;
- Опыт эксплуатации моделей в on-premise или изолированных средах;
- Опыт расчета и оптимизации unit-экономики inference.