MLOps-инженер
Summary
MLOps engineer deploying and operating ML/LLM models in production on Kubernetes (CPU/GPU). Owns the full lifecycle — inference engines (vLLM, Triton, BentoML), CI/CD and GitOps, RAG pipelines with vector DBs, monitoring/observability, and MLSecOps practices.
Вам предстоит заниматься:
- Вывод ML/LLM-моделей в промышленную эксплуатацию: упаковка, деплой и сопровождение инференс-движков (vLLM, Triton Inference Server, BentoML) на Kubernetes (CPU/GPU);
- развитие и поддержка ML-инфраструктуры на базе Kubernetes: GPU-ноды, Helm, автоскейлинг, маршрутизация трафика, управление ресурсами;
- автоматизация жизненного цикла модели: CI/CD для ML-пайплайнов, сборка образов, публикация артефактов, канареечные релизы, A/B-тесты и откаты;
- эксплуатация RAG-пайплайнов и векторных баз данных (Qdrant, Milvus, pgvector), их мониторинг и оптимизация;
- развитие мониторинга ML-систем: Prometheus + Grafana, метрики сервинга, качество моделей, дрейф данных и деградация поведения моделей;
- трекинг экспериментов и Model Registry (MLflow / ClearML), версионирование кода, данных и моделей, обеспечение воспроизводимости ML-процессов;
- внедрение практик MLSecOps: LLM Guardrails, OWASP Top 10 for LLM, подпись моделей, контроль доступа к registry, детекция аномалий;
- сканирование уязвимостей (Trivy, SAST/DAST/SCA, tfsec/checkov), управление секретами (HashiCorp Vault), настройка сетевых политик;
- оптимизация использования вычислительных ресурсов (GPU) с учетом надежности, производительности и стоимости (FinOps);
- обеспечение SLA/SLO, реагирование на инциденты, участие в post-mortem, подготовка технической документации.
- Образование: Высшее техническое образование
- Опыт работы: 2-4 года, из них опыт эксплуатации ML/LLM-инфраструктуры — от 1 года
- Уверенный Python (ООП, типизация, асинхронность) и Bash, администрирование Linux;
- Docker (multistage build) и Kubernetes (Helm, HPA, ingress, storage, observability), GPU-инфраструктура (драйверы, CUDA Toolkit, MIG, nvidia-container-toolkit);
- инференс-движки: vLLM, Triton Inference Server, BentoML или аналогичные решения;
- CI/CD: GitLab CI / GitHub Actions, GitOps (ArgoCD), IaC (Terraform, Ansible);
- мониторинг: Prometheus, Grafana, LangFuse, алертинг, диагностика инцидентов;
- трекинг экспериментов и Model Registry: MLflow / ClearML;
- RAG: векторные базы данных (Qdrant, Milvus, pgvector), LangChain / LlamaIndex;
- безопасность ML: LLM Guardrails, OWASP Top 10 for LLM, HashiCorp Vault, Trivy, подпись моделей.
Мы предлагаем:
- дополнительные дни к основному оплачиваемому отпуску;
- доплата по больничному листу;
- ДМС, включая стоматологию (после испытательного срока);
- социальная поддержка от компании;
- частичная компенсация обедов;
- корпоративные скидки на изучение английского языка и занятия фитнесом.
Условия:
- трудоустройство в соответствии с ТК РФ;
- График работы: 5/2 (9:30-18:00);
- Гибридный формат;
- место работы: Комфортабельный офис в Башне Меркурий, Москва-Сити.