DevOps / MLOps Engineer (LLM Infrastructure)
Summary
DevOps/MLOps engineer owning the LLM infrastructure layer of a B2B autonomous AI-agents platform built for the US market. Handles cloud/Kubernetes deployment, CI-CD and GitOps, GPU inference, observability, access management, and production reliability of managed and self-hosted LLM services.
Зарплата: от 120000 RUR (до вычета налогов)
О продукте и роли
Мы создаём B2B-платформу автономных ИИ-агентов для рынка США и ищем инженера, который возьмёт на себя инфраструктурный контур LLM-платформы: стабильное и безопасное развёртывание, масштабирование, наблюдаемость и стоимость AI-сервисов. Разработка ML-моделей и исследовательские эксперименты не являются ядром роли.
Что предстоит делать
Обслуживать облачную инфраструктуру компании. Поддерживать виртуальные машины, кластеры, сети и хранилища у облачных провайдеров: обновления и патчи, управление образами и конфигурациями, резервное копирование и проверка восстановления, контроль расходов на облако, планирование ресурсов под рост нагрузки.
Сопровождать инфраструктуру на стороне клиентов. Разворачивать и поддерживать сервисы в контуре заказчика: согласование доступов и регламентов, удалённая диагностика, обновления без простоя, мониторинг состояния, техническая документация для команды клиента.
Администрировать рабочие среды команды. Поддерживать защищённый удалённый доступ к средам разработки и внутренним сервисам, единые конфигурации и политики, защиту рабочих данных и централизованный контроль состояния.
Вести учётные записи и доступы. Поддерживать единую точку входа и многофакторную аутентификацию, управлять ролями и группами по принципу минимальных привилегий, выдавать и вовремя отзывать доступы к репозиториям, облакам, базам данных и внутренним сервисам, регулярно пересматривать права, вести реестр и журналирование, закрывать все доступы сотрудника в день увольнения.
Автоматизировать поставку сервисов и моделей. Строить CI/CD и GitOps-процессы, управлять инфраструктурой как кодом, обеспечивать воспроизводимые релизы, canary- и blue-green-развёртывания, rollback и disaster recovery. Давать разработчикам единый способ запускать, тестировать и выпускать LLM- и агентные сервисы без ручной настройки инфраструктуры.
Эксплуатировать LLM-сервисы. Поддерживать интеграции с managed-моделями и, при необходимости, inference-сервисы для open-source моделей. Настраивать маршрутизацию запросов, квоты, rate limits, retry, fallback и безопасное переключение между моделями и провайдерами.
Обеспечивать производительность и экономику inference. Контролировать latency, throughput, доступность, использование токенов и стоимость. Для self-hosted моделей — управлять GPU-ресурсами, планированием нагрузки, autoscaling, batching и кэшированием.
Строить наблюдаемость LLM-платформы. Метрики, логи и распределённая трассировка запросов; мониторинг версий моделей и конфигураций, ошибок провайдеров, расхода токенов и деградации производительности. Настраивать алерты и понятные дашборды для инженерной команды.
Обеспечивать надёжность и безопасность. Участвовать в on-call, расследовать инциденты, проводить RCA и postmortem, создавать runbooks и устранять системные причины повторных сбоев. Управлять секретами, настраивать сетевую изоляцию, шифрование, аудит действий и безопасную работу с пользовательскими данными.
Обязательные требования
- 3+ лет опыта в DevOps/MLOps и практический опыт развёртывания или поддержки LLM- или GenAI-сервисов.
- Опыт работы в крупной компании или с высоконагруженными промышленными системами: сможете описать масштаб, собственную зону ответственности, инциденты и принятые архитектурные решения.
- Администрирование Linux в облачной среде: образы, конфигурации, обновления без простоя, резервное копирование и проверенное восстановление.
- Уверенная эксплуатация Kubernetes в production: Helm, управление ресурсами, autoscaling, persistent storage, networking и безопасные обновления.
- Практический опыт CI/CD и GitOps, infrastructure as code и автоматизации: GitLab CI, GitHub Actions или аналоги; Argo CD; Terraform и Ansible или сопоставимые инструменты.
- Практический опыт одного или обоих контуров LLM-инфраструктуры: эксплуатация managed LLM API с маршрутизацией, квотами, retry и fallback; развёртывание open-source моделей через vLLM, TGI, Triton, Ollama или аналоги.
- Наблюдаемость production-систем: метрики, логи, трассировка, алерты; контроль доступности, latency, throughput, ошибок и стоимости LLM-запросов.
- Опыт обеспечения надёжности: on-call, расследование инцидентов, RCA и runbooks.
- Управление доступами: SSO и провайдер идентификации (Google Workspace, Entra ID, Keycloak, Okta или аналоги), MFA, RBAC, отлаженные процессы onboarding и offboarding.
- Организация защищённого удалённого доступа: VPN или Zero Trust, бастион-хосты, управление ключами и сертификатами.
- Готовность к сервисным задачам: поддержка коллег и клиентов, работа по заявкам, соблюдение сроков реакции.
- Python и Bash на уровне автоматизации инфраструктуры и диагностики production-сервисов.
- Английский B1 или выше: чтение документации и рабочее взаимодействие с техническими командами.
Будет преимуществом
- Эксплуатация GPU-кластеров: NVIDIA GPU Operator или device plugin, квоты, scheduling, autoscaling, мониторинг загрузки и capacity planning.
- Оптимизация inference: batching, caching, quantization, управление latency, throughput и стоимостью.
- RAG-инфраструктура, векторные хранилища и пайплайны данных: pgvector, Qdrant, Milvus, S3 или аналоги.
- Langfuse, LangSmith, Arize Phoenix или другие инструменты трассировки и наблюдаемости LLM-приложений.
- MLflow, Kubeflow, Ray, KServe или другие компоненты жизненного цикла и serving ML-моделей.
- Опыт развёртывания решений в инфраструктуре корпоративных клиентов или в регулируемой среде.
- Построение процессов управления доступом с нуля: регламенты, реестр, регулярный пересмотр прав.
- Управление стоимостью облака: тегирование ресурсов, бюджеты, оптимизация потребления.
- Прохождение аудита безопасности или соответствия требованиям заказчика (SOC 2, ISO 27001 или аналог).
Условия
- Полная занятость, работа в офисе (Москва), возможна удаленка.
- Возможность определять инфраструктурные стандарты LLM-платформы с ранней стадии.
- Высокая самостоятельность в выборе инженерных решений; оценка по надёжности, скорости выпуска и стоимости эксплуатации.
- Сложные задачи на стыке DevOps, MLOps, облачной инфраструктуры и production AI.
Как откликнуться
Вместо стандартного сопроводительного письма:
- Расскажите об одном LLM- или GenAI-сервисе, который вы лично довели до production или поддерживали после запуска: для кого он был создан, как был устроен, каков был масштаб и за что отвечали лично вы.
- Опишите самый сложный инфраструктурный инцидент в этом проекте: как он проявился, как вы нашли причину, что изменили и как проверили результат.
- Расскажите, какое первоначальное решение в этом проекте не сработало, почему и чем вы его заменили. Если возможно, приложите подтверждающие материалы: GitHub, архитектурную схему, техническую статью или публичный разбор.
Отклики из общих формулировок без конкретного production-опыта не рассматриваются.